# fluidaudio | Fluid Inference | Knowledge Base | Instagit

Frontier CoreML audio models in your apps — text-to-speech, speech-to-text, voice activity detection, and speaker diarization. In Swift, powered by SOTA open source. 

GitHub Stars: 1.6k

Repository: https://github.com/fluidinference/fluidaudio

---

## Articles

### [Streaming vs Offline VAD Processing in FluidAudio: Architecture and Implementation Guide](/fluidinference/fluidaudio/what-is-the-difference-between-streaming-and-offline-vad-processing)

Understand streaming vs offline VAD processing in FluidAudio. Explore architecture and implementation for real-time or batch VAD with this technical guide.

- Tags: architecture
- Published: 2026-03-02

### [How FluidAudio Handles Audio Format Conversion for Inference](/fluidinference/fluidaudio/how-does-fluidaudio-handle-audio-format-conversion-for-inference)

FluidAudio ensures consistent model-ready audio data for inference by normalizing all inputs to 16 kHz mono Float32 using its AudioConverter class. Learn how it works.

- Tags: how-to-guide
- Published: 2026-03-02

### [How to Implement Speaker Identification with Known Speaker Embeddings in FluidAudio](/fluidinference/fluidaudio/how-do-i-implement-speaker-identification-with-known-speaker-embeddings)

Implement speaker identification with known speaker embeddings using FluidAudio. Learn how the SpeakerManager class efficiently matches vectors with cosine distance and EMA updates.

- Tags: how-to-guide
- Published: 2026-03-02

### [Limitations of Sortformer for Speaker Diarization: Constraints and Workarounds](/fluidinference/fluidaudio/what-are-the-limitations-of-sortformer-for-speaker-diarization)

Explore the limitations of Sortformer for speaker diarization including fixed speaker slots and cross-session identity issues. Learn about workarounds for large conferences.

- Tags: deep-dive
- Published: 2026-03-02

### [How FluidAudio Handles Model Downloads and Caching](/fluidinference/fluidaudio/how-does-fluidaudio-handle-model-downloads-and-caching)

Discover how FluidAudio manages model downloads and caching with its centralized subsystem. Learn how it fetches, caches, and verifies Core ML models for efficient use.

- Tags: internals
- Published: 2026-03-02

### [How to Customize VAD Thresholds for Different Audio Environments in FluidAudio](/fluidinference/fluidaudio/how-do-i-customize-vad-thresholds-for-different-audio-environments)

Customize VAD thresholds in FluidAudio for any audio environment. Adjust defaultThreshold and VadSegmentationConfig for precise voice activity detection and segmentation.

- Tags: how-to-guide
- Published: 2026-03-02

### [FluidAudio Offline Diarization Pipeline Architecture: Core ML Segmentation and VBx Clustering in Swift](/fluidinference/fluidaudio/what-is-the-architecture-of-the-offline-diarization-pipeline)

Explore the FluidAudio offline diarization pipeline architecture. Discover how Core ML models, Swift concurrency, and VBx clustering create on-device speaker segmentation for your audio projects.

- Tags: architecture
- Published: 2026-03-02

### [How to Handle the Last Chunk in Streaming ASR Processing in FluidAudio](/fluidinference/fluidaudio/how-do-i-handle-the-last-chunk-in-streaming-asr-processing)

Learn how to handle the last chunk in streaming ASR processing by setting the isLastChunk flag to true in FluidAudio. Trigger final decoding and emit all pending tokens.

- Tags: how-to-guide
- Published: 2026-03-02

### [Thread Safety Guarantees in FluidAudio Managers: Swift Actor Implementation Explained](/fluidinference/fluidaudio/what-are-the-thread-safety-guarantees-when-using-fluidaudio-managers)

Discover FluidAudio manager thread safety guarantees. Swift actors eliminate data races by serializing access to mutable state. Learn more about this compiler-enforced protection.

- Tags: internals
- Published: 2026-03-02

### [How Context Biasing Improves ASR Accuracy for Domain-Specific Terms in FluidAudio](/fluidinference/fluidaudio/how-does-context-biasing-improve-asr-accuracy-for-domain-specific-terms)

Enhance ASR accuracy for domain-specific terms with context biasing in FluidAudio. Learn how this technique boosts recognition by weighting rare words during CTC decoding.

- Tags: deep-dive
- Published: 2026-03-02

### [How to Debug Diarization Issues with Speaker Embedding Validation in FluidAudio](/fluidinference/fluidaudio/how-do-i-debug-diarization-issues-with-speaker-embedding-validation)

Debug diarization issues in FluidAudio by validating speaker embeddings. Enable debug logging and check embedding magnitudes for common errors. Resolve inconsistencies and improve speaker recognition accuracy.

- Tags: how-to-guide
- Published: 2026-03-02

### [FluidAudio Performance Metrics: ASR Timing and Diarization Quality Explained](/fluidinference/fluidaudio/what-performance-metrics-does-fluidaudio-expose-and-how-are-they-calculated)

Understand FluidAudio performance metrics including ASR timing and diarization quality. Learn how FluidAudio's PerformanceMonitor and DiarizationMetricsCalculator measure real-time factors memory usage and error rates.

- Tags: performance
- Published: 2026-03-02

### [How Inverse Text Normalization (ITN) Works in FluidAudio: A Deep Dive into the Swift-NeMo Integration](/fluidinference/fluidaudio/how-does-inverse-text-normalization-itn-work-in-fluidaudio)

Discover how FluidAudio leverages Swift and NeMo for advanced inverse text normalization ITN. Experience context-aware text transformation and word disambiguation with NLTagger.

- Tags: deep-dive
- Published: 2026-03-02

### [FluidAudio vs FluidAudioTTS: Understanding the Difference Between the Core SDK and Advanced TTS Add-On](/fluidinference/fluidaudio/what-is-the-difference-between-fluidaudio-and-fluidaudiotts-products)

Explore the differences between FluidAudio core SDK and the FluidAudioTTS add-on. Understand features like on-device ASR, VAD, PocketTTS vs. Kokoro TTS. Choose the right solution for your needs.

- Tags: deep-dive
- Published: 2026-03-02

### [How to Implement Real-Time Transcription with Streaming ASR in FluidAudio](/fluidinference/fluidaudio/how-do-i-implement-real-time-transcription-with-streaming-asr)

Implement real-time transcription using FluidAudio's StreamingAsrManager. Get incremental, time-stamped transcriptions from live audio with built-in resampling and error recovery.

- Tags: how-to-guide
- Published: 2026-03-02

### [Multi-Speaker Diarization with Overlapping Speech: Best Practices in FluidAudio](/fluidinference/fluidaudio/what-are-the-best-practices-for-handling-multi-speaker-diarization-with-overlapping-speech)

Master multi-speaker diarization with overlapping speech. FluidAudio offers best practices for accurate speaker separation even with complex audio. Learn how.

- Tags: best-practices
- Published: 2026-03-02

### [How Streaming VAD Handles Speech Segmentation in FluidAudio](/fluidinference/fluidaudio/how-does-streaming-vad-handle-speech-segmentation)

Learn how FluidAudio's streaming VAD segments speech using state machines hysteresis and silence detection for accurate real-time audio processing.

- Tags: deep-dive
- Published: 2026-03-02

### [How to Set Up Model Registry URL Override in FluidAudio for Offline Mirrors](/fluidinference/fluidaudio/how-do-i-set-up-model-registry-url-override-for-offline-mirrors)

Set up model registry URL override in FluidAudio for offline mirrors by exporting REGISTRY_URL or setting ModelRegistry.baseURL programmatically. Redirect model downloads to your internal mirror.

- Tags: how-to-guide
- Published: 2026-03-02

### [How the ANE Memory Optimizer Works in FluidAudio: A Deep Dive into Apple Neural Engine Optimization](/fluidinference/fluidaudio/how-does-the-ane-memory-optimizer-work-in-fluidaudio)

Discover how FluidAudio's ANE memory optimizer boosts Apple Neural Engine throughput via 64-byte alignment, buffer pooling, and zero-copy data movement on Apple Silicon.

- Tags: deep-dive
- Published: 2026-03-02

### [How to Integrate Custom Vocabulary and Word Spotting into ASR Using FluidAudio](/fluidinference/fluidaudio/how-do-i-integrate-custom-vocabulary-word-spotting-into-asr)

Integrate custom vocabulary and word spotting into ASR with FluidAudio. Use our dual-encoder CTC pipeline to boost domain-specific terms without retraining the base ASR model.

- Tags: how-to-guide
- Published: 2026-03-02

### [How Sortformer Compares to Pyannote for Speaker Diarization in FluidAudio](/fluidinference/fluidaudio/how-does-sortformer-compare-to-pyannote-for-speaker-diarization)

Compare Sortformer vs Pyannote for speaker diarization in FluidAudio. Discover Sortformer's ultra-low latency streaming and Pyannote's flexible offline capabilities for your audio needs.

- Tags: deep-dive
- Published: 2026-03-02

### [How to Configure the Offline Diarization Pipeline with VBx Clustering in FluidAudio](/fluidinference/fluidaudio/how-do-i-configure-the-offline-diarization-pipeline-with-vbx-clustering)

Learn to configure the offline diarization pipeline with VBx clustering in FluidAudio. Set custom thresholds and warm-start parameters for efficient speaker diarization.

- Tags: how-to-guide
- Published: 2026-03-02

### [Parakeet TDT v2 vs v3 ASR Models: Key Differences in FluidAudio](/fluidinference/fluidaudio/what-is-the-difference-between-parakeet-tdt-v2-and-v3-asr-models)

Discover the key differences between Parakeet TDT v2 and v3 ASR models in FluidAudio. Learn about multilingual support, blank token IDs, and decoder architecture to choose the right model.

- Tags: deep-dive
- Published: 2026-03-02

### [How FluidAudio Handles Streaming vs Batch Processing for ASR: Architecture and Implementation](/fluidinference/fluidaudio/how-does-fluidaudio-handle-streaming-vs-batch-processing-for-asr)

FluidAudio intelligently routes ASR requests to streaming or batch processing using configurable thresholds. Discover its runtime architecture and implementation details.

- Tags: architecture
- Published: 2026-03-02

