CLI-Tool
FluidInference/FluidAudio avatar
FluidInference/FluidAudio

FluidAudio: Sprachverarbeitung auf Apple-Geräten

FluidInference/FluidAudio bietet eine praxistaugliche Open-Source-Implementierung mit stabiler Einsatzbarkeit für reale Anwendungsfälle.

2.762 Sterne415 ForksSwiftApache-2.0

Auf einen Blick

Was ist das?
Lokale Spracherkennung, Sprachsynthese, Sprachaktivitätserkennung und Sprecherdiarisierung mit CoreML-Modellen auf der Apple Neural Engine.
Für wen ist es gedacht?
FluidAudio verpackt konvertierte CoreML-Versionen von Open-Source-Audiomodellen für Apple-Geräte mit ANE-Inferenz, Offline-Modellladen und CLI-Werkzeugen. Das README nennt nur für ASR einen Echtzeitfaktor; alle weiteren Leistungsangaben müssen gegen das Dokument Benchmarks.md geprüft werden.
Darf ich es kommerziell nutzen?
Ja. Apache-2.0 ist eine freizügige Lizenz: Sie dürfen darauf aufbauende Software nutzen, verändern und verkaufen, solange Sie die Urheberrechts- und Lizenzhinweise beibehalten.
Wird es noch gepflegt?
Ja. Die letzten Commits kamen vor 1 Tag.
In welcher Sprache ist es geschrieben?
Hauptsächlich Swift, laut der Sprachstatistik von GitHub.

Die Antworten beruhen auf den GitHub-Daten des Projekts (zuletzt abgeglichen am 14. September 2026) und auf unserer Analyse. Sie sind keine Rechtsberatung.

TIEFGEHENDE OPEN-SOURCE-ANALYSE

Ein Swift SDK für Audio-KI auf dem Gerät

FluidAudio ist ein Swift SDK für Audio-KI, das vollständig lokal auf Apple-Geräten läuft. Das README beschreibt vollständig lokale Inferenz mit niedriger Latenz, wobei die Berechnung auf die Apple Neural Engine (ANE) ausgelagert wird, was laut Projekt weniger Speicherverbrauch und in der Regel schnellere Inferenz bedeutet. Das SDK verzichtet vollständig auf GPU und MPS und hält die CPU-Auslastung niedrig, was das README mit Hintergrundverarbeitung, Ambient Computing und Dauerbetrieb verbindet. Die Repository-Metadaten führen Swift als Hauptsprache; das README richtet sich an macOS und iOS. Eine Mindestversion des Betriebssystems oder eine Liste unterstützter Apple-Chips nennt es nicht, diese Punkte bleiben offene Prüffragen, und konkrete Messwerte zu Akku oder Speicher fehlen ebenfalls.

Was der Modellkatalog abdeckt

Das README gruppiert die Fähigkeiten des SDK in fünf Aufgaben: automatische Spracherkennung, inverse Textnormalisierung, Sprachsynthese, Sprecherdiarisierung und Sprachaktivitätserkennung. Zu den ASR-Modellen gehören Parakeet TDT v3 (0.6b) für die Batch-Transkription in 25 europäischen Sprachen und Japanisch, SenseVoice und Paraformer für Mandarin-Chinesisch sowie Parakeet EOU (120m) für Streaming-ASR mit Erkennung des Äußerungsendes auf Englisch. Für die VAD werden Silero-Modelle verwendet; das README erwähnt außerdem die Extraktion von Sprecher-Embeddings. Alle Modelle wurden vom FluidInference-Team konvertiert und optimiert und stehen unter freizügigen Lizenzen auf HuggingFace. Der Katalog wird in diesem Dokument nicht vollständig aufgelistet, sondern auf Models.md verwiesen. Das README nennt für ASR einen Echtzeitfaktor von etwa 190x, also eine Stunde Audio in etwa 19 Sekunden auf einem M4 Pro.

Drei Wege zur Sprecherdiarisierung

Die Diarisierung wird im README am ausführlichsten behandelt. Die Standardwahl für Online-Betrieb ist LS-EEND, ein einzelnes End-to-End-Modell, das bis zu 10 Sprecher unterstützt, mit 100-Millisekunden-Frame-Updates und einer 900-Millisekunden vorläufigen Vorschau. Sortformer ist die zweite Streaming-Option, auf 4 Sprecher begrenzt und mit besserer Stabilität der Sprecheridentität beschrieben; die Lizenz ist die NVIDIA Open Model License. Für Offline-Batch-Verarbeitung beschreibt das README eine Pyannote-Community-1-Pipeline mit Powerset-Segmentierung, WeSpeaker-Embeddings und VBx-Clustering, die JSON mit DER, JER und RTFx ausgibt. Eine separate Pyannote-3.1-Pipeline ist die dritte Wahl für Online-Betrieb und wird wegen ihrer modularen Segmentierungs- und Embedding-Stufen beibehalten, obwohl sie deutlich langsamer ist. Benchmarkzahlen enthält das README selbst nicht; es verweist auf Benchmarks.md, daher ist der tatsächliche Leistungsunterschied dort zu prüfen.

Zwei TTS-Backends: PocketTTS und Kokoro

FluidAudio bringt zwei TTS-Backends mit. PocketTTS erzeugt Audio frame für frame, unterstützt Streaming und Stimmklonierung aus einer 1 bis 30 Sekunden langen Probe und bietet Sprachpakete für Englisch, Deutsch, Italienisch, Portugiesisch und Spanisch sowie eine 24-lagige französische Variante. Kokoro ist ein paralleles Synthesemodell mit SSML- und Aussprachesteuerung in 9 Sprachen; der neuere KokoroAne-Pfad im README führt den Großteil des Modells auf der Neural Engine aus und berichtet eine 3- bis 11-fache Verbesserung des Echtzeitfaktors gegenüber dem früheren Einzelgraphen-Pfad auf Apple Silicon. Eine Beta-Anmerkung am Anfang des TTS-Abschnitts sagt, TTS unterstütze derzeit nur amerikanisches Englisch, während derselbe Abschnitt später Sprachpakete für andere Sprachen auflistet; das README löst diesen Widerspruch nicht auf. Leser sollten dies anhand der tatsächlich veröffentlichten Version prüfen.

Installation und Wrapper für andere Frameworks

Die Installation erfolgt über den Swift Package Manager. Das README zeigt eine Abhängigkeit auf das FluidAudio-Repository ab Version 0.12.4 und bietet eine CocoaPods-Podspec derselben Version an, empfiehlt aber das Plugin cocoapods-spm für eine bessere SPM-Integration. Für Projekte mit anderen Frameworks pflegt das Projekt einen React-Native- und Expo-Wrapper namens @fluidinference/react-native-fluidaudio sowie einen Rust- und Tauri-Wrapper namens fluidaudio-rs, installierbar über npm beziehungsweise cargo. Das Kommandozeilenwerkzeug fluidaudiocli ist nur für macOS verfügbar; iOS-Apps sollen die Bibliothek programmatisch nutzen. Mindestversionen für Swift oder Xcode nennt das README nicht. Es führt außerdem eine Tabelle mit Drittanbieter-Apps, jeweils mit Angabe der verwendeten Modelle, wobei diese Apps außerhalb dieses Repositories liegen.

Konfiguration des Modell-Downloads

Modelle werden bei erster Verwendung automatisch von HuggingFace geladen. Das README nennt drei Mechanismen für Umgebungen, in denen dieser Host nicht erreichbar ist. Eine Registry-URL-Überschreibung, programmatisch über ModelRegistry.baseURL oder über die Umgebungsvariablen REGISTRY_URL und MODEL_REGISTRY_URL, ändert das Download-Ziel auf einen Mirror oder internen Server. Die Umgebungsvariable https_proxy leitet Downloads über einen Proxy, was Firmen-Firewalls abdeckt. Der dritte Mechanismus, ModelHub.offlineMode, ist ein statisches Flag, das jeden Netzabruf verweigert: Download-Aufrufe werfen dann DownloadError.networkDisabled, fehlende lokale Dateien erzeugen DownloadError.modelMissing mit einer Liste der fehlenden Einträge. Der Standardwert ist false, bestehende Aufrufer sehen also keine Verhaltensänderung, wie das README festhält.

Dokumentation, CI und Lizenz

Das Repository verweist auf DeepWiki für automatisch generierte Dokumentation und pflegt Anleitungen zu Audiokonvertierung, manuellem Modellladen, ASR-Last-Chunk-Behandlung, VAD-Segmentierung, Diarisierung, CLI und API-Referenz. Zur CI gehören eine Standard-Build-Matrix, ein Streaming-Diarisierungs-Regressionsbenchmark auf der Datei ES2004a sowie ein Offline-Pipeline-Workflow, der fehlschlägt, wenn DER oder JER die Schwellenwerte überschreiten oder Modelle nicht heruntergeladen werden können. Das Projekt steht unter Apache 2.0, was eine unbefristete, weltweite, nicht-exklusive Urheberrechtslizenz und eine Patentlizenz für Beiträge gewährt. Der hier gezeigte Lizenzauszug enthält nur Gewährungs- und Weiterverteilungsbedingungen; Zusagen zu Gewährleistung oder Support enthält er nicht. In den Danksagungen werden sherpa-onnx, Pyannote, WeSpeaker, parakeet-mlx, silero-vad und Kokoro-82M genannt.

Redaktionelles Fazit

FluidAudio verpackt konvertierte CoreML-Versionen von Open-Source-Audiomodellen für Apple-Geräte mit ANE-Inferenz, Offline-Modellladen und CLI-Werkzeugen. Das README nennt nur für ASR einen Echtzeitfaktor; alle weiteren Leistungsangaben müssen gegen das Dokument Benchmarks.md geprüft werden.

Offizielle Quellen

  1. Official documentation
  2. Official README
  3. Project repository
  4. Release notes
Community-Notizen

Community-Notizen