Vosk: die direkte Spracherkennung, außerhalb ligne
Vosk (alphacep/vosk-api, Apache-2.0-Lizenz, entwickelt von Alpha Cephei) ist eine Offline-Spracherkennungs-Engine, die fortlaufend im Streaming-Betrieb transkribiert und portable Modelle von etwa 50 MB pro Sprache verwendet – das kleine französische Modell vosk-model-small-fr-0.22 ist 41 MB groß. Vosk unterstützt mindestens 20 Sprachen und läuft auf einem Raspberry Pi oder Smartphone, bleibt bei schwierigem Audiomaterial jedoch weniger präzise als Whisper: daher auf Sprachbefehle und den Echtzeitbetrieb beschränken.
Vosk ist eine sehr ressourcenschonende Offline-Spracherkennungsengine, die von Alpha Cephei entwickelt wurde und auf Kaldi basiert. Sie verarbeitet Audio als kontinuierlichen Datenstrom: Sie transkribiert während des Sprechens, läuft auf einem Prozessor mit geringer Leistung und verwendet Modelle von wenigen Dutzend Megabyte. Bei der Textqualität kann sie nicht mit großen Modellen mithalten — sie erfüllt eine andere Aufgabe, und das, was sie leistet, lässt sich nicht leicht ersetzen. Dieser Leitfaden erläutert die vom Projekt veröffentlichten Zahlen, auch für die beiden offiziellen französischen Modelle, und zieht anschließend einen ehrlichen Vergleich mit Whisper.
#Was Vosk anders macht
Die führenden Transkriptionsmodelle verarbeiten Dateien: Sie erhalten eine vollständige Aufnahme und liefern nach Abschluss der Verarbeitung einen Text. Vosk verarbeitet einen Audiostream: Es erhält das Audio in kleinen Abschnitten und liefert während des Sprechens zunächst vorläufige und dann endgültige Ergebnisse, dank seiner Streaming-API mit einer Latenz nahe null. Die offizielle Projektbeschreibung nennt diese „zero-latency response with streaming API“ als zentrales Merkmal, ebenso wie die Größe seiner Modelle.
Dieser Unterschied in der Architektur erklärt alles Weitere: winzige Modelle, eine mühelose Ausführung auf der CPU, ein Speicherbedarf, der mit einem Raspberry Pi oder einem Einsteiger-Smartphone vereinbar ist, und eine geringere Textqualität als bei großen Modellen, wenn das Audiomaterial schwierig oder verrauscht ist.
#Vosk in Zahlen, auch für Französisch
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Das Projekt beschreibt genau, was es bietet. Das offizielle Repository kündigt Spracherkennung für „20+ languages and dialects“, Bindings für Python, Java, Node.js, C#, C++, Rust und Go sowie „portable“ Modelle mit 50 MB an. Wer mehr Genauigkeit möchte, kann auf deutlich größere Servermodelle zurückgreifen. Alles wird unter der Apache-2.0-Lizenz veröffentlicht – eine nützliche Absicherung, wenn ein Projekt seine Open-Source-Abhängigkeiten gegenüber einer Rechtsabteilung begründen muss.
| Modell | Größe | Wortfehlerrate (je niedriger, desto besser) | Vorgesehener Einsatzzweck |
|---|---|---|---|
| vosk-model-small-fr-0.22 | 41 MB | 23,95 (Common Voice) · 19,30 (MTEDX) · 27,25 (Podcasts) | Android, iOS, Raspberry Pi |
| vosk-model-fr-0.22 | 1,4 GB | 14,72 (Common Voice) · 11,64 (MLS) · 13,10 (MTEDX) | Server, höhere Genauigkeit |
Der Größenunterschied (41 MB gegenüber 1,4 GB) führt zu einem deutlichen Unterschied in der Genauigkeit: Je nach Testdatensatz verdoppelt sich die Wortfehlerrate nahezu. Das ist der zentrale Kompromiss bei Vosk, mit Zahlen belegt statt nur angenommen: Das kleinere Modell macht häufiger Fehler; für Sprachbefehle mit begrenztem Wortschatz ist das akzeptabel, für die Transkription eines Interviews deutlich weniger. Neben den offiziellen Modellen veröffentlicht das vom französischen Softwareanbieter Linagora getragene Projekt LinTO eigene französischsprachige Modelle, die mit Vosk kompatibel sind — ein nützlicher Anhaltspunkt für ein französischsprachiges Projekt, das vor der Auswahl mehrere Quellen vergleichen möchte.
Die Einzelheiten der vier Testdatensätze (Common Voice, MTEDX, Podcasts, MLS) sollten auch als methodischer Warnhinweis gelesen werden statt als bloße Rangliste, die man unverändert übernimmt: Die Wortfehlerrate kann sich bei demselben Modell von einem Datensatz zum anderen verdoppeln; bei der leichtgewichtigen Version liegt sie zwischen 19,30 auf MTEDX und 27,25 bei den Podcasts. Eine saubere Studioaufnahme und ein bei Umgebungsgeräuschen aufgezeichnetes Gespräch liefern unabhängig vom gewählten Modell nicht dieselbe Qualität – ein weiterer Grund, mit Aufnahmen zu testen, die für den tatsächlichen Einsatz repräsentativ sind, statt sich auf einen einzigen veröffentlichten Durchschnittswert auf einem Produktdatenblatt zu verlassen.
#Echtzeitverarbeitung – die eigentliche Stärke
- Latenz
- Der Text erscheint bereits während des Sprechens, was Sprachbefehle und Live-Untertitel ermöglicht.
- Teilergebnisse
- Die Anwendung kann reagieren, bevor der Satz zu Ende gesprochen ist – unverzichtbar für ein Aktivierungswort oder einen kurzen Befehl.
- Speicherbedarf
- 41 MB für das leichte französische Modell, gegenüber 1,4 GB für die Serverversion und oft mehreren Gigabyte für ein großes Allzweckmodell.
- Eingeschränktes Vokabular
- Die Erkennung kann auf eine Liste erwarteter Wörter beschränkt werden, was die Genauigkeit bei Befehlen erheblich verbessert.
Dieser letzte Punkt wird unterschätzt. Wenn Sie eine Anwendung per Sprache steuern möchten, macht die Beschränkung des Wortschatzes auf fünfzig mögliche Befehle aus einer durchschnittlichen Spracherkennungs-Engine eine sehr zuverlässige – während ein großes Allzweckmodell weiterhin zwischen ähnlichen Homophonen schwankt. Das bestätigt auch das offizielle Datenblatt, das „reconfigurable vocabulary“ neben der Sprecheridentifikation als native Funktion der Engine nennt – zwei Fähigkeiten, die nur wenige Engines dieser Größe von Haus aus bieten.
#Vosk oder Whisper
| Kriterium | Vosk | Whisper und abgeleitete Modelle |
|---|---|---|
| Modus | Kontinuierlicher Datenstrom | Datei |
| Latenz | Nahezu null (Streaming-API) | Nach der Verarbeitung |
| Modellgröße | 41 MB bis 1,4 GB je nach Variante | Hunderte von MB bis mehrere GB |
| Hardware | Leistungsschwacher, eingebetteter Prozessor | Ordentlicher Prozessor, GPU wünschenswert |
| Qualität bei schwierigem Audiomaterial | Ordentlich, gemessen (WER ≈ 15–28 je nach Modell und Test) | Erheblich besser |
| Zeichensetzung und Formatierung | Eingeschränkt | Gut |
| Geeignet für | Sprachbefehle, Echtzeitbetrieb, eingebettete Systeme | Transkription von Treffen, Interviews, Videos |
Es gibt keinen Gesamtsieger. Eine solide Verarbeitungskette nutzt oft beide: Vosk, um einen Befehl zu erkennen oder eine unmittelbare Rückmeldung anzuzeigen, während der Nutzer spricht, und ein größeres Modell wie Faster-Whisper, um die endgültige, genauere Transkription zu erstellen, sobald die Aufnahme abgeschlossen ist und Rechenkapazität zur Verfügung steht.
#Die Fälle, in denen Vosk die Nase vorn hat
- 01Sprachsteuerung einer AnwendungEingeschränktes Vokabular, minimale Latenz, keine Netzwerkabhängigkeit
- 02Live-UntertitelungInternes Meeting, Konferenz, Barrierefreiheit in Echtzeit.
- 03Embedded HardwareEin Nanocomputer oder ein eigenständiges Gerät, auf dem ein großes Modell keinen Platz findet – das Projekt nennt ausdrücklich Raspberry Pi und Android als Zielplattformen.
- 04Strikte Vertraulichkeit ohne GPUEin gewöhnlicher Rechner, der nichts senden darf und keine Grafikkarte hat.
Diese vier Fälle haben eines gemeinsam: Sie tolerieren eine ordentliche statt einer hervorragenden Textqualität im Austausch für eine nahezu latenzfreie Verarbeitung und einen Ressourcenbedarf, der mit bescheidener Hardware vereinbar ist. Sobald die umgekehrte Anforderung gilt – höchste Qualität ist gefordert, einige Sekunden Latenz sind tolerierbar –, hat ein Modell zur Verarbeitung von Dateien wie Faster-Whisper wieder die Nase vorn. Das erklärt, warum die beiden Werkzeuge in einer vollständigen, gut konzipierten Sprachverarbeitungskette meist nebeneinander eingesetzt werden, statt einander zu ersetzen.
#Audioformate und Textexport
In der Praxis beschränkt sich ein Transkriptionsprojekt niemals auf den bloßen Aufruf der Engine: Man muss das empfangene Eingabeformat einlesen, es bei Bedarf konvertieren und anschließend das Ergebnis in einem Format ausgeben, das sich weiterverarbeiten lässt; häufig muss man dabei mehrere Anbieter von Aufzeichnungen gleichzeitig verwalten. Die in der oben zitierten Studie dokumentierte Pipeline veranschaulicht diesen vollständigen Ablauf: Einlesen mehrerer gängiger Audioformate (WAV, MP3, FLAC, OGG) über Python-Module zur Vorverarbeitung, Spracherkennung mit dem KaldiRecognizer von Vosk und anschließender Export des gewonnenen Textes in ein strukturiertes Dokument, das zum Gegenlesen oder Archivieren bereitsteht.
Dieses Detail ist wichtig, weil Vosk selbst als Eingabe einen Audiostream in einem bestimmten Format erwartet (Mono-PCM, in der Regel 16 kHz), nicht einfach eine beliebige Datei in ihrer ursprünglichen Form. Ein Projekt, das unterschiedliche Audiodaten erhält – Aufnahmen von Mobiltelefonen, Exporte aus Videokonferenzen, komprimierte Dateien aus verschiedenen Quellen –, benötigt daher fast immer einen Konvertierungsschritt vor der Erkennungs-Engine. Oft liegen genau dort, statt in der Engine selbst, die Ursachen für die weiter oben in diesem Leitfaden erwähnten Fehler, bei denen sich die Erkennung ohne ausdrückliche Fehlermeldung verschlechtert.
#Das Sprachmodell anpassen
Unter der Haube stützt sich die Spracherkennung von Vosk auf den eigenen KaldiRecognizer, der von der Spracherkennungsengine Kaldi abgeleitet ist – ein Detail, das erklärt, warum das Projekt das gesamte Ökosystem der Kaldi-Werkzeuge zur Anpassung übernimmt, statt bei jeder neuen Sprache oder jedem neuen Fachgebiet von vorne anzufangen. Eine aktuelle Forschungsarbeit zu diesem Thema, die auf einer angepassten Vosk-Pipeline aufbaut, hat die konkrete Wirkung eines angepassten Sprachmodells gemessen: Angepasste Modelle senken die Wortfehlerrate, insbesondere bei technischem Vokabular, ausgeprägten Akzenten oder verrauschten Audioaufnahmen.
Für ein französischsprachiges Projekt eröffnet das einen konkreten Ansatz jenseits der Wahl zwischen dem kleinen Modell und dem Servermodell: einen Fachwortschatz (Produktnamen, interner Jargon, Akronyme, lokale Eigennamen) in das Sprachmodell einzubringen, statt sich mit dem allgemeinen Wortschatz zu begnügen. Das erfordert mehr Arbeit als ein einfacher Download, bringt aber einen Vosk-Einsatz der Qualität eines großen Modells in einem bestimmten Fachgebiet am nächsten, ohne dessen Rechenaufwand oder Latenz in Kauf nehmen zu müssen.
#Umsetzung
Die Funktionsweise ist einfach: Man installiert das Paket (pip install vosk für Python), lädt ein Modell für die gewünschte Sprache herunter, öffnet einen Audiostream, übergibt der Engine Audioabschnitte und liest zunächst die vorläufigen, dann die endgültigen Ergebnisse aus. Es gibt Bindings für Python, Java, Node.js, C#, C++, Rust und Go, und ein WebSocket-Server ermöglicht es, eine Webseite oder eine mobile Anwendung mit einer Engine zu verbinden, die auf Ihrem Rechner läuft.
Vor dem produktiven Einsatz sind zwei Punkte zu beachten: Die Qualität hängt stark vom gewählten Sprachmodell ab – die Tabelle oben gibt eine Größenordnung an, aber testen Sie das Modell mit Ihren eigenen Aufnahmen, bevor Sie darauf aufbauen – und die Abtastrate des Audios muss dem entsprechen, was das Modell erwartet. Andernfalls verschlechtert sich die Erkennung, ohne dass eine ausdrückliche Fehlermeldung erscheint.
- Lokaler Sprachassistent: die vollständige Kette
- Dateien schnell lokal transkribieren
- Den Assistenten mit Kokoro hörbar antworten lassen
- Whisper + Ollama: Transkription zu 100 % offline
- Quelle: offizielles GitHub-Repository von Vosk
- Quelle: Katalog der Vosk-Modelle mit Größen und Leistungswerten
- Quelle: Studie zur Anpassung des Sprachmodells Vosk
#FAQ
Ist Vosk kostenlos?+
Braucht man eine Grafikkarte?+
Vosk oder Whisper?+
Funktioniert es auf Französisch und mit welcher Qualität?+
Kann man den erkannten Wortschatz begrenzen?+
Welche Modellgröße für ein eingebettetes Projekt wählen?+
Kann die Genauigkeit ohne Modellwechsel verbessert werden?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.