Mittelstufe 11 Min.Audio

Vosk: die direkte Spracherkennung, außerhalb ligne

Direkte Antwort

Vosk (alphacep/vosk-api, Apache-2.0-Lizenz, entwickelt von Alpha Cephei) ist eine Offline-Spracherkennungs-Engine, die fortlaufend im Streaming-Betrieb transkribiert und portable Modelle von etwa 50 MB pro Sprache verwendet – das kleine französische Modell vosk-model-small-fr-0.22 ist 41 MB groß. Vosk unterstützt mindestens 20 Sprachen und läuft auf einem Raspberry Pi oder Smartphone, bleibt bei schwierigem Audiomaterial jedoch weniger präzise als Whisper: daher auf Sprachbefehle und den Echtzeitbetrieb beschränken.

Vosk ist eine sehr ressourcenschonende Offline-Spracherkennungsengine, die von Alpha Cephei entwickelt wurde und auf Kaldi basiert. Sie verarbeitet Audio als kontinuierlichen Datenstrom: Sie transkribiert während des Sprechens, läuft auf einem Prozessor mit geringer Leistung und verwendet Modelle von wenigen Dutzend Megabyte. Bei der Textqualität kann sie nicht mit großen Modellen mithalten — sie erfüllt eine andere Aufgabe, und das, was sie leistet, lässt sich nicht leicht ersetzen. Dieser Leitfaden erläutert die vom Projekt veröffentlichten Zahlen, auch für die beiden offiziellen französischen Modelle, und zieht anschließend einen ehrlichen Vergleich mit Whisper.

Von Mohamed Meguedmi·Aktualisierung 2026-09-28·Unter Windows, macOS und Linux getestet

#Was Vosk anders macht

Die führenden Transkriptionsmodelle verarbeiten Dateien: Sie erhalten eine vollständige Aufnahme und liefern nach Abschluss der Verarbeitung einen Text. Vosk verarbeitet einen Audiostream: Es erhält das Audio in kleinen Abschnitten und liefert während des Sprechens zunächst vorläufige und dann endgültige Ergebnisse, dank seiner Streaming-API mit einer Latenz nahe null. Die offizielle Projektbeschreibung nennt diese „zero-latency response with streaming API“ als zentrales Merkmal, ebenso wie die Größe seiner Modelle.

Dieser Unterschied in der Architektur erklärt alles Weitere: winzige Modelle, eine mühelose Ausführung auf der CPU, ein Speicherbedarf, der mit einem Raspberry Pi oder einem Einsteiger-Smartphone vereinbar ist, und eine geringere Textqualität als bei großen Modellen, wenn das Audiomaterial schwierig oder verrauscht ist.

#Vosk in Zahlen, auch für Französisch

Das Kit Lokale KI

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Das Projekt beschreibt genau, was es bietet. Das offizielle Repository kündigt Spracherkennung für „20+ languages and dialects“, Bindings für Python, Java, Node.js, C#, C++, Rust und Go sowie „portable“ Modelle mit 50 MB an. Wer mehr Genauigkeit möchte, kann auf deutlich größere Servermodelle zurückgreifen. Alles wird unter der Apache-2.0-Lizenz veröffentlicht – eine nützliche Absicherung, wenn ein Projekt seine Open-Source-Abhängigkeiten gegenüber einer Rechtsabteilung begründen muss.

Die beiden offiziellen französischen Modelle (Katalog alphacephei.com/vosk/models)
ModellGrößeWortfehlerrate (je niedriger, desto besser)Vorgesehener Einsatzzweck
vosk-model-small-fr-0.2241 MB23,95 (Common Voice) · 19,30 (MTEDX) · 27,25 (Podcasts)Android, iOS, Raspberry Pi
vosk-model-fr-0.221,4 GB14,72 (Common Voice) · 11,64 (MLS) · 13,10 (MTEDX)Server, höhere Genauigkeit

Der Größenunterschied (41 MB gegenüber 1,4 GB) führt zu einem deutlichen Unterschied in der Genauigkeit: Je nach Testdatensatz verdoppelt sich die Wortfehlerrate nahezu. Das ist der zentrale Kompromiss bei Vosk, mit Zahlen belegt statt nur angenommen: Das kleinere Modell macht häufiger Fehler; für Sprachbefehle mit begrenztem Wortschatz ist das akzeptabel, für die Transkription eines Interviews deutlich weniger. Neben den offiziellen Modellen veröffentlicht das vom französischen Softwareanbieter Linagora getragene Projekt LinTO eigene französischsprachige Modelle, die mit Vosk kompatibel sind — ein nützlicher Anhaltspunkt für ein französischsprachiges Projekt, das vor der Auswahl mehrere Quellen vergleichen möchte.

Die Einzelheiten der vier Testdatensätze (Common Voice, MTEDX, Podcasts, MLS) sollten auch als methodischer Warnhinweis gelesen werden statt als bloße Rangliste, die man unverändert übernimmt: Die Wortfehlerrate kann sich bei demselben Modell von einem Datensatz zum anderen verdoppeln; bei der leichtgewichtigen Version liegt sie zwischen 19,30 auf MTEDX und 27,25 bei den Podcasts. Eine saubere Studioaufnahme und ein bei Umgebungsgeräuschen aufgezeichnetes Gespräch liefern unabhängig vom gewählten Modell nicht dieselbe Qualität – ein weiterer Grund, mit Aufnahmen zu testen, die für den tatsächlichen Einsatz repräsentativ sind, statt sich auf einen einzigen veröffentlichten Durchschnittswert auf einem Produktdatenblatt zu verlassen.

#Echtzeitverarbeitung – die eigentliche Stärke

Latenz
Der Text erscheint bereits während des Sprechens, was Sprachbefehle und Live-Untertitel ermöglicht.
Teilergebnisse
Die Anwendung kann reagieren, bevor der Satz zu Ende gesprochen ist – unverzichtbar für ein Aktivierungswort oder einen kurzen Befehl.
Speicherbedarf
41 MB für das leichte französische Modell, gegenüber 1,4 GB für die Serverversion und oft mehreren Gigabyte für ein großes Allzweckmodell.
Eingeschränktes Vokabular
Die Erkennung kann auf eine Liste erwarteter Wörter beschränkt werden, was die Genauigkeit bei Befehlen erheblich verbessert.

Dieser letzte Punkt wird unterschätzt. Wenn Sie eine Anwendung per Sprache steuern möchten, macht die Beschränkung des Wortschatzes auf fünfzig mögliche Befehle aus einer durchschnittlichen Spracherkennungs-Engine eine sehr zuverlässige – während ein großes Allzweckmodell weiterhin zwischen ähnlichen Homophonen schwankt. Das bestätigt auch das offizielle Datenblatt, das „reconfigurable vocabulary“ neben der Sprecheridentifikation als native Funktion der Engine nennt – zwei Fähigkeiten, die nur wenige Engines dieser Größe von Haus aus bieten.

#Vosk oder Whisper

Zwei Werkzeuge, zwei Aufgabenbereiche
KriteriumVoskWhisper und abgeleitete Modelle
ModusKontinuierlicher DatenstromDatei
LatenzNahezu null (Streaming-API)Nach der Verarbeitung
Modellgröße41 MB bis 1,4 GB je nach VarianteHunderte von MB bis mehrere GB
HardwareLeistungsschwacher, eingebetteter ProzessorOrdentlicher Prozessor, GPU wünschenswert
Qualität bei schwierigem AudiomaterialOrdentlich, gemessen (WER ≈ 15–28 je nach Modell und Test)Erheblich besser
Zeichensetzung und FormatierungEingeschränktGut
Geeignet fürSprachbefehle, Echtzeitbetrieb, eingebettete SystemeTranskription von Treffen, Interviews, Videos

Es gibt keinen Gesamtsieger. Eine solide Verarbeitungskette nutzt oft beide: Vosk, um einen Befehl zu erkennen oder eine unmittelbare Rückmeldung anzuzeigen, während der Nutzer spricht, und ein größeres Modell wie Faster-Whisper, um die endgültige, genauere Transkription zu erstellen, sobald die Aufnahme abgeschlossen ist und Rechenkapazität zur Verfügung steht.

#Die Fälle, in denen Vosk die Nase vorn hat

  1. 01
    Sprachsteuerung einer Anwendung
    Eingeschränktes Vokabular, minimale Latenz, keine Netzwerkabhängigkeit
  2. 02
    Live-Untertitelung
    Internes Meeting, Konferenz, Barrierefreiheit in Echtzeit.
  3. 03
    Embedded Hardware
    Ein Nanocomputer oder ein eigenständiges Gerät, auf dem ein großes Modell keinen Platz findet – das Projekt nennt ausdrücklich Raspberry Pi und Android als Zielplattformen.
  4. 04
    Strikte Vertraulichkeit ohne GPU
    Ein gewöhnlicher Rechner, der nichts senden darf und keine Grafikkarte hat.

Diese vier Fälle haben eines gemeinsam: Sie tolerieren eine ordentliche statt einer hervorragenden Textqualität im Austausch für eine nahezu latenzfreie Verarbeitung und einen Ressourcenbedarf, der mit bescheidener Hardware vereinbar ist. Sobald die umgekehrte Anforderung gilt – höchste Qualität ist gefordert, einige Sekunden Latenz sind tolerierbar –, hat ein Modell zur Verarbeitung von Dateien wie Faster-Whisper wieder die Nase vorn. Das erklärt, warum die beiden Werkzeuge in einer vollständigen, gut konzipierten Sprachverarbeitungskette meist nebeneinander eingesetzt werden, statt einander zu ersetzen.

#Audioformate und Textexport

In der Praxis beschränkt sich ein Transkriptionsprojekt niemals auf den bloßen Aufruf der Engine: Man muss das empfangene Eingabeformat einlesen, es bei Bedarf konvertieren und anschließend das Ergebnis in einem Format ausgeben, das sich weiterverarbeiten lässt; häufig muss man dabei mehrere Anbieter von Aufzeichnungen gleichzeitig verwalten. Die in der oben zitierten Studie dokumentierte Pipeline veranschaulicht diesen vollständigen Ablauf: Einlesen mehrerer gängiger Audioformate (WAV, MP3, FLAC, OGG) über Python-Module zur Vorverarbeitung, Spracherkennung mit dem KaldiRecognizer von Vosk und anschließender Export des gewonnenen Textes in ein strukturiertes Dokument, das zum Gegenlesen oder Archivieren bereitsteht.

Dieses Detail ist wichtig, weil Vosk selbst als Eingabe einen Audiostream in einem bestimmten Format erwartet (Mono-PCM, in der Regel 16 kHz), nicht einfach eine beliebige Datei in ihrer ursprünglichen Form. Ein Projekt, das unterschiedliche Audiodaten erhält – Aufnahmen von Mobiltelefonen, Exporte aus Videokonferenzen, komprimierte Dateien aus verschiedenen Quellen –, benötigt daher fast immer einen Konvertierungsschritt vor der Erkennungs-Engine. Oft liegen genau dort, statt in der Engine selbst, die Ursachen für die weiter oben in diesem Leitfaden erwähnten Fehler, bei denen sich die Erkennung ohne ausdrückliche Fehlermeldung verschlechtert.

#Das Sprachmodell anpassen

Unter der Haube stützt sich die Spracherkennung von Vosk auf den eigenen KaldiRecognizer, der von der Spracherkennungsengine Kaldi abgeleitet ist – ein Detail, das erklärt, warum das Projekt das gesamte Ökosystem der Kaldi-Werkzeuge zur Anpassung übernimmt, statt bei jeder neuen Sprache oder jedem neuen Fachgebiet von vorne anzufangen. Eine aktuelle Forschungsarbeit zu diesem Thema, die auf einer angepassten Vosk-Pipeline aufbaut, hat die konkrete Wirkung eines angepassten Sprachmodells gemessen: Angepasste Modelle senken die Wortfehlerrate, insbesondere bei technischem Vokabular, ausgeprägten Akzenten oder verrauschten Audioaufnahmen.

Für ein französischsprachiges Projekt eröffnet das einen konkreten Ansatz jenseits der Wahl zwischen dem kleinen Modell und dem Servermodell: einen Fachwortschatz (Produktnamen, interner Jargon, Akronyme, lokale Eigennamen) in das Sprachmodell einzubringen, statt sich mit dem allgemeinen Wortschatz zu begnügen. Das erfordert mehr Arbeit als ein einfacher Download, bringt aber einen Vosk-Einsatz der Qualität eines großen Modells in einem bestimmten Fachgebiet am nächsten, ohne dessen Rechenaufwand oder Latenz in Kauf nehmen zu müssen.

!
Das Eingabeformat als Ursache unbemerkter Fehler
Vosk erwartet einen Mono-PCM-Datenstrom, in der Regel mit einer Abtastrate von genau 16 kHz. Eine Stereodatei, eine andere Abtastrate oder ein nicht konvertiertes komprimiertes Format verschlechtern die Erkennung, ohne dass jemals eine ausdrückliche Fehlermeldung angezeigt wird – das wirkt wie ein schlechtes Modell, obwohl die eigentliche Ursache bereits vorher bei der Konvertierung liegt.

#Umsetzung

Die Funktionsweise ist einfach: Man installiert das Paket (pip install vosk für Python), lädt ein Modell für die gewünschte Sprache herunter, öffnet einen Audiostream, übergibt der Engine Audioabschnitte und liest zunächst die vorläufigen, dann die endgültigen Ergebnisse aus. Es gibt Bindings für Python, Java, Node.js, C#, C++, Rust und Go, und ein WebSocket-Server ermöglicht es, eine Webseite oder eine mobile Anwendung mit einer Engine zu verbinden, die auf Ihrem Rechner läuft.

Vosk installieren und das kleine französische Modell herunterladen
pip install vosk
curl -LO https://alphacephei.com/vosk/models/vosk-model-small-fr-0.22.zip
unzip vosk-model-small-fr-0.22.zip

Vor dem produktiven Einsatz sind zwei Punkte zu beachten: Die Qualität hängt stark vom gewählten Sprachmodell ab – die Tabelle oben gibt eine Größenordnung an, aber testen Sie das Modell mit Ihren eigenen Aufnahmen, bevor Sie darauf aufbauen – und die Abtastrate des Audios muss dem entsprechen, was das Modell erwartet. Andernfalls verschlechtert sich die Erkennung, ohne dass eine ausdrückliche Fehlermeldung erscheint.

#FAQ

Ist Vosk kostenlos?+
Ja: Das Repository alphacep/vosk-api ist unter der Apache-2.0-Lizenz veröffentlicht, einer der freizügigsten offenen Lizenzen, die auch eine kommerzielle Nutzung ohne Lizenzgebühren erlaubt. Prüfen Sie jedoch die Lizenz des konkreten Sprachmodells, das Sie herunterladen: Die beiden offiziellen französischen Modelle stehen ebenfalls unter Apache 2.0, aber einige Drittanbietermodelle im Katalog haben eigene Bedingungen.
Braucht man eine Grafikkarte?+
Nein, und genau darin liegt sein Vorteil: Das Projekt ist für die Ausführung auf der CPU ausgelegt, auch auf eingebetteter Hardware wie einem Raspberry Pi oder einem Android-Smartphone, mit portablen Modellen von etwa 50 MB – genau 41 MB für das offizielle leichte französischsprachige Modell.
Vosk oder Whisper?+
Vosk für die Erkennung in Echtzeit, Sprachbefehle und eingebettete Systeme, mit nahezu keiner Latenz dank seiner Streaming-API. Whisper und seine Varianten wie Faster-Whisper für die Transkription von Dateien mit bestmöglicher Textqualität. Beide lassen sich sehr gut in derselben Verarbeitungskette kombinieren.
Funktioniert es auf Französisch und mit welcher Qualität?+
Ja, es gibt zwei offizielle Modelle: vosk-model-small-fr-0.22 (41 MB, Wortfehlerrate je nach Test ungefähr 20 bis 27) für eingebettete Systeme und vosk-model-fr-0.22 (1,4 GB, ungefähr 12 bis 14) für eine höhere Genauigkeit auf Serverseite. Alternativen gibt es auch über das Projekt LinTO des französischen Softwareanbieters Linagora.
Kann man den erkannten Wortschatz begrenzen?+
Ja, und diese Einstellung beeinflusst die Genauigkeit bei Sprachbefehlen am stärksten: Die Erkennung auf eine Liste erwarteter Sätze zu beschränken, verbessert die Zuverlässigkeit deutlich. Das Projekt dokumentiert diese Funktion ausdrücklich unter der Bezeichnung „rekonfigurierbares Vokabular“, neben der Sprecheridentifikation.
Welche Modellgröße für ein eingebettetes Projekt wählen?+
Das schlanke Modell mit 41 MB (vosk-model-small-fr-0.22 für Französisch) bleibt die Referenz für Raspberry Pi oder Android. Das Servermodell mit 1,4 GB halbiert nahezu die auf denselben Testdatensätzen gemessene Wortfehlerrate, setzt jedoch mehr verfügbaren Speicher und mehr Rechenleistung voraus und eignet sich deshalb nicht für einen wirklich eingebetteten Einsatz.
Kann die Genauigkeit ohne Modellwechsel verbessert werden?+
Ja, indem Sie das Sprachmodell an das Fachvokabular des Projekts anpassen, statt die Modellgröße zu ändern. Eine aktuelle Studie zur Vosk-Pipeline zeigt, dass dieser Ansatz die Wortfehlerrate reduziert, insbesondere bei technischem Fachjargon, ausgeprägten Akzenten oder verrauschten Audioaufnahmen — ohne den Rechenaufwand eines größeren Modells.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.