Kokoro TTS: eine überzeugende lokale Stimme und leicht
Kokoro (hexgrad/Kokoro-82M, Apache-2.0-Lizenz) ist ein offenes Sprachsynthesemodell mit 82 Millionen Parametern, das auf StyleTTS 2 und ISTFTNet basiert. Es unterstützt 8 Sprachen und 54 Stimmen (darunter Französisch), läuft auf der CPU schneller als in Echtzeit und wurde ausschließlich mit lizenzgebührenfreien Audiodaten trainiert — Stimmenklonen ist nicht möglich, da kein Klonmodul veröffentlicht wurde. Beobachtete Kosten bei Nutzung über eine API: weniger als 1 $ pro Million Zeichen.
Die meisten guten Sprachsynthesesysteme laufen in der Cloud oder benötigen leistungsfähige Hardware. Kokoro ist ein sehr kleines offenes Modell (Repository hexgrad/Kokoro-82M, Lizenz Apache 2.0), das überzeugende Ergebnisse liefert und auf einem gewöhnlichen Rechner Sprache schneller als in Echtzeit erzeugt – auch ohne Grafikkarte. Sein Datenblatt beschreibt ungewöhnlich genau, was das Modell enthält, einschließlich der Herkunft der Trainingsdaten. Damit ist es eines der seltenen Sprachsynthesemodelle, bei denen sich jede Aussage überprüfen lässt, statt sie einfach glauben zu müssen.
#Warum ein kleines Modell die Rechnung verändert
Die Qualität der Sprachsynthese ist schon seit einiger Zeit nicht mehr das Problem; die Kosten und die Frage, wo sie ausgeführt wird, dagegen schon. Online-Stimmen klingen sehr gut, setzen aber voraus, dass jeder von Ihrem System gesprochene Satz an einen Dienstleister übermittelt und nutzungsabhängig abgerechnet wird. Große lokale Modelle klingen gut und belegen eine Grafikkarte, die Sie lieber Ihrem Sprachmodell zur Verfügung stellen würden als der Stimme, die es sprechen lässt.
Ein Modell, das klein genug ist, um auf einem Prozessor in einer Sekunde ausgeführt zu werden, beseitigt beide Einschränkungen auf einmal. Ein langes Dokument laut vorzulesen, ist dann keine Budgetentscheidung mehr. Ein Assistent kann alle seine Antworten aussprechen statt nur der wichtigen. Eine Stapelverarbeitung kann über Nacht hundert Dateien auf Hardware vorlesen, die Sie bereits besitzen, ohne etwas an Dritte zu senden, auf ein Kontingent zu warten oder eine Rechnung im Blick behalten zu müssen, die mit dem verarbeiteten Volumen steigt.
#Das Modell in überprüften Zahlen
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
- 82 Millionen Parameter
- Eine Größenordnung kleiner als die Modelle, mit denen es üblicherweise verglichen wird.
- Architektur StyleTTS 2 + ISTFTNet
- Ein „Decoder-only“-Design ohne Diffusion, was zum Teil erklärt, warum es so schlank ist.
- 8 Sprachen, 54 Stimmen (v1.0)
- Veröffentlicht am 27. Januar 2025, trainiert auf einigen hundert Stunden Audio.
- Gesamtkosten des Trainings: etwa 1.000 $
- Insgesamt 1.000 Stunden Rechenzeit auf A100-GPUs mit 80 GB – im Vergleich zu konkurrierenden Modellen ein winziges Budget für dieses Ergebnis.
- Ausschließlich frei nutzbare Daten
- Gemeinfreie Audiodaten, Audiodaten unter permissiven Lizenzen oder synthetische Audiodaten von kommerziellen Anbietern mit geschlossenen Systemen – ausdrücklich niemals unautorisierte Stimmenklone oder Audiodaten eines anderen offenen Modells.
Dieser letzte Punkt verdient besondere Aufmerksamkeit: Die Modellbeschreibung nennt die Herkunft der Daten ausdrücklich, was in diesem Bereich selten ist. Das ist einer der Gründe, warum sich Kokoro ohne die rechtliche Unklarheit einsetzen lässt, die Modelle umgibt, die mit ohne Zustimmung beschafften oder geklonten Stimmen trainiert wurden – ein Punkt, der besonders für ein Projekt für die breite Öffentlichkeit in Frankreich zählt, wo das Persönlichkeitsrecht an der eigenen Stimme ernst genommen wird. Bei seiner Veröffentlichung erreichte Kokoro den ersten Platz in der Community-Rangliste TTS Spaces Arena, vor deutlich größeren Modellen: XTTS v2 (467 Millionen Parameter), MetaVoice (1,2 Milliarden) und Fish Speech (etwa 500 Millionen) wurden alle von einem Modell mit 82 Millionen Parametern übertroffen – eine Rangliste aus einem bestimmten Zeitpunkt, keine universelle Garantie, aber ein starkes Signal für das Verhältnis von Qualität zu Modellgröße für alle, die schnell entscheiden müssen, ohne zehn Modelle parallel laufen zu lassen.
#Was es tut und was es nicht tut
| Kapazität | Kokoro |
|---|---|
| Natürliche Prosodie bei gewöhnlichem Text | Stark für seine Größe |
| Vordefinierte Stimmen | 54 Stimmen in 8 Sprachen, darunter Französisch (fr-fr) |
| Stimmenklonung aus einem Sample | Dies ist nicht sein Ziel: Kein Klonmodul wurde mit den Gewichten veröffentlicht |
| Fein abgestimmte emotionale Steuerung | Eingeschränkt |
| Geschwindigkeit | Schneller als Echtzeit auf einfacher Hardware |
| Offline-Betrieb | Ja, nachdem die Gewichte über pip install kokoro heruntergeladen wurden |
Ehrlich formuliert: Es ist ein sehr guter Vorleser, kein Schauspieler. Für Erzählungen, Benachrichtigungen, einen Assistenten oder Barrierefreiheit ist das mehr als ausreichend. Für eine darstellerische Leistung, bei der eine bestimmte Ausdrucksabsicht zählt, brauchen Sie ein Werkzeug, das sich feiner steuern lässt. Was die Kosten angeht, liegt der beobachtete API-Preis bei rund 1 $ pro Million Eingabezeichen – etwa tausend Zeichen ergeben eine Minute Audio. Das ist auch bei lokaler Nutzung ein nützlicher Richtwert, um die tatsächlichen Kosten eines vergleichbaren Cloud-Abonnements über längere Zeit gegenüberzustellen.
#Seine Rolle in einer lokalen Verarbeitungskette
- 01SpracheingabeEin Transkriptionsmodell wandelt die gesprochenen Worte des Benutzers in Text um; Faster-Whisper übernimmt diesen Schritt gut, auch ohne GPU.
- 02Das Modell denkt nachEin lokales Modell erzeugt die Antwort und wird von Ollama oder einer anderen Engine bereitgestellt.
- 03Die Stimme wird ausgegebenKokoro liest die Antwort über das Python-Paket kokoro vor, das die Phonemisierung durch die Bibliothek misaki nutzt und für bestimmte Wörter außerhalb des Wörterbuchs auf espeak-ng als Ersatz zurückgreift.
Das Latenzbudget muss immer als Ganzes betrachtet werden: Der Nutzer nimmt die Gesamtdauer wahr – erst Transkription, dann Generierung, dann Sprachsynthese. Die Sprachsynthese ist in der Regel der am wenigsten aufwendige der drei Schritte. Das bedeutet, dass die wahrgenommene Reaktionsgeschwindigkeit eines Sprachassistenten vor allem von der Geschwindigkeit Ihres Sprachmodells bestimmt wird, nicht von der Stimme, die die endgültige Antwort vorliest.
#Drei konkrete Anwendungen auf Französisch
Die fr-fr-Stimme von Kokoro macht das Modell direkt für ein französischsprachiges Publikum nutzbar, ohne auf eine englische Stimme mit schlechter Aussprache oder einen nutzungsabhängig abgerechneten Drittanbieterdienst zurückgreifen zu müssen. Drei Anwendungsfälle kommen bei den Projekten, die das Modell einsetzen, am häufigsten vor.
- Vorlesen langer Dokumente
- Berichte, Artikel, Notizen zur laufenden Recherche: Ein mehrseitiges Dokument vorlesen zu lassen, kostet nur noch etwas Prozessorzeit statt eines Abonnements für eine API, die pro Zeichen abrechnet.
- Sprachassistent für den privaten oder beruflichen Einsatz
- In Kombination mit Whisper für die Spracherkennung und einem lokalen LLM für das Nachdenken schließt Kokoro den Kreislauf, ohne dass eine Unterhaltung das lokale Netzwerk verlässt.
- Barrierefreiheit und Benachrichtigungen
- Vorlesen von Bildschirminhalten, Sprachwarnungen, Bestätigung von Aktionen: Anwendungen, bei denen Latenz und Offline-Verfügbarkeit wichtiger sind als die Nuancen der Interpretation.
In allen drei Fällen ändert sich die Kostenbetrachtung grundlegend: An die Stelle der bei jedem Aufruf berechneten Kosten pro Zeichen treten Stromverbrauch und Prozessorzeit einer Maschine, die Sie bereits besitzen. Bei großen Mengen vorzulesenden Textes – von der täglichen Dokumentenrecherche bis zum sprachbasierten Kundendienst – wächst der Kostenvorteil der lokalen Verarbeitung schnell, zumal die Sprachausgabe selbst ohne dedizierte Grafikkarte schneller als in Echtzeit erzeugt wird.
#Kokoro oder Piper
| Kokoro | Piper | |
|---|---|---|
| Ausgabequalität | Überlegen, natürlichere Prosodie | Gut, flacher |
| Speicherbedarf | 82 Millionen Parameter, ein einziges Modell | Sehr klein, ein ONNX-Modell pro Stimme (VITS) |
| Geschwindigkeit auf der CPU | Schnell | Extrem schnell, für Hardware mit stark begrenzten Ressourcen konzipiert |
| Sprachabdeckung | 8 Sprachen, 54 Stimmen (v1.0) | 44 Sprachen/Sprachvarianten in der offiziellen Stimmenliste |
| Lizenz | Apache 2.0, einheitlich für alle Stimmen | GPL-3.0 im aktiven Repository; MIT im alten, inzwischen archivierten Repository |
| Wann die Wahl sinnvoll ist | Die Qualität ist entscheidend | Der Ressourcenbedarf, die Latenz oder eine Stimme für eine bestimmte Sprach- und Regionsvariante haben Vorrang |
Die Lizenzfrage bei Piper sollte geprüft werden, bevor Sie sich darauf festlegen: Das ursprüngliche Repository rhasspy/piper unter MIT-Lizenz ist inzwischen archiviert und schreibgeschützt. Die aktive Entwicklung ist zu OHF-Voice/piper1-gpl gewechselt, das von der Open Home Foundation unter GPL-3.0 gepflegt wird – für die kommerzielle Nutzung ein wesentlicher Unterschied gegenüber Tutorials, die weiterhin die MIT-Lizenz des alten Repositorys nennen. Die offizielle Piper-Dokumentation weist außerdem darauf hin, dass einzelne Stimmen restriktivere Lizenzen haben können als die Engine: Das ist für jede Stimme einzeln zu prüfen, nicht nur auf Projektebene. Piper ist weiterhin anders aufgebaut als Kokoro: Jede Stimme ist ein eigenständiges VITS-Modell, das nach ONNX exportiert wurde, mit einer .onnx-Datei und einer .onnx.json-Konfigurationsdatei, während Kokoro seine 54 Stimmen über einen einzigen gemeinsamen Satz von Modellgewichten bereitstellt.
- Lokaler Sprachassistent: Whisper + Ollama + Piper von Anfang bis Ende
- Der Schritt des Zuhörens: schnell lokal transkribieren, auch ohne GPU
- Vosk: eine weitere Option für die Offline-Spracherkennung
- Ein Besprechungsprotokoll lokal automatisieren
- Quelle: offizielle Modellkarte von Kokoro-82M auf Hugging Face
- Quelle: GitHub-Repository des Python-Pakets kokoro
- Quelle: aktives Repository von Piper (GPL-3.0)
#Lizenz und Ethik
Zwei Fragen entscheiden darüber, ob ein Sprachsynthesemodell in Ihrem Projekt einsetzbar ist, und nur eine davon ist technischer Natur. Die erste betrifft die Lizenz für die Gewichte und Stimmen, die die kommerzielle Nutzung regelt: Bei Kokoro ist das Apache 2.0, eine permissive und eindeutige Lizenz, die alle 54 Stimmen gemeinsam abdeckt. Das gilt nicht für alle Sprachsynthese-Engines; das naheliegendste Beispiel ist Piper mit seinem jüngsten Wechsel zu GPL-3.0. Der zweite Punkt ist, dass ein Modell mit vordefinierten Stimmen die Frage der Einwilligung vollständig vermeidet, während das Klonen der Stimme einer Person anhand einer Aufnahme deren Zustimmung erfordert und in einer wachsenden Zahl von Rechtsordnungen rechtliche Konsequenzen mit sich bringt. Die Modellkarte von Kokoro ist ausdrücklich: Zusammen mit den Gewichten wurde kein Modul zum Stimmenklonen veröffentlicht. Diese Nutzung wird somit bereits durch die technische Ausgestaltung ausgeschlossen und nicht lediglich durch Nutzungsrichtlinien.
Für ein französisches Projekt vereinfacht diese Kombination vieles: Es muss kein Lizenzvertrag für die Stimme ausgehandelt werden, es gibt keine reale Person, deren Zustimmung eingeholt werden muss, und die Apache-2.0-Lizenz wirft keine Fragen hinsichtlich des Weiterverkaufs oder der Integration in ein kostenpflichtiges Produkt auf. Der einzige verbleibende Punkt, auf den Sie achten müssen, ist rein technischer Natur: Prüfen, ob die gewählte französische Stimme bei den tatsächlichen Texten des Projekts richtig klingt, einschließlich Akzenten und Kürzeln, bevor sie in großem Umfang eingesetzt wird.
#FAQ
Ist Kokoro kommerziell nutzbar?+
Braucht man eine Grafikkarte?+
Kann es meine Stimme klonen?+
Kokoro oder Piper?+
Welche Sprachen werden unterstützt, und gehört Französisch dazu?+
Woher stammen die Trainingsdaten von Kokoro?+
Wie hoch sind die tatsächlichen Kosten im Vergleich zu einer Cloud-API?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.