Einsteiger 10 Min.Audio

Kokoro TTS: eine überzeugende lokale Stimme und leicht

Direkte Antwort

Kokoro (hexgrad/Kokoro-82M, Apache-2.0-Lizenz) ist ein offenes Sprachsynthesemodell mit 82 Millionen Parametern, das auf StyleTTS 2 und ISTFTNet basiert. Es unterstützt 8 Sprachen und 54 Stimmen (darunter Französisch), läuft auf der CPU schneller als in Echtzeit und wurde ausschließlich mit lizenzgebührenfreien Audiodaten trainiert — Stimmenklonen ist nicht möglich, da kein Klonmodul veröffentlicht wurde. Beobachtete Kosten bei Nutzung über eine API: weniger als 1 $ pro Million Zeichen.

Die meisten guten Sprachsynthesesysteme laufen in der Cloud oder benötigen leistungsfähige Hardware. Kokoro ist ein sehr kleines offenes Modell (Repository hexgrad/Kokoro-82M, Lizenz Apache 2.0), das überzeugende Ergebnisse liefert und auf einem gewöhnlichen Rechner Sprache schneller als in Echtzeit erzeugt – auch ohne Grafikkarte. Sein Datenblatt beschreibt ungewöhnlich genau, was das Modell enthält, einschließlich der Herkunft der Trainingsdaten. Damit ist es eines der seltenen Sprachsynthesemodelle, bei denen sich jede Aussage überprüfen lässt, statt sie einfach glauben zu müssen.

Von Mohamed Meguedmi·Aktualisierung 2026-09-28·Unter Windows, macOS und Linux getestet

#Warum ein kleines Modell die Rechnung verändert

Die Qualität der Sprachsynthese ist schon seit einiger Zeit nicht mehr das Problem; die Kosten und die Frage, wo sie ausgeführt wird, dagegen schon. Online-Stimmen klingen sehr gut, setzen aber voraus, dass jeder von Ihrem System gesprochene Satz an einen Dienstleister übermittelt und nutzungsabhängig abgerechnet wird. Große lokale Modelle klingen gut und belegen eine Grafikkarte, die Sie lieber Ihrem Sprachmodell zur Verfügung stellen würden als der Stimme, die es sprechen lässt.

Ein Modell, das klein genug ist, um auf einem Prozessor in einer Sekunde ausgeführt zu werden, beseitigt beide Einschränkungen auf einmal. Ein langes Dokument laut vorzulesen, ist dann keine Budgetentscheidung mehr. Ein Assistent kann alle seine Antworten aussprechen statt nur der wichtigen. Eine Stapelverarbeitung kann über Nacht hundert Dateien auf Hardware vorlesen, die Sie bereits besitzen, ohne etwas an Dritte zu senden, auf ein Kontingent zu warten oder eine Rechnung im Blick behalten zu müssen, die mit dem verarbeiteten Volumen steigt.

#Das Modell in überprüften Zahlen

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
82 Millionen Parameter
Eine Größenordnung kleiner als die Modelle, mit denen es üblicherweise verglichen wird.
Architektur StyleTTS 2 + ISTFTNet
Ein „Decoder-only“-Design ohne Diffusion, was zum Teil erklärt, warum es so schlank ist.
8 Sprachen, 54 Stimmen (v1.0)
Veröffentlicht am 27. Januar 2025, trainiert auf einigen hundert Stunden Audio.
Gesamtkosten des Trainings: etwa 1.000 $
Insgesamt 1.000 Stunden Rechenzeit auf A100-GPUs mit 80 GB – im Vergleich zu konkurrierenden Modellen ein winziges Budget für dieses Ergebnis.
Ausschließlich frei nutzbare Daten
Gemeinfreie Audiodaten, Audiodaten unter permissiven Lizenzen oder synthetische Audiodaten von kommerziellen Anbietern mit geschlossenen Systemen – ausdrücklich niemals unautorisierte Stimmenklone oder Audiodaten eines anderen offenen Modells.

Dieser letzte Punkt verdient besondere Aufmerksamkeit: Die Modellbeschreibung nennt die Herkunft der Daten ausdrücklich, was in diesem Bereich selten ist. Das ist einer der Gründe, warum sich Kokoro ohne die rechtliche Unklarheit einsetzen lässt, die Modelle umgibt, die mit ohne Zustimmung beschafften oder geklonten Stimmen trainiert wurden – ein Punkt, der besonders für ein Projekt für die breite Öffentlichkeit in Frankreich zählt, wo das Persönlichkeitsrecht an der eigenen Stimme ernst genommen wird. Bei seiner Veröffentlichung erreichte Kokoro den ersten Platz in der Community-Rangliste TTS Spaces Arena, vor deutlich größeren Modellen: XTTS v2 (467 Millionen Parameter), MetaVoice (1,2 Milliarden) und Fish Speech (etwa 500 Millionen) wurden alle von einem Modell mit 82 Millionen Parametern übertroffen – eine Rangliste aus einem bestimmten Zeitpunkt, keine universelle Garantie, aber ein starkes Signal für das Verhältnis von Qualität zu Modellgröße für alle, die schnell entscheiden müssen, ohne zehn Modelle parallel laufen zu lassen.

#Was es tut und was es nicht tut

Tatsächliche Fähigkeiten
KapazitätKokoro
Natürliche Prosodie bei gewöhnlichem TextStark für seine Größe
Vordefinierte Stimmen54 Stimmen in 8 Sprachen, darunter Französisch (fr-fr)
Stimmenklonung aus einem SampleDies ist nicht sein Ziel: Kein Klonmodul wurde mit den Gewichten veröffentlicht
Fein abgestimmte emotionale SteuerungEingeschränkt
GeschwindigkeitSchneller als Echtzeit auf einfacher Hardware
Offline-BetriebJa, nachdem die Gewichte über pip install kokoro heruntergeladen wurden

Ehrlich formuliert: Es ist ein sehr guter Vorleser, kein Schauspieler. Für Erzählungen, Benachrichtigungen, einen Assistenten oder Barrierefreiheit ist das mehr als ausreichend. Für eine darstellerische Leistung, bei der eine bestimmte Ausdrucksabsicht zählt, brauchen Sie ein Werkzeug, das sich feiner steuern lässt. Was die Kosten angeht, liegt der beobachtete API-Preis bei rund 1 $ pro Million Eingabezeichen – etwa tausend Zeichen ergeben eine Minute Audio. Das ist auch bei lokaler Nutzung ein nützlicher Richtwert, um die tatsächlichen Kosten eines vergleichbaren Cloud-Abonnements über längere Zeit gegenüberzustellen.

#Seine Rolle in einer lokalen Verarbeitungskette

  1. 01
    Spracheingabe
    Ein Transkriptionsmodell wandelt die gesprochenen Worte des Benutzers in Text um; Faster-Whisper übernimmt diesen Schritt gut, auch ohne GPU.
  2. 02
    Das Modell denkt nach
    Ein lokales Modell erzeugt die Antwort und wird von Ollama oder einer anderen Engine bereitgestellt.
  3. 03
    Die Stimme wird ausgegeben
    Kokoro liest die Antwort über das Python-Paket kokoro vor, das die Phonemisierung durch die Bibliothek misaki nutzt und für bestimmte Wörter außerhalb des Wörterbuchs auf espeak-ng als Ersatz zurückgreift.

Das Latenzbudget muss immer als Ganzes betrachtet werden: Der Nutzer nimmt die Gesamtdauer wahr – erst Transkription, dann Generierung, dann Sprachsynthese. Die Sprachsynthese ist in der Regel der am wenigsten aufwendige der drei Schritte. Das bedeutet, dass die wahrgenommene Reaktionsgeschwindigkeit eines Sprachassistenten vor allem von der Geschwindigkeit Ihres Sprachmodells bestimmt wird, nicht von der Stimme, die die endgültige Antwort vorliest.

→
Geben Sie die Sprachausgabe nach und nach aus, während der Text entsteht
Auf die vollständige Antwort zu warten, bevor die Sprachausgabe beginnt, verschenkt die Sekunden, die das Modell für ihre Erzeugung gebraucht hat. Die Sprache Satz für Satz zu synthetisieren, während der Text eintrifft, lässt das System erheblich reaktionsfreudiger wirken, ohne dass es tatsächlich schneller wird.

#Drei konkrete Anwendungen auf Französisch

Die fr-fr-Stimme von Kokoro macht das Modell direkt für ein französischsprachiges Publikum nutzbar, ohne auf eine englische Stimme mit schlechter Aussprache oder einen nutzungsabhängig abgerechneten Drittanbieterdienst zurückgreifen zu müssen. Drei Anwendungsfälle kommen bei den Projekten, die das Modell einsetzen, am häufigsten vor.

Vorlesen langer Dokumente
Berichte, Artikel, Notizen zur laufenden Recherche: Ein mehrseitiges Dokument vorlesen zu lassen, kostet nur noch etwas Prozessorzeit statt eines Abonnements für eine API, die pro Zeichen abrechnet.
Sprachassistent für den privaten oder beruflichen Einsatz
In Kombination mit Whisper für die Spracherkennung und einem lokalen LLM für das Nachdenken schließt Kokoro den Kreislauf, ohne dass eine Unterhaltung das lokale Netzwerk verlässt.
Barrierefreiheit und Benachrichtigungen
Vorlesen von Bildschirminhalten, Sprachwarnungen, Bestätigung von Aktionen: Anwendungen, bei denen Latenz und Offline-Verfügbarkeit wichtiger sind als die Nuancen der Interpretation.

In allen drei Fällen ändert sich die Kostenbetrachtung grundlegend: An die Stelle der bei jedem Aufruf berechneten Kosten pro Zeichen treten Stromverbrauch und Prozessorzeit einer Maschine, die Sie bereits besitzen. Bei großen Mengen vorzulesenden Textes – von der täglichen Dokumentenrecherche bis zum sprachbasierten Kundendienst – wächst der Kostenvorteil der lokalen Verarbeitung schnell, zumal die Sprachausgabe selbst ohne dedizierte Grafikkarte schneller als in Echtzeit erzeugt wird.

#Kokoro oder Piper

Zwei unterschiedliche Prioritäten
KokoroPiper
AusgabequalitätÜberlegen, natürlichere ProsodieGut, flacher
Speicherbedarf82 Millionen Parameter, ein einziges ModellSehr klein, ein ONNX-Modell pro Stimme (VITS)
Geschwindigkeit auf der CPUSchnellExtrem schnell, für Hardware mit stark begrenzten Ressourcen konzipiert
Sprachabdeckung8 Sprachen, 54 Stimmen (v1.0)44 Sprachen/Sprachvarianten in der offiziellen Stimmenliste
LizenzApache 2.0, einheitlich für alle StimmenGPL-3.0 im aktiven Repository; MIT im alten, inzwischen archivierten Repository
Wann die Wahl sinnvoll istDie Qualität ist entscheidendDer Ressourcenbedarf, die Latenz oder eine Stimme für eine bestimmte Sprach- und Regionsvariante haben Vorrang

Die Lizenzfrage bei Piper sollte geprüft werden, bevor Sie sich darauf festlegen: Das ursprüngliche Repository rhasspy/piper unter MIT-Lizenz ist inzwischen archiviert und schreibgeschützt. Die aktive Entwicklung ist zu OHF-Voice/piper1-gpl gewechselt, das von der Open Home Foundation unter GPL-3.0 gepflegt wird – für die kommerzielle Nutzung ein wesentlicher Unterschied gegenüber Tutorials, die weiterhin die MIT-Lizenz des alten Repositorys nennen. Die offizielle Piper-Dokumentation weist außerdem darauf hin, dass einzelne Stimmen restriktivere Lizenzen haben können als die Engine: Das ist für jede Stimme einzeln zu prüfen, nicht nur auf Projektebene. Piper ist weiterhin anders aufgebaut als Kokoro: Jede Stimme ist ein eigenständiges VITS-Modell, das nach ONNX exportiert wurde, mit einer .onnx-Datei und einer .onnx.json-Konfigurationsdatei, während Kokoro seine 54 Stimmen über einen einzigen gemeinsamen Satz von Modellgewichten bereitstellt.

#Lizenz und Ethik

Zwei Fragen entscheiden darüber, ob ein Sprachsynthesemodell in Ihrem Projekt einsetzbar ist, und nur eine davon ist technischer Natur. Die erste betrifft die Lizenz für die Gewichte und Stimmen, die die kommerzielle Nutzung regelt: Bei Kokoro ist das Apache 2.0, eine permissive und eindeutige Lizenz, die alle 54 Stimmen gemeinsam abdeckt. Das gilt nicht für alle Sprachsynthese-Engines; das naheliegendste Beispiel ist Piper mit seinem jüngsten Wechsel zu GPL-3.0. Der zweite Punkt ist, dass ein Modell mit vordefinierten Stimmen die Frage der Einwilligung vollständig vermeidet, während das Klonen der Stimme einer Person anhand einer Aufnahme deren Zustimmung erfordert und in einer wachsenden Zahl von Rechtsordnungen rechtliche Konsequenzen mit sich bringt. Die Modellkarte von Kokoro ist ausdrücklich: Zusammen mit den Gewichten wurde kein Modul zum Stimmenklonen veröffentlicht. Diese Nutzung wird somit bereits durch die technische Ausgestaltung ausgeschlossen und nicht lediglich durch Nutzungsrichtlinien.

Für ein französisches Projekt vereinfacht diese Kombination vieles: Es muss kein Lizenzvertrag für die Stimme ausgehandelt werden, es gibt keine reale Person, deren Zustimmung eingeholt werden muss, und die Apache-2.0-Lizenz wirft keine Fragen hinsichtlich des Weiterverkaufs oder der Integration in ein kostenpflichtiges Produkt auf. Der einzige verbleibende Punkt, auf den Sie achten müssen, ist rein technischer Natur: Prüfen, ob die gewählte französische Stimme bei den tatsächlichen Texten des Projekts richtig klingt, einschließlich Akzenten und Kürzeln, bevor sie in großem Umfang eingesetzt wird.

#FAQ

Ist Kokoro kommerziell nutzbar?+
Ja. Kokoro-82M wird unter der Apache-2.0-Lizenz veröffentlicht, einer der permissivsten offenen Lizenzen. Laut seiner Modellseite kann es „überall eingesetzt werden, von Produktionsumgebungen bis zu persönlichen Projekten“. Es werden weder Lizenzgebühren noch zusätzliche Namensnennungen über die üblichen Apache-Bedingungen hinaus verlangt; das gilt für alle 54 Stimmen zusammen.
Braucht man eine Grafikkarte?+
Nein. Mit seinen 82 Millionen Parametern ist die Generierung auf der CPU praktikabel und auf gewöhnlicher Hardware in der Regel schneller als in Echtzeit. Eine GPU hilft bei der Stapelverarbeitung großer Datenmengen, ist aber für die interaktive Nutzung in einem Sprachassistenten nicht erforderlich.
Kann es meine Stimme klonen?+
Nein, und das ist eine bewusste Designentscheidung: Die Modellkarte bestätigt, dass kein Modul zum Stimmenklonen zusammen mit den Gewichten veröffentlicht wurde. Stattdessen bietet das Modell 54 vordefinierte Stimmen in 8 Sprachen. Stimmenklonen gehört zu einer anderen Modellklasse und wirft Fragen der Einwilligung auf, die sich mit vordefinierten Stimmen vollständig vermeiden lassen.
Kokoro oder Piper?+
Kokoro für eine natürlichere Ausgabe mit 82 Millionen Parametern; Piper, wenn ein möglichst geringer Ressourcenbedarf und die niedrigste Latenz Vorrang haben, typischerweise auf eingebetteter Hardware. Beide funktionieren vollständig offline, aber prüfen Sie die Lizenz: Kokoro steht unter Apache 2.0, während die aktiv gepflegte Variante von Piper auf GPL-3.0 umgestellt wurde.
Welche Sprachen werden unterstützt, und gehört Französisch dazu?+
Ja: Version 1.0 umfasst 8 Sprachen und 54 Stimmen, darunter amerikanisches und britisches Englisch, Spanisch, Französisch, Hindi, Italienisch, Japanisch, brasilianisches Portugiesisch und Mandarin. Prüfen Sie die genaue Verfügbarkeit der Stimmen pro Sprache in der Datei VOICES.md des Modells, bevor Sie sich auf eine bestimmte Stimme festlegen.
Woher stammen die Trainingsdaten von Kokoro?+
Aus einigen Hundert Stunden Audiomaterial, ausschließlich gemeinfrei, unter einer freizügigen Lizenz oder synthetisch von kommerziellen Anbietern mit geschlossenen Systemen erzeugt — ausdrücklich niemals aus einem anderen offenen Modell oder einem nicht autorisierten Stimmenklon, laut der auf der Modellkarte veröffentlichten Herkunftserklärung.
Wie hoch sind die tatsächlichen Kosten im Vergleich zu einer Cloud-API?+
Bei lokalem Betrieb fallen als einzige laufende Kosten Stromkosten an, und zwar für ein Modell mit 82 Millionen Parametern, das auf einem Prozessor in wenigen Sekunden läuft. Als Orientierung liegt der beobachtete Marktpreis für Kokoro über eine API bei etwa 1 US-Dollar pro Million Zeichen; diese Zahl bietet einen hilfreichen Vergleich, bevor Sie sich zwischen Selbsthosting und einem Drittanbieter-Dienst entscheiden.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.