Automatischer Sitzungsbericht: Whisper + LLM 100 % lokal
Ein KI-gestütztes Besprechungsprotokoll besteht aus zwei Bausteinen: das Audio transkribieren und anschließend den Text zusammenfassen. Das Problem ist, dass die meisten SaaS-Tools die vollständige Aufzeichnung Ihrer Besprechung – Namen, Zahlen, Strategie – an Server Dritter senden. Dieser Leitfaden setzt dieselbe Pipeline vollständig lokal um: Whisper für die Transkription, ein über Ollama betriebenes LLM zum Extrahieren von Entscheidungen und Aufgaben – ohne dass etwas Ihren Rechner verlässt.
#Warum lokale Verarbeitung bei sensiblen Besprechungen die beste Wahl ist
Eine Besprechungsaufzeichnung ist keine harmlose Datei. In einer Stunde Aufnahme finden sich Kundennamen, Beträge, Personalentscheidungen, noch nicht angekündigte strategische Ausrichtungen für Produkte und manchmal personenbezogene Daten im Sinne der DSGVO. Diese Audioaufnahme einem Cloud-Dienst für automatische Besprechungsprotokolle anzuvertrauen, bedeutet zu akzeptieren, dass all diese Inhalte an einen Dritten übertragen, von ihm verarbeitet und möglicherweise gespeichert werden.
- Echte Vertraulichkeit
- Audio und Transkription bleiben auf Ihrem Rechner. Keine betrieblichen Daten werden über einen externen Server geleitet, der sie protokollieren oder zum Training verwenden könnte.
- Vereinfachte DSGVO-Konformität
- Keine Übermittlung an einen Auftragsverarbeiter, der sich häufig außerhalb der EU befindet. Der Aspekt „Übermittlung personenbezogener Daten“ entfällt damit von vornherein in Ihrer Datenschutz-Folgenabschätzung.
- Keine laufenden Kosten
- Kein Abonnement pro Benutzer und keine Minutengebühren für transkribierte Inhalte. Sobald die Maschine eingerichtet ist, können Sie so viele Meetings wie gewünscht verarbeiten.
- Offline-Funktionalität
- Unterwegs, an einem Standort ohne zuverlässige Verbindung oder bei einer Besprechung in einem abgeschiedenen Raum: Die Verarbeitung bleibt auch ohne Internet verfügbar.
#Das Prinzip der zweistufigen Pipeline
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Die Erstellung eines KI-gestützten Besprechungsprotokolls gliedert sich immer in zwei getrennte Schritte, die nicht verwechselt werden dürfen. Der erste wandelt Ton in Text um: Das ist die Aufgabe von Whisper, dem Spracherkennungsmodell von OpenAI, von dem mehrere Open-Source-Implementierungen problemlos lokal laufen. Der zweite wandelt diesen Rohtext in ein strukturiertes Dokument um: Das ist die Aufgabe eines lokalen LLM, das von Ollama bereitgestellt wird.
- Transkription (Whisper)
- Eingabe: eine Audio- oder Videodatei. Ausgabe: der vollständige Text der Besprechung, gegebenenfalls mit Zeitstempeln. Das ist rechenintensiv, läuft aber mechanisch ab.
- Zusammenfassung (Ollama-LLM)
- Eingabe: das Transkript. Ausgabe: ein Protokoll – Zusammenfassung, getroffene Entscheidungen und anstehende Maßnahmen mit den jeweils Verantwortlichen. Hier macht der Prompt den entscheidenden Unterschied.
Die beiden Schritte zu trennen bietet einen praktischen Vorteil: Sie können die Zusammenfassung mit unterschiedlichen Prompts beliebig oft erneut erstellen, ohne die Transkription wiederholen zu müssen, die der langsamste Teil ist.
#Voraussetzungen
- Ollama installiert
- Der Daemon lauscht standardmäßig auf http://localhost:11434. Falls Sie Ollama noch nicht installiert haben, lesen Sie die Anleitung zur Installation von Ollama, die unten auf der Seite aufgeführt ist.
- Ein LLM zum Zusammenfassen
- Ein Modell mit 9 bis 12 Milliarden Parametern in Q4_K_M (≈7 GB VRAM), das Französisch gut beherrscht, reicht völlig aus. Qwen 3.5 9B (256k Kontext, ideal für lange Transkripte) oder Gemma 4 12B sind hervorragende Optionen für strukturierte Zusammenfassungen.
- Whisper
- Eine lokale Implementierung: openai-whisper (einfach), faster-whisper (schnell) oder whisper.cpp (leicht, ohne GPU). Dieser Leitfaden verwendet die ersten beiden.
- ffmpeg
- Unverzichtbar zum Einlesen von Videoformaten (mp4 von Teams/Zoom) und zum Konvertieren von Audio. Whisper greift im Hintergrund darauf zurück.
- Hardware
- Eine GPU beschleunigt Whisper erheblich, aber medium läuft auch auf der CPU (langsamer). Rechnen Sie mit etwa 2 GB VRAM für das Modell small und mehr für large-v3.
#Schritt 1: Die Audioaufnahme der Besprechung mit Whisper transkribieren
Der direkteste Weg zur Installation führt über das Paket openai-whisper, das einen sofort einsatzbereiten Befehlszeilenbefehl bereitstellt. Installieren Sie es in einer Python-Umgebung und installieren Sie ffmpeg auf Systemebene.
Für die Transkription genügt anschließend ein einziger Befehl. Dabei werden das Modell, die Sprache (eine feste Vorgabe verhindert Fehler bei der Spracherkennung in kurzen Besprechungen) und das Textausgabeformat angegeben.
Sie erhalten eine Datei reunion.txt, die die gesamte Besprechung enthält. Wenn Sie auch Untertitel mit Zeitstempeln möchten (nützlich, um eine Passage wiederzufinden), fügen Sie --output_format srt hinzu, oder verwenden Sie all, um alles auf einmal zu generieren.
Bei einer einstündigen Besprechung kann die Transkription auf der CPU lange dauern. Hier kommt faster-whisper ins Spiel: eine Neuimplementierung, die CTranslate2 nutzt und bei gleicher Qualität deutlich schneller ist. Hier ist ein Python-Skript, das transkribiert und den Text speichert.
#Eine Teams- oder Zoom-Aufzeichnung verarbeiten
Teams- und Zoom-Aufnahmen sind .mp4-Videodateien (manchmal .m4a-Dateien für reine Audioaufnahmen). Whisper kann sie direkt lesen, da es ffmpeg nutzt. Die Audiospur zuerst in Mono mit 16 kHz zu extrahieren, ist jedoch zuverlässiger und schneller – insbesondere bei whisper.cpp, das dies voraussetzt.
- -ar 16000
- Wandelt die Abtastrate auf 16 kHz um, die von Whisper erwartete Frequenz. 48 kHz beizubehalten ist unnötig: Sprache benötigt das nicht.
- -ac 1
- Führt die Kanäle zu einem Monosignal zusammen. Für die Transkription bietet es keinen Vorteil, eine Besprechungsaufnahme in Stereo zu belassen.
- -c:a pcm_s16le
- Gibt unkomprimiertes WAV aus, das sicherste Eingabeformat für Whisper.
Wo finden Sie die Datei? Bei Teams landen die Aufnahmen in OneDrive/SharePoint (Ordner „Recordings“): Laden Sie die .mp4-Datei vor der Verarbeitung lokal herunter. Bei Zoom befindet sich die lokale Aufnahme im Ordner Documents/Zoom, mit einer separaten Datei audio.m4a, wenn die entsprechende Option aktiviert ist – verwenden Sie direkt diese Audiodatei, ohne den Umweg über die Videodatei.
#Schritt 2: die Zusammenfassung durch ein lokales LLM
Die rohe Transkription ist unleserlich: keine zuverlässige Zeichensetzung, keinerlei Struktur, Wiederholungen. Das lokale LLM verwandelt sie in einen nutzbaren Bericht. Dazu wird der Text mit präzisen Anweisungen zum erwarteten Ausgabeformat an Ollama gesendet.
Am einfachsten zum Testen: das Transkript per Pipe an ollama run übergeben. Das Modell erhält den Prompt, gefolgt vom Text der Besprechung.
Für eine regelmäßige Nutzung empfiehlt sich die REST-API von Ollama auf Port 11434: Sie trennt die Systemnachricht (Rolle und Format) sauber vom Inhalt (Transkription) und macht das Ergebnis in einem Skript wiederverwendbar.
#Der Prompt, der Entscheidungen und Maßnahmen übersichtlich ausgibt
Das ist das Herzstück eines guten KI-generierten Besprechungsprotokolls. Ein vager Prompt liefert eine lange Zusammenfassung als Textblock; ein strukturierter Prompt liefert ein direkt nutzbares Dokument. Entscheidend ist, ein ausdrückliches, in Abschnitte gegliedertes Ausgabeformat vorzugeben und das Modell aufzufordern, klar zwischen bereits getroffenen Entscheidungen und noch offenen Aufgaben zu unterscheiden.
- Ein vorgegebenes Format
- Die Abschnittsüberschriften (##) zwingen das Modell, die Informationen zu ordnen, statt alles zu vermischen. So erhalten Sie von einer Besprechung zur nächsten eine einheitliche Ausgabe.
- Die Anti-Halluzinations-Regel
- „Übernehmen Sie nur das, was tatsächlich gesagt wird“ und „nicht angegeben“ verringern das Risiko erheblich, dass das LLM eine Frist oder eine verantwortliche Person erfindet, die es nicht gibt.
- Die verantwortliche Person in eckigen Klammern
- Wenn [Verantwortlicher] systematisch am Anfang jeder Maßnahme steht, lässt sich das Protokoll direkt in die Tat umsetzen – auf einen Blick ist klar, wer was erledigt.
#Die gesamte Pipeline automatisieren
Sobald beide Schritte erfolgreich überprüft wurden, werden sie in einem einzigen Skript hintereinander ausgeführt: Geben Sie dem Skript eine Besprechungsdatei, und es erstellt das Protokoll in Markdown. So wird aus dem manuellen Ablauf ein Werkzeug für den täglichen Gebrauch.
Passen Sie synthese.py so an, dass das Skript die als Argument übergebene Datei liest und das Ergebnis auf die Standardausgabe schreibt. Damit erhalten Sie einen einzigen Befehl: ./compte-rendu.sh reunion_teams.mp4, und das Besprechungsprotokoll im Markdown-Format erscheint wenige Minuten später, ohne dass auch nur ein einziges Byte den Rechner verlassen hat.
#Fehlerbehebung
- Transkription, die ins Englische wechselt
- Whisper hat die Sprache wegen eines stillen oder zweisprachigen Anfangs falsch erkannt. Erzwingen Sie immer --language French (oder language="fr").
- Falsch geschriebene Eigennamen
- Das ist normal: Whisper erschließt Wörter anhand ihres Klangs. Ergänzen Sie den Prompt für die Zusammenfassung um einen kurzen Korrekturdurchgang („korrigiere offensichtlich falsch transkribierte Namen“) oder stellen Sie dem LLM ein Glossar der Namen bereit.
- Besprechung zu lang für das Kontextfenster
- Teilen Sie die Transkription in Blöcke von etwa 3.000 Wörtern auf, fassen Sie jeden zusammen und erstellen Sie anschließend eine Synthese der Zusammenfassungen. Erhöhen Sie auch num_ctx im Ollama-Aufruf, sofern Ihr VRAM dies zulässt.
- Whisper sehr langsam
- Wechseln Sie zu faster-whisper, aktivieren Sie vad_filter, verwenden Sie ein kleineres Modell (medium → small) oder wechseln Sie zur GPU. whisper.cpp ist ebenfalls eine gute Option auf Rechnern ohne GPU.
- Sich überlagernde Stimmen
- Whisper unterscheidet die Sprecher nicht. Für ein Protokoll nach dem Muster „wer hat was gesagt“ muss im Vorfeld ein Diarisierungsschritt (z. B. mit pyannote) hinzugefügt werden – ein Thema für sich.
#Weiterführende Informationen
Dieser Leitfaden kombiniert zwei Bausteine, die auf dieser Website bereits ausführlich behandelt wurden. Um die einzelnen Schritte zu vertiefen oder das Gesamtsystem abzusichern:
- Whisper + Ollama: Transkriptions- und Zusammenfassungspipeline 100 % lokal
- Der Referenzleitfaden zur Audiokomponente, mit den verschiedenen Whisper-Implementierungen und einem durchgängigen Beispiel anhand einer einstündigen Besprechung.
- Quantisierung wählen (Q4, Q5, Q8, FP16)
- Damit ein Zusammenfassungsmodell mit 14B oder 32B Parametern in den Speicher Ihrer GPU passt, ohne die Qualität des Sitzungsprotokolls zu beeinträchtigen.
- Lokale LLMs und DSGVO: Datenschutzkonformität im Unternehmen
- Die regulatorische Ergänzung: Die lokale Verarbeitung von Besprechungen erleichtert die Einhaltung der Vorschriften; dieser Leitfaden erläutert, was noch dokumentiert werden muss.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.