Mittelstufe 12 Min.Desktop

Automatischer Sitzungsbericht: Whisper + LLM 100 % lokal

Ein KI-gestütztes Besprechungsprotokoll besteht aus zwei Bausteinen: das Audio transkribieren und anschließend den Text zusammenfassen. Das Problem ist, dass die meisten SaaS-Tools die vollständige Aufzeichnung Ihrer Besprechung – Namen, Zahlen, Strategie – an Server Dritter senden. Dieser Leitfaden setzt dieselbe Pipeline vollständig lokal um: Whisper für die Transkription, ein über Ollama betriebenes LLM zum Extrahieren von Entscheidungen und Aufgaben – ohne dass etwas Ihren Rechner verlässt.

Von Marie L.·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum lokale Verarbeitung bei sensiblen Besprechungen die beste Wahl ist

Eine Besprechungsaufzeichnung ist keine harmlose Datei. In einer Stunde Aufnahme finden sich Kundennamen, Beträge, Personalentscheidungen, noch nicht angekündigte strategische Ausrichtungen für Produkte und manchmal personenbezogene Daten im Sinne der DSGVO. Diese Audioaufnahme einem Cloud-Dienst für automatische Besprechungsprotokolle anzuvertrauen, bedeutet zu akzeptieren, dass all diese Inhalte an einen Dritten übertragen, von ihm verarbeitet und möglicherweise gespeichert werden.

Echte Vertraulichkeit
Audio und Transkription bleiben auf Ihrem Rechner. Keine betrieblichen Daten werden über einen externen Server geleitet, der sie protokollieren oder zum Training verwenden könnte.
Vereinfachte DSGVO-Konformität
Keine Übermittlung an einen Auftragsverarbeiter, der sich häufig außerhalb der EU befindet. Der Aspekt „Übermittlung personenbezogener Daten“ entfällt damit von vornherein in Ihrer Datenschutz-Folgenabschätzung.
Keine laufenden Kosten
Kein Abonnement pro Benutzer und keine Minutengebühren für transkribierte Inhalte. Sobald die Maschine eingerichtet ist, können Sie so viele Meetings wie gewünscht verarbeiten.
Offline-Funktionalität
Unterwegs, an einem Standort ohne zuverlässige Verbindung oder bei einer Besprechung in einem abgeschiedenen Raum: Die Verarbeitung bleibt auch ohne Internet verfügbar.
i
Auch bei lokaler Verarbeitung müssen Sie die Beteiligten informieren
Auch für die Aufzeichnung einer Besprechung gelten Regeln: Informieren Sie die Teilnehmenden und holen Sie ihre Zustimmung ein. Der lokale Betrieb löst die Frage der Datenübertragung, nicht die der Einwilligung in die Aufzeichnung.

#Das Prinzip der zweistufigen Pipeline

Das Kit Lokale KI

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Die Erstellung eines KI-gestützten Besprechungsprotokolls gliedert sich immer in zwei getrennte Schritte, die nicht verwechselt werden dürfen. Der erste wandelt Ton in Text um: Das ist die Aufgabe von Whisper, dem Spracherkennungsmodell von OpenAI, von dem mehrere Open-Source-Implementierungen problemlos lokal laufen. Der zweite wandelt diesen Rohtext in ein strukturiertes Dokument um: Das ist die Aufgabe eines lokalen LLM, das von Ollama bereitgestellt wird.

Transkription (Whisper)
Eingabe: eine Audio- oder Videodatei. Ausgabe: der vollständige Text der Besprechung, gegebenenfalls mit Zeitstempeln. Das ist rechenintensiv, läuft aber mechanisch ab.
Zusammenfassung (Ollama-LLM)
Eingabe: das Transkript. Ausgabe: ein Protokoll – Zusammenfassung, getroffene Entscheidungen und anstehende Maßnahmen mit den jeweils Verantwortlichen. Hier macht der Prompt den entscheidenden Unterschied.

Die beiden Schritte zu trennen bietet einen praktischen Vorteil: Sie können die Zusammenfassung mit unterschiedlichen Prompts beliebig oft erneut erstellen, ohne die Transkription wiederholen zu müssen, die der langsamste Teil ist.

#Voraussetzungen

Ollama installiert
Der Daemon lauscht standardmäßig auf http://localhost:11434. Falls Sie Ollama noch nicht installiert haben, lesen Sie die Anleitung zur Installation von Ollama, die unten auf der Seite aufgeführt ist.
Ein LLM zum Zusammenfassen
Ein Modell mit 9 bis 12 Milliarden Parametern in Q4_K_M (≈7 GB VRAM), das Französisch gut beherrscht, reicht völlig aus. Qwen 3.5 9B (256k Kontext, ideal für lange Transkripte) oder Gemma 4 12B sind hervorragende Optionen für strukturierte Zusammenfassungen.
Whisper
Eine lokale Implementierung: openai-whisper (einfach), faster-whisper (schnell) oder whisper.cpp (leicht, ohne GPU). Dieser Leitfaden verwendet die ersten beiden.
ffmpeg
Unverzichtbar zum Einlesen von Videoformaten (mp4 von Teams/Zoom) und zum Konvertieren von Audio. Whisper greift im Hintergrund darauf zurück.
Hardware
Eine GPU beschleunigt Whisper erheblich, aber medium läuft auch auf der CPU (langsamer). Rechnen Sie mit etwa 2 GB VRAM für das Modell small und mehr für large-v3.
→
Welches Whisper-Modell wählen?
Für Französisch liefert small bei einer sauberen Audioaufnahme bereits gute Ergebnisse. Wechseln Sie bei einer Besprechung mit mehreren Sprechern oder mäßiger Tonqualität zu medium und zu large-v3, wenn die Transkriptionsqualität wichtiger ist als die Geschwindigkeit (Akzente, Fachjargon, überlappende Sprachbeiträge).

#Schritt 1: Die Audioaufnahme der Besprechung mit Whisper transkribieren

Der direkteste Weg zur Installation führt über das Paket openai-whisper, das einen sofort einsatzbereiten Befehlszeilenbefehl bereitstellt. Installieren Sie es in einer Python-Umgebung und installieren Sie ffmpeg auf Systemebene.

Installation
# ffmpeg (Debian/Ubuntu)
sudo apt install ffmpeg

# Whisper (dans un venv de préférence)
pip install -U openai-whisper

Für die Transkription genügt anschließend ein einziger Befehl. Dabei werden das Modell, die Sprache (eine feste Vorgabe verhindert Fehler bei der Spracherkennung in kurzen Besprechungen) und das Textausgabeformat angegeben.

Terminal
whisper reunion.mp3 \
  --model medium \
  --language French \
  --output_format txt \
  --output_dir ./transcriptions

Sie erhalten eine Datei reunion.txt, die die gesamte Besprechung enthält. Wenn Sie auch Untertitel mit Zeitstempeln möchten (nützlich, um eine Passage wiederzufinden), fügen Sie --output_format srt hinzu, oder verwenden Sie all, um alles auf einmal zu generieren.

Bei einer einstündigen Besprechung kann die Transkription auf der CPU lange dauern. Hier kommt faster-whisper ins Spiel: eine Neuimplementierung, die CTranslate2 nutzt und bei gleicher Qualität deutlich schneller ist. Hier ist ein Python-Skript, das transkribiert und den Text speichert.

transcrire.py
from faster_whisper import WhisperModel

# device="cuda" si GPU NVIDIA, sinon "cpu"
model = WhisperModel("medium", device="cuda", compute_type="float16")

segments, info = model.transcribe(
    "reunion.mp3",
    language="fr",
    vad_filter=True,   # coupe les silences, gagne du temps
)

with open("reunion.txt", "w", encoding="utf-8") as f:
    for seg in segments:
        f.write(seg.text.strip() + "\n")

print(f"Langue détectée : {info.language} — durée : {info.duration:.0f}s")
→
Die Option vad_filter
Der VAD-Filter (Erkennung von Sprachaktivität) entfernt Sprechpausen und Stille vor der Transkription. Bei einer echten Besprechung mit vielen Pausen und Leerlaufzeiten beschleunigt er die Verarbeitung deutlich, ohne die Qualität des relevanten Textes zu beeinträchtigen.

#Eine Teams- oder Zoom-Aufzeichnung verarbeiten

Teams- und Zoom-Aufnahmen sind .mp4-Videodateien (manchmal .m4a-Dateien für reine Audioaufnahmen). Whisper kann sie direkt lesen, da es ffmpeg nutzt. Die Audiospur zuerst in Mono mit 16 kHz zu extrahieren, ist jedoch zuverlässiger und schneller – insbesondere bei whisper.cpp, das dies voraussetzt.

Audio aus der .mp4-Datei extrahieren
ffmpeg -i reunion_teams.mp4 \
  -ar 16000 -ac 1 \
  -c:a pcm_s16le \
  reunion.wav
-ar 16000
Wandelt die Abtastrate auf 16 kHz um, die von Whisper erwartete Frequenz. 48 kHz beizubehalten ist unnötig: Sprache benötigt das nicht.
-ac 1
Führt die Kanäle zu einem Monosignal zusammen. Für die Transkription bietet es keinen Vorteil, eine Besprechungsaufnahme in Stereo zu belassen.
-c:a pcm_s16le
Gibt unkomprimiertes WAV aus, das sicherste Eingabeformat für Whisper.

Wo finden Sie die Datei? Bei Teams landen die Aufnahmen in OneDrive/SharePoint (Ordner „Recordings“): Laden Sie die .mp4-Datei vor der Verarbeitung lokal herunter. Bei Zoom befindet sich die lokale Aufnahme im Ordner Documents/Zoom, mit einer separaten Datei audio.m4a, wenn die entsprechende Option aktiviert ist – verwenden Sie direkt diese Audiodatei, ohne den Umweg über die Videodatei.

!
Verarbeiten Sie die Daten nicht über einen SaaS-Cloud-Dienst
Die ganze Idee des lokalen Betriebs wird hinfällig, wenn Sie die KI des Anbieters (Teams Premium, Zoom AI Companion) das Besprechungsprotokoll auf dem Server erstellen lassen. Laden Sie die Rohdatei herunter und verarbeiten Sie sie auf Ihrem eigenen Rechner: Nur so können Sie garantieren, dass keine Daten nach außen gelangen.

#Schritt 2: die Zusammenfassung durch ein lokales LLM

Die rohe Transkription ist unleserlich: keine zuverlässige Zeichensetzung, keinerlei Struktur, Wiederholungen. Das lokale LLM verwandelt sie in einen nutzbaren Bericht. Dazu wird der Text mit präzisen Anweisungen zum erwarteten Ausgabeformat an Ollama gesendet.

Am einfachsten zum Testen: das Transkript per Pipe an ollama run übergeben. Das Modell erhält den Prompt, gefolgt vom Text der Besprechung.

Kurzübersicht
ollama run qwen3.5:9b "Résume ce compte rendu de réunion en français, \
en listant les points clés, les décisions et les actions à mener. \
Voici la transcription :

$(cat reunion.txt)"

Für eine regelmäßige Nutzung empfiehlt sich die REST-API von Ollama auf Port 11434: Sie trennt die Systemnachricht (Rolle und Format) sauber vom Inhalt (Transkription) und macht das Ergebnis in einem Skript wiederverwendbar.

synthese.py
import requests

transcript = open("reunion.txt", encoding="utf-8").read()

SYSTEM = """Tu es un assistant qui rédige des comptes rendus de réunion clairs et concis en français.
Tu ne inventes rien : tu ne t'appuies que sur la transcription fournie."""

resp = requests.post("http://localhost:11434/api/chat", json={
    "model": "qwen3.5:9b",
    "stream": False,
    "messages": [
        {"role": "system", "content": SYSTEM},
        {"role": "user", "content": PROMPT + "\n\n---\n" + transcript},
    ],
})

print(resp.json()["message"]["content"])
i
Auf das Kontextfenster achten
Eine einstündige Besprechung ergibt leicht 8.000 bis 12.000 Wörter. Prüfen Sie, ob das Kontextfenster des Modells groß genug ist (num_ctx). Wenn die Transkription diese Kapazität überschreitet, teilen Sie sie in Abschnitte auf und fassen Sie diese einzeln zusammen, bevor Sie eine abschließende Gesamtsynthese erstellen – eine kleine Map-Reduce-Pipeline.

#Der Prompt, der Entscheidungen und Maßnahmen übersichtlich ausgibt

Das ist das Herzstück eines guten KI-generierten Besprechungsprotokolls. Ein vager Prompt liefert eine lange Zusammenfassung als Textblock; ein strukturierter Prompt liefert ein direkt nutzbares Dokument. Entscheidend ist, ein ausdrückliches, in Abschnitte gegliedertes Ausgabeformat vorzugeben und das Modell aufzufordern, klar zwischen bereits getroffenen Entscheidungen und noch offenen Aufgaben zu unterscheiden.

Prompt zur Zusammenfassung
À partir de la transcription de réunion ci-dessous, produis un compte rendu structuré en français, en respectant EXACTEMENT ce format :

## Résumé
Trois à cinq phrases sur l'objet et les conclusions de la réunion.

## Décisions prises
- Une puce par décision actée, formulée clairement.

## Actions à mener
- [Responsable] Action précise — échéance si mentionnée.

## Points en suspens
- Sujets évoqués sans conclusion, à traiter plus tard.

Règles :
- Ne reprends que ce qui est réellement dit dans la transcription.
- Si le responsable ou l'échéance d'une action n'est pas mentionné, écris « non précisé ».
- Reste factuel, pas de reformulation marketing.
Ein vorgegebenes Format
Die Abschnittsüberschriften (##) zwingen das Modell, die Informationen zu ordnen, statt alles zu vermischen. So erhalten Sie von einer Besprechung zur nächsten eine einheitliche Ausgabe.
Die Anti-Halluzinations-Regel
„Übernehmen Sie nur das, was tatsächlich gesagt wird“ und „nicht angegeben“ verringern das Risiko erheblich, dass das LLM eine Frist oder eine verantwortliche Person erfindet, die es nicht gibt.
Die verantwortliche Person in eckigen Klammern
Wenn [Verantwortlicher] systematisch am Anfang jeder Maßnahme steht, lässt sich das Protokoll direkt in die Tat umsetzen – auf einen Blick ist klar, wer was erledigt.
→
Testen Sie mehrere Modelle an derselben Transkription
Da die Transkription bereits vorliegt, kostet der Vergleich der Modelle nichts: Lassen Sie die Zusammenfassung derselben Datei reunion.txt erneut erstellen, zuerst mit Qwen 3.5 9B, dann mit Gemma 4 12B. Sie werden schnell sehen, welches Modell die Maßnahmen auf Französisch besser strukturiert.

#Die gesamte Pipeline automatisieren

Sobald beide Schritte erfolgreich überprüft wurden, werden sie in einem einzigen Skript hintereinander ausgeführt: Geben Sie dem Skript eine Besprechungsdatei, und es erstellt das Protokoll in Markdown. So wird aus dem manuellen Ablauf ein Werkzeug für den täglichen Gebrauch.

compte-rendu.sh
#!/usr/bin/env bash
set -euo pipefail

INPUT="$1"                 # reunion.mp4 ou reunion.mp3
BASE="$(basename "${INPUT%.*}")"

# 1. Extraire l'audio en 16 kHz mono
ffmpeg -y -i "$INPUT" -ar 16000 -ac 1 -c:a pcm_s16le "$BASE.wav"

# 2. Transcrire
whisper "$BASE.wav" --model medium --language French \
  --output_format txt --output_dir .

# 3. Synthétiser avec le LLM local
python synthese.py "$BASE.txt" > "$BASE-compte-rendu.md"

echo "Compte rendu prêt : $BASE-compte-rendu.md"

Passen Sie synthese.py so an, dass das Skript die als Argument übergebene Datei liest und das Ergebnis auf die Standardausgabe schreibt. Damit erhalten Sie einen einzigen Befehl: ./compte-rendu.sh reunion_teams.mp4, und das Besprechungsprotokoll im Markdown-Format erscheint wenige Minuten später, ohne dass auch nur ein einziges Byte den Rechner verlassen hat.

#Fehlerbehebung

Transkription, die ins Englische wechselt
Whisper hat die Sprache wegen eines stillen oder zweisprachigen Anfangs falsch erkannt. Erzwingen Sie immer --language French (oder language="fr").
Falsch geschriebene Eigennamen
Das ist normal: Whisper erschließt Wörter anhand ihres Klangs. Ergänzen Sie den Prompt für die Zusammenfassung um einen kurzen Korrekturdurchgang („korrigiere offensichtlich falsch transkribierte Namen“) oder stellen Sie dem LLM ein Glossar der Namen bereit.
Besprechung zu lang für das Kontextfenster
Teilen Sie die Transkription in Blöcke von etwa 3.000 Wörtern auf, fassen Sie jeden zusammen und erstellen Sie anschließend eine Synthese der Zusammenfassungen. Erhöhen Sie auch num_ctx im Ollama-Aufruf, sofern Ihr VRAM dies zulässt.
Whisper sehr langsam
Wechseln Sie zu faster-whisper, aktivieren Sie vad_filter, verwenden Sie ein kleineres Modell (medium → small) oder wechseln Sie zur GPU. whisper.cpp ist ebenfalls eine gute Option auf Rechnern ohne GPU.
Sich überlagernde Stimmen
Whisper unterscheidet die Sprecher nicht. Für ein Protokoll nach dem Muster „wer hat was gesagt“ muss im Vorfeld ein Diarisierungsschritt (z. B. mit pyannote) hinzugefügt werden – ein Thema für sich.

#Weiterführende Informationen

Dieser Leitfaden kombiniert zwei Bausteine, die auf dieser Website bereits ausführlich behandelt wurden. Um die einzelnen Schritte zu vertiefen oder das Gesamtsystem abzusichern:

Whisper + Ollama: Transkriptions- und Zusammenfassungspipeline 100 % lokal
Der Referenzleitfaden zur Audiokomponente, mit den verschiedenen Whisper-Implementierungen und einem durchgängigen Beispiel anhand einer einstündigen Besprechung.
Quantisierung wählen (Q4, Q5, Q8, FP16)
Damit ein Zusammenfassungsmodell mit 14B oder 32B Parametern in den Speicher Ihrer GPU passt, ohne die Qualität des Sitzungsprotokolls zu beeinträchtigen.
Lokale LLMs und DSGVO: Datenschutzkonformität im Unternehmen
Die regulatorische Ergänzung: Die lokale Verarbeitung von Besprechungen erleichtert die Einhaltung der Vorschriften; dieser Leitfaden erläutert, was noch dokumentiert werden muss.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.