Mittelstufe 11 Min.Gesundheit

Gesundheit: Transkription von consultations

Direkte Antwort

Ja: Whisper (faster-whisper) transkribiert die Audioaufnahme und ein lokales LLM erstellt den Bericht, ohne dass Daten den Rechner des Arztes verlassen. Die lokale Verarbeitung hebt die geltenden Anforderungen nicht auf: berufliche Schweigepflicht, Information des Patienten mit Widerspruchsrecht, Einwilligung in die Aufnahme seiner Stimme, ein HDS-zertifizierter Hostinganbieter, falls ein Dritter Daten speichert, und Durchsicht durch den Arzt selbst.

Ein Arzt, der abends seine Berichte schreibt, kann mit einer lokalen Verarbeitungskette aus Audio, Transkription und anschließendem strukturiertem Bericht Zeit sparen. Sie lernen, diese Verarbeitungskette einzurichten, ihre Grenzen zu kennen (Halluzinationen, abgeschnittener Kontext) und den von HAS, CNIL und der französischen Ärztekammer (Ordre des médecins) festgelegten Rahmen einzuhalten. Dabei werden mehrere verbreitete Irrtümer ausgeräumt.

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet

#Eine Konsultation lokal transkribieren: Was erlaubt ist und unter welchen Bedingungen

Ja, ein Arzt kann seine Konsultationen mit einer KI transkribieren, ohne dass die Audiodaten seinen Rechner verlassen: Whisper transkribiert die Sprache, ein lokales LLM (über Ollama) verfasst einen strukturierten Bericht, und die Fachkraft liest ihn durch und gibt ihn frei. Die gesetzlichen Pflichten entfallen dadurch nicht. Der Leitfaden von HAS und CNIL aus dem Jahr 2026 erinnert daran, dass die Einführung eines KI-Systems die Regeln zur beruflichen Schweigepflicht nach Artikel L. 1110-4 des französischen Gesundheitsgesetzbuchs nicht verändert. Außerdem muss der Patient informiert und sein Widerspruchsrecht respektiert werden. Beim Hosting durch Dritte ist ein HDS-zertifizierter Hosting-Anbieter erforderlich. Die lokale Verarbeitung vermeidet gerade diese Datenübertragung und die damit verbundenen Risiken. Dieser Leitfaden zeigt den Aufbau der Pipeline und erläutert anschließend die Rahmenbedingungen und die unverzichtbaren Prüfungen. Dabei räumt er mit einigen verbreiteten Irrtümern auf.

Die automatische Transkription von Konsultationen ist laut demselben Leitfaden der häufigste Anwendungsfall generativer KI in der Gesundheitsversorgung. Es geht daher nicht darum, ob man das tun kann, sondern wie man dabei korrekt vorgeht.

!
Dieser Leitfaden ist keine Rechtsberatung
Die rechtlichen Hinweise entsprechen den Leitfäden der HAS, der CNIL und des Conseil national de l'Ordre des médecins. Lassen Sie das System für Ihre Situation (Einzelpraxis, Gesundheitszentrum, Einrichtung) von Ihrem Datenschutzbeauftragten oder Ihrer zuständigen berufsständischen Instanz prüfen und bestätigen.

#Die Rahmenbedingungen in Frankreich: Was die offiziellen Leitfäden sagen

Das Kit Lokale KI

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Lebenslange Updates

Die Tabelle führt jede Anforderung mit ihren konkreten Auswirkungen auf eine lokale Pipeline auf. Dabei korrigiert sie zwei verbreitete Vorstellungen: Die Einwilligung des Patienten ist nicht die Rechtsgrundlage für die Verarbeitung, und HDS ist nicht grundsätzlich erforderlich, sondern dann, wenn ein Dritter die Daten hostet.

Anforderungen und Folgen für einen lokalen Pipeline-Workflow
ThemaWas die Anleitungen sagenPraktische Konsequenz
Berufliche SchweigepflichtKI ändert die Regeln des Artikels L. 1110-4 des CSP nichtDer Bericht unterliegt weiterhin der Schweigepflicht; beschränken Sie den Zugriff auf den Rechner
HostingEin Drittanbieter, der Gesundheitsdaten hostet (Cloud), muss als Hosting-Anbieter für Gesundheitsdaten zertifiziert seinVerarbeitung auf dem Rechner des Arztes: kein externer Hostinganbieter im Datenfluss
RechtsgrundlageNach Auffassung der CNIL ist die Einwilligung für diese Verarbeitungen weder die Rechtsgrundlage noch die Ausnahme.Dokumentieren Sie die gewählte Rechtsgrundlage gemeinsam mit Ihrem Datenschutzbeauftragten; verlassen Sie sich nicht auf ein angekreuztes Kästchen.
InformationEine transparente, zugängliche Information mit Widerspruchsrecht genügt in den meisten FällenDurch einen Hinweis oder mündlich mitteilen, dass die Konsultation transkribiert wird; eine Ablehnung respektieren.
SprachaufnahmeDie Nutzung von Sprachaufnahmen, anhand derer Personen identifiziert werden können, setzt gemäß dem französischen Zivilgesetzbuch eine Einwilligung vorausHolen Sie die Zustimmung des Patienten ein, bevor Sie seine Stimme aufzeichnen.
Validierung des BerichtsEr sollte nicht von einem Dritten, der nicht an der Besprechung teilnimmt, wie einer Sekretärin, validiert werdenDer Arzt, der den Patienten gesehen hat, liest den Text selbst noch einmal durch
AufbewahrungDer Rat der Berufskammer empfiehlt 20 Jahre nach der letzten Konsultation, da es keine spezifische gesetzliche Regelung für die freiberufliche Tätigkeit gibtFür den Bericht gilt diese Frist; es gibt keinen Grund, die unbearbeitete Audioaufnahme aufzubewahren

#Zwei verbreitete Irrtümer, von denen man sich verabschieden sollte

Erster Irrglaube: „ChatGPT ist ausdrücklich verboten“. Die Texte richten sich gegen kein bestimmtes Tool. Das Problem ist struktureller Natur: Wenn Sie Gesundheitsdaten an einen Online-Dienst senden, verlassen diese Ihren Arbeitsplatzrechner. Das erfordert einen zertifizierten Hosting-Anbieter, einen Auftragsverarbeitungsvertrag und eine angemessene Information. Der Leitfaden von HAS und CNIL benennt außerdem das Risiko einer Verletzung der medizinischen Schweigepflicht durch die Aufnahme sensibler Daten in Anfragen an Online-Konversationsagenten.

Zweiter Irrglaube: „Lokal bedeutet rechtskonform“. Die lokale Verarbeitung beseitigt die Datenübertragung, nicht aber die Pflicht, ein Verzeichnis zu führen, die Patienten zu informieren, den Rechner abzusichern und zu prüfen, ob eine Datenschutz-Folgenabschätzung erforderlich ist. Der Leitfaden zählt die Datenschutz-Folgenabschätzung gegebenenfalls zu den Pflichten des Betreibers: Lassen Sie sich beraten, um diesen Punkt sowie die mögliche Einstufung Ihres Tools als Medizinprodukt zu klären.

#Der Stack: Whisper, ein lokales LLM und optional die Sprecherdiarisierung

Die Bausteine der Pipeline
BausteinRolleGut zu wissen
faster-whisperTranskribiert das Audio (CTranslate2-Implementierung von Whisper)Laut Angaben bis zu viermal schneller als die ursprüngliche Implementierung bei gleicher Genauigkeit
Modell large-v3Mehrsprachiges Modell aus der Whisper-Familie, das auch Französisch unterstütztWird bei der ersten Nutzung heruntergeladen; anhand Ihrer eigenen Aufnahmen zu überprüfen
Ollama + qwen3.5:9bVerfasst den strukturierten BerichtModell mit 9 Milliarden Parametern; 6,6 GB laut der Ollama-Modellbibliothek
pyannote (Option)Sprecherdiarisierung: Wer spricht wannModell zum Herunterladen mit einem Hugging Face-Token nach Annahme der Nutzungsbedingungen

Zum Durchsatz liefert die Dokumentation von faster-whisper einen zeitlich eingeordneten Vergleichswert: 13 Minuten Audio wurden mit dem Modell large-v2 in fp16 in 1 Minute und 03 Sekunden transkribiert, bei 4.525 MB VRAM auf einer RTX 3070 Ti mit 8 GB (Benchmark der Maintainer, CUDA 12.4). Dieselben Maintainer messen 59 Sekunden bei 2.926 MB in int8. Das sind ihre Messungen auf ihrem Rechner, nicht unsere: Sie zeigen, dass eine bescheidene Grafikkarte schneller als in Echtzeit transkribiert, ohne damit eine Zusage für Ihren Rechner zu machen.

i
Auf dem Mac ist CUDA nicht verfügbar
Das offizielle Beispiel von faster-whisper zeigt die Ausführung auf der CPU in int8. Diese Konfiguration empfiehlt sich auf einem Mac: langsamer als eine NVIDIA-GPU, aber ausreichend für eine nachträgliche Transkription nach der Konsultation.

#Installation

Terminal
python3 -m venv venv
source venv/bin/activate

pip install faster-whisper ollama
# Optionnel pour la diarisation :
pip install pyannote.audio
Terminal
# Le modèle Whisper se télécharge au premier usage.
# Modèle de rédaction via Ollama :
ollama pull qwen3.5:9b

Mit einer NVIDIA-GPU benötigt faster-whisper die Bibliotheken cuBLAS und cuDNN 9 für CUDA 12. Ohne diese schlägt das Laden des Modells fehl: Installieren Sie die Bibliotheken vor dem Test oder wechseln Sie in den CPU-Modus.

#Audio transkribieren

Das folgende Skript legt die Sprache fest, aktiviert den Stillefilter (VAD) und versieht jedes Segment mit einem Zeitstempel. Passen Sie die erste Zeile an: device cuda mit float16 für eine NVIDIA-GPU, device cpu mit int8 für einen Mac oder einen PC ohne kompatible Grafikkarte.

Python
from faster_whisper import WhisperModel

# GPU NVIDIA : device="cuda", compute_type="float16"
# Sans GPU compatible : device="cpu", compute_type="int8"
model = WhisperModel("large-v3", device="cuda", compute_type="float16")

MOTS_CLES = "amoxicilline, paracétamol, HbA1c, tension artérielle"

def transcribe(audio_path):
    segments, info = model.transcribe(
        audio_path,
        language="fr",
        beam_size=5,
        vad_filter=True,        # coupe les silences
        hotwords=MOTS_CLES,     # vocabulaire attendu
        word_timestamps=False,
    )
    lines = []
    for s in segments:
        ts = f"[{int(s.start // 60):02d}:{int(s.start % 60):02d}]"
        lines.append(f"{ts} {s.text.strip()}")
    return "\n".join(lines)

if __name__ == "__main__":
    import sys
    print(transcribe(sys.argv[1]))

Mit dem Parameter hotwords, den die Transkriptionsfunktion von faster-whisper bereitstellt, lassen sich dem Modell erwartete Begriffe vorschlagen: Medikamentennamen, Kürzel, Untersuchungen. Er hilft, bietet aber keine Garantie: Prüfen Sie Eigennamen und Dosierungen immer nach.

#Whisper kann schreiben, was niemand gesagt hat

Die Modellkarte von large-v3 warnt davor, dass die Vorhersagen Texte enthalten können, die im Audio nicht vorkommen; sie bezeichnet dies als Halluzination. Bei einer Konsultation kann dadurch während einer Sprechpause ein plausibler, aber erfundener Satz entstehen, eine Zahl verändert werden oder ein ähnlicher, aber falscher Medikamentenname erscheinen. Der VAD-Filter verringert das Risiko während Sprechpausen; er ersetzt nicht das Gegenlesen.

#Den strukturierten Bericht verfassen

Das zweite Skript sendet die Transkription über die API von Ollama an ein lokales Modell. Zwei Einstellungen sind entscheidend: eine niedrige Temperatur, um erfundene Inhalte zu begrenzen, und ein ausreichend großes Kontextfenster. Die Dokumentation von Ollama nennt bei weniger als 24 GiB VRAM ein standardmäßiges Kontextfenster von etwa 4.000 Tokens. Eine zwanzigminütige Konsultation umfasst ungefähr 3.000 Wörter, also mehrere Tausend Tokens (Schätzung, abhängig von der Sprechgeschwindigkeit): Ohne explizite Angabe von num_ctx besteht die Gefahr, dass das Ende der Transkription abgeschnitten wird. Das Beispiel legt daher 16.384 Tokens fest.

Python
import requests

SYSTEM_CR = """Tu es un assistant pour médecin généraliste français.
À partir d'une TRANSCRIPTION BRUTE d'une consultation, tu produis un
compte-rendu médical structuré.

FORMAT DE SORTIE :
## Motif de consultation
## Antécédents (mentionnés)
## Examen clinique
## Diagnostic / Hypothèses
## Traitement / Prescriptions
## Suivi

RÈGLES :
- Reste TEXTUEL : n'ajoute aucun élément non mentionné dans la transcription.
- Reformule en vocabulaire médical standard.
- Si une section n'est pas abordée, écris "Non mentionné".
- Ne complète jamais une posologie ou un diagnostic absent.
"""

def summarize(transcription):
    r = requests.post("http://localhost:11434/api/chat", json={
        "model": "qwen3.5:9b",
        "messages": [
            {"role": "system", "content": SYSTEM_CR},
            {"role": "user",   "content": transcription},
        ],
        "stream": False,
        "options": {"temperature": 0.2, "num_ctx": 16384},
    })
    return r.json()["message"]["content"]

Dieser Prompt wendet die Prinzipien aus dem Leitfaden zu Systemprompts an: überprüfbare Regeln, ein explizites Ausgabeformat und ein festgelegtes Verhalten bei fehlenden Informationen. Die Anweisung „Nicht erwähnt“ ist wichtig: Sie verhindert, dass das Modell einen leeren Abschnitt mit einer plausiblen Annahme füllt.

#Diarisierung: Arzt und Patient unterscheiden

Die Sprecherdiarisierung ordnet jedes Segment einem Sprecher zu (SPEAKER_00, SPEAKER_01). Sie ist vor allem nützlich, wenn Sie die eigentliche Konsultation mit zwei Sprechern aufnehmen; wenn nur der Arzt diktiert, ist sie unnötig. Das pyannote-Repository empfiehlt derzeit die Pipeline community-1: Sie müssen deren Nutzungsbedingungen auf Hugging Face akzeptieren und ein Zugriffstoken erstellen, um sie herunterzuladen. Die Inferenz wird anschließend lokal ausgeführt.

Python
import torch
from pyannote.audio import Pipeline

pipeline = Pipeline.from_pretrained(
    "pyannote/speaker-diarization-community-1",
    token="HUGGINGFACE_ACCESS_TOKEN",
)
pipeline.to(torch.device("cuda"))  # si un GPU est disponible

output = pipeline("consultation.wav")
for turn, speaker in output.speaker_diarization:
    print(f"{turn.start:.1f}s - {turn.end:.1f}s : {speaker}")
→
Die beiden Ergebnisse kombinieren
Für einen Bericht mit zwei Sprechern gleichen Sie die Segmente von Whisper und pyannote anhand ihrer Zeitstempel ab, bevor Sie den Text an das LLM senden. Der Leitfaden zu WhisperX beschreibt ein Tool, das diesen Abgleich Wort für Wort durchführt.

#Typischer Workflow in der Praxis

  1. 01
    Den Patienten informieren
    Informieren Sie vor der Aufnahme darüber, dass die Konsultation oder das Diktat von einem lokalen Tool transkribiert wird und der Patient dem widersprechen kann. Wenn Sie seine Stimme aufnehmen, holen Sie seine Zustimmung ein. Dokumentieren Sie die Information des Patienten in der Patientenakte.
  2. 02
    Aufzeichnen
    Zwei Optionen: Nach der Konsultation 1 bis 2 Minuten lang Notizen diktieren (der Patient wird nicht mehr aufgezeichnet) oder das Gespräch aufzeichnen (mündliche Einwilligung erforderlich, Sprechertrennung hilfreich). Das Diktieren minimiert die erhobene Datenmenge.
  3. 03
    Die Datei auf dem Rechner ablegen
    Übertragen Sie die Audiodatei (WAV, MP3, M4A) in einen eigens dafür vorgesehenen, verschlüsselten Ordner. Ein kleines Skript überwacht den Ordner und startet die Verarbeitung.
  4. 04
    Pipeline starten
    Das Skript transkribiert, fasst zusammen, speichert den Bericht als Text neben der Audiodatei und protokolliert den Vorgang, ohne medizinische Inhalte in das Protokoll zu schreiben.
  5. 05
    Selbst gegenlesen und freigeben
    Der Arzt, der den Patienten gesehen hat, liest den Bericht nochmals durch, korrigiert ihn und übernimmt ihn anschließend in seine Praxisverwaltungssoftware. Eine dritte Person, die bei der Konsultation nicht anwesend war, kann die Halluzinationen nicht erkennen.
  6. 06
    Die unbearbeitete Audioaufnahme löschen
    Sobald der Bericht freigegeben ist, löschen Sie die Audioaufnahme und die vorläufige Transkription: Die Daten erfüllen keinen Zweck mehr, und der Bericht wird mit der Patientenakte weitergeführt.

#Was bei der Durchsicht zu prüfen ist

Prüfraster für einen generierten Bericht
ElementRisikoPrüfung
Medikamente und DosierungenÄhnlicher Name, Einheit oder Dosis geändertMit der tatsächlichen Verordnung vergleichen
VorerkrankungenErfundene oder dem falschen Patienten zugeordnete VorerkrankungMit der Patientenakte abgleichen
NegationenAus „Kein Fieber“ wurde „Fieber“Sätze mit Verneinungen erneut lesen
Leere AbschnittePlausible Annahme als Ersatz für „Nicht erwähnt“Prüfen, ob nichts ergänzt wurde
Datumsangaben und DauerangabenFalsche Behandlungsdauer oder falscher Zeitraum bis zur NachkontrolleMit dem Gesagten abgleichen
Verzeichnis der Verarbeitungstätigkeiten
Der Leitfaden der CNIL und des Ordre des médecins verlangt, ein Verzeichnis der Verarbeitungstätigkeiten zu führen; fügen Sie dort einen Eintrag hinzu, der diese lokale Pipeline und ihre Zwecke beschreibt.
Aufbewahrungszeit
Für den Bericht gilt dieselbe Aufbewahrungsdauer wie für die Patientenakte (20 Jahre nach der letzten Konsultation gemäß der Empfehlung der zuständigen Berufskammer). Die unbearbeitete Audioaufnahme wird gelöscht, sobald der Bericht freigegeben ist und sie nicht mehr benötigt wird.
Verschlüsselung und Datensicherungen
Verschlüsseln Sie das Laufwerk (FileVault, BitLocker, LUKS) und erstellen Sie regelmäßig Sicherungskopien auf einem verschlüsselten Datenträger, der außerhalb der Praxis aufbewahrt wird. Ein gestohlener Rechner mit unverschlüsselten Gesundheitsdaten stellt eine Datenschutzverletzung dar.
Nachvollziehbarkeit
Dokumentieren Sie die Aufklärung des Patienten, die Version der Tools und die Validierung durch den Arzt: Diese Aufzeichnungen dienen Ihnen bei einer Kontrolle als Nachweise.
FAQ
Kann eine medizinische Konsultation mit einer KI transkribiert werden?+
Ja, sofern die Rahmenbedingungen eingehalten werden: Die berufliche Schweigepflicht gilt weiterhin, der Patient muss informiert werden und widersprechen können, die Aufzeichnung seiner Stimme erfordert seine Zustimmung, und der Bericht muss vom Arzt gegengelesen werden. Eine lokale Verarbeitung vermeidet die Übertragung an einen externen Hosting-Anbieter, entbindet aber nicht von den übrigen Pflichten.
Ist die Einwilligung des Patienten erforderlich, um sein Behandlungsgespräch zu transkribieren?+
Für die Datenverarbeitung ist die CNIL der Auffassung, dass die Einwilligung weder die Rechtsgrundlage noch die Ausnahme ist: Die Information der Betroffenen und das Widerspruchsrecht reichen grundsätzlich aus. Die Aufzeichnung der Stimme einer identifizierbaren Person erfordert hingegen nach dem französischen Zivilgesetzbuch deren Einwilligung. Wer seine Notizen nach der Konsultation diktiert, umgeht diese Frage.
Ist für eine lokale Pipeline ein HDS-Hosting-Anbieter vorgeschrieben?+
Die Verpflichtung betrifft Gesundheitsdaten, die einem Dritten zur Speicherung anvertraut werden, beispielsweise in einer Cloud. Bei einer Verarbeitung auf dem Rechner des Arztes ohne Datenübertragung ist kein externer Hostinganbieter am Datenfluss beteiligt. Wenn Sie eine entfernte Datensicherung oder einen Online-Dienst hinzufügen, stellt sich die Frage erneut.
Ist Whisper für das französische medizinische Vokabular zuverlässig?+
Whisper large-v3 ist das Referenzmodell der Modellfamilie, aber seine Modellkarte weist darauf hin, dass es Texte erzeugen kann, die im Audio nicht vorkommen. Medikamentennamen, Abkürzungen und Dosierungen sind die Schwachstellen. Der Parameter hotwords hilft, das Nachlesen bleibt jedoch unverzichtbar, und niemand darf die abschließende Prüfung anstelle des Arztes übernehmen.
Kann eine medizinische Sekretärin den generierten Bericht freigeben?+
Der Leitfaden von HAS und CNIL empfiehlt, den Bericht nicht von einer dritten Person prüfen und freigeben zu lassen, die bei der Konsultation nicht anwesend war, da sie Halluzinationen nicht erkennen kann. Der Arzt, der den Patienten untersucht hat, liest den Bericht durch und gibt ihn frei. Die Sekretärin kann das Dokument anschließend ablegen oder einpflegen.
Welche Konfiguration benötigt man, um diese Pipeline zu betreiben?+
Eine NVIDIA-GPU mit 8 GB VRAM transkribiert laut den Messungen von faster-whisper schneller als in Echtzeit, und ein Schreibmodell mit 9 Milliarden Parametern benötigt laut der Ollama-Modellbibliothek 6,6 GB. Ohne GPU funktioniert der CPU-Modus mit int8 ebenfalls, allerdings langsamer: Planen Sie eine zeitversetzte Verarbeitung ein.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.