Gesundheit: Transkription von consultations
Ja: Whisper (faster-whisper) transkribiert die Audioaufnahme und ein lokales LLM erstellt den Bericht, ohne dass Daten den Rechner des Arztes verlassen. Die lokale Verarbeitung hebt die geltenden Anforderungen nicht auf: berufliche Schweigepflicht, Information des Patienten mit Widerspruchsrecht, Einwilligung in die Aufnahme seiner Stimme, ein HDS-zertifizierter Hostinganbieter, falls ein Dritter Daten speichert, und Durchsicht durch den Arzt selbst.
Ein Arzt, der abends seine Berichte schreibt, kann mit einer lokalen Verarbeitungskette aus Audio, Transkription und anschließendem strukturiertem Bericht Zeit sparen. Sie lernen, diese Verarbeitungskette einzurichten, ihre Grenzen zu kennen (Halluzinationen, abgeschnittener Kontext) und den von HAS, CNIL und der französischen Ärztekammer (Ordre des médecins) festgelegten Rahmen einzuhalten. Dabei werden mehrere verbreitete Irrtümer ausgeräumt.
#Eine Konsultation lokal transkribieren: Was erlaubt ist und unter welchen Bedingungen
Ja, ein Arzt kann seine Konsultationen mit einer KI transkribieren, ohne dass die Audiodaten seinen Rechner verlassen: Whisper transkribiert die Sprache, ein lokales LLM (über Ollama) verfasst einen strukturierten Bericht, und die Fachkraft liest ihn durch und gibt ihn frei. Die gesetzlichen Pflichten entfallen dadurch nicht. Der Leitfaden von HAS und CNIL aus dem Jahr 2026 erinnert daran, dass die Einführung eines KI-Systems die Regeln zur beruflichen Schweigepflicht nach Artikel L. 1110-4 des französischen Gesundheitsgesetzbuchs nicht verändert. Außerdem muss der Patient informiert und sein Widerspruchsrecht respektiert werden. Beim Hosting durch Dritte ist ein HDS-zertifizierter Hosting-Anbieter erforderlich. Die lokale Verarbeitung vermeidet gerade diese Datenübertragung und die damit verbundenen Risiken. Dieser Leitfaden zeigt den Aufbau der Pipeline und erläutert anschließend die Rahmenbedingungen und die unverzichtbaren Prüfungen. Dabei räumt er mit einigen verbreiteten Irrtümern auf.
Die automatische Transkription von Konsultationen ist laut demselben Leitfaden der häufigste Anwendungsfall generativer KI in der Gesundheitsversorgung. Es geht daher nicht darum, ob man das tun kann, sondern wie man dabei korrekt vorgeht.
#Die Rahmenbedingungen in Frankreich: Was die offiziellen Leitfäden sagen
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Die Tabelle führt jede Anforderung mit ihren konkreten Auswirkungen auf eine lokale Pipeline auf. Dabei korrigiert sie zwei verbreitete Vorstellungen: Die Einwilligung des Patienten ist nicht die Rechtsgrundlage für die Verarbeitung, und HDS ist nicht grundsätzlich erforderlich, sondern dann, wenn ein Dritter die Daten hostet.
| Thema | Was die Anleitungen sagen | Praktische Konsequenz |
|---|---|---|
| Berufliche Schweigepflicht | KI ändert die Regeln des Artikels L. 1110-4 des CSP nicht | Der Bericht unterliegt weiterhin der Schweigepflicht; beschränken Sie den Zugriff auf den Rechner |
| Hosting | Ein Drittanbieter, der Gesundheitsdaten hostet (Cloud), muss als Hosting-Anbieter für Gesundheitsdaten zertifiziert sein | Verarbeitung auf dem Rechner des Arztes: kein externer Hostinganbieter im Datenfluss |
| Rechtsgrundlage | Nach Auffassung der CNIL ist die Einwilligung für diese Verarbeitungen weder die Rechtsgrundlage noch die Ausnahme. | Dokumentieren Sie die gewählte Rechtsgrundlage gemeinsam mit Ihrem Datenschutzbeauftragten; verlassen Sie sich nicht auf ein angekreuztes Kästchen. |
| Information | Eine transparente, zugängliche Information mit Widerspruchsrecht genügt in den meisten Fällen | Durch einen Hinweis oder mündlich mitteilen, dass die Konsultation transkribiert wird; eine Ablehnung respektieren. |
| Sprachaufnahme | Die Nutzung von Sprachaufnahmen, anhand derer Personen identifiziert werden können, setzt gemäß dem französischen Zivilgesetzbuch eine Einwilligung voraus | Holen Sie die Zustimmung des Patienten ein, bevor Sie seine Stimme aufzeichnen. |
| Validierung des Berichts | Er sollte nicht von einem Dritten, der nicht an der Besprechung teilnimmt, wie einer Sekretärin, validiert werden | Der Arzt, der den Patienten gesehen hat, liest den Text selbst noch einmal durch |
| Aufbewahrung | Der Rat der Berufskammer empfiehlt 20 Jahre nach der letzten Konsultation, da es keine spezifische gesetzliche Regelung für die freiberufliche Tätigkeit gibt | Für den Bericht gilt diese Frist; es gibt keinen Grund, die unbearbeitete Audioaufnahme aufzubewahren |
#Zwei verbreitete Irrtümer, von denen man sich verabschieden sollte
Erster Irrglaube: „ChatGPT ist ausdrücklich verboten“. Die Texte richten sich gegen kein bestimmtes Tool. Das Problem ist struktureller Natur: Wenn Sie Gesundheitsdaten an einen Online-Dienst senden, verlassen diese Ihren Arbeitsplatzrechner. Das erfordert einen zertifizierten Hosting-Anbieter, einen Auftragsverarbeitungsvertrag und eine angemessene Information. Der Leitfaden von HAS und CNIL benennt außerdem das Risiko einer Verletzung der medizinischen Schweigepflicht durch die Aufnahme sensibler Daten in Anfragen an Online-Konversationsagenten.
Zweiter Irrglaube: „Lokal bedeutet rechtskonform“. Die lokale Verarbeitung beseitigt die Datenübertragung, nicht aber die Pflicht, ein Verzeichnis zu führen, die Patienten zu informieren, den Rechner abzusichern und zu prüfen, ob eine Datenschutz-Folgenabschätzung erforderlich ist. Der Leitfaden zählt die Datenschutz-Folgenabschätzung gegebenenfalls zu den Pflichten des Betreibers: Lassen Sie sich beraten, um diesen Punkt sowie die mögliche Einstufung Ihres Tools als Medizinprodukt zu klären.
#Der Stack: Whisper, ein lokales LLM und optional die Sprecherdiarisierung
| Baustein | Rolle | Gut zu wissen |
|---|---|---|
| faster-whisper | Transkribiert das Audio (CTranslate2-Implementierung von Whisper) | Laut Angaben bis zu viermal schneller als die ursprüngliche Implementierung bei gleicher Genauigkeit |
| Modell large-v3 | Mehrsprachiges Modell aus der Whisper-Familie, das auch Französisch unterstützt | Wird bei der ersten Nutzung heruntergeladen; anhand Ihrer eigenen Aufnahmen zu überprüfen |
| Ollama + qwen3.5:9b | Verfasst den strukturierten Bericht | Modell mit 9 Milliarden Parametern; 6,6 GB laut der Ollama-Modellbibliothek |
| pyannote (Option) | Sprecherdiarisierung: Wer spricht wann | Modell zum Herunterladen mit einem Hugging Face-Token nach Annahme der Nutzungsbedingungen |
Zum Durchsatz liefert die Dokumentation von faster-whisper einen zeitlich eingeordneten Vergleichswert: 13 Minuten Audio wurden mit dem Modell large-v2 in fp16 in 1 Minute und 03 Sekunden transkribiert, bei 4.525 MB VRAM auf einer RTX 3070 Ti mit 8 GB (Benchmark der Maintainer, CUDA 12.4). Dieselben Maintainer messen 59 Sekunden bei 2.926 MB in int8. Das sind ihre Messungen auf ihrem Rechner, nicht unsere: Sie zeigen, dass eine bescheidene Grafikkarte schneller als in Echtzeit transkribiert, ohne damit eine Zusage für Ihren Rechner zu machen.
#Installation
Mit einer NVIDIA-GPU benötigt faster-whisper die Bibliotheken cuBLAS und cuDNN 9 für CUDA 12. Ohne diese schlägt das Laden des Modells fehl: Installieren Sie die Bibliotheken vor dem Test oder wechseln Sie in den CPU-Modus.
#Audio transkribieren
Das folgende Skript legt die Sprache fest, aktiviert den Stillefilter (VAD) und versieht jedes Segment mit einem Zeitstempel. Passen Sie die erste Zeile an: device cuda mit float16 für eine NVIDIA-GPU, device cpu mit int8 für einen Mac oder einen PC ohne kompatible Grafikkarte.
Mit dem Parameter hotwords, den die Transkriptionsfunktion von faster-whisper bereitstellt, lassen sich dem Modell erwartete Begriffe vorschlagen: Medikamentennamen, Kürzel, Untersuchungen. Er hilft, bietet aber keine Garantie: Prüfen Sie Eigennamen und Dosierungen immer nach.
#Whisper kann schreiben, was niemand gesagt hat
Die Modellkarte von large-v3 warnt davor, dass die Vorhersagen Texte enthalten können, die im Audio nicht vorkommen; sie bezeichnet dies als Halluzination. Bei einer Konsultation kann dadurch während einer Sprechpause ein plausibler, aber erfundener Satz entstehen, eine Zahl verändert werden oder ein ähnlicher, aber falscher Medikamentenname erscheinen. Der VAD-Filter verringert das Risiko während Sprechpausen; er ersetzt nicht das Gegenlesen.
#Den strukturierten Bericht verfassen
Das zweite Skript sendet die Transkription über die API von Ollama an ein lokales Modell. Zwei Einstellungen sind entscheidend: eine niedrige Temperatur, um erfundene Inhalte zu begrenzen, und ein ausreichend großes Kontextfenster. Die Dokumentation von Ollama nennt bei weniger als 24 GiB VRAM ein standardmäßiges Kontextfenster von etwa 4.000 Tokens. Eine zwanzigminütige Konsultation umfasst ungefähr 3.000 Wörter, also mehrere Tausend Tokens (Schätzung, abhängig von der Sprechgeschwindigkeit): Ohne explizite Angabe von num_ctx besteht die Gefahr, dass das Ende der Transkription abgeschnitten wird. Das Beispiel legt daher 16.384 Tokens fest.
Dieser Prompt wendet die Prinzipien aus dem Leitfaden zu Systemprompts an: überprüfbare Regeln, ein explizites Ausgabeformat und ein festgelegtes Verhalten bei fehlenden Informationen. Die Anweisung „Nicht erwähnt“ ist wichtig: Sie verhindert, dass das Modell einen leeren Abschnitt mit einer plausiblen Annahme füllt.
#Diarisierung: Arzt und Patient unterscheiden
Die Sprecherdiarisierung ordnet jedes Segment einem Sprecher zu (SPEAKER_00, SPEAKER_01). Sie ist vor allem nützlich, wenn Sie die eigentliche Konsultation mit zwei Sprechern aufnehmen; wenn nur der Arzt diktiert, ist sie unnötig. Das pyannote-Repository empfiehlt derzeit die Pipeline community-1: Sie müssen deren Nutzungsbedingungen auf Hugging Face akzeptieren und ein Zugriffstoken erstellen, um sie herunterzuladen. Die Inferenz wird anschließend lokal ausgeführt.
#Typischer Workflow in der Praxis
- 01Den Patienten informierenInformieren Sie vor der Aufnahme darüber, dass die Konsultation oder das Diktat von einem lokalen Tool transkribiert wird und der Patient dem widersprechen kann. Wenn Sie seine Stimme aufnehmen, holen Sie seine Zustimmung ein. Dokumentieren Sie die Information des Patienten in der Patientenakte.
- 02AufzeichnenZwei Optionen: Nach der Konsultation 1 bis 2 Minuten lang Notizen diktieren (der Patient wird nicht mehr aufgezeichnet) oder das Gespräch aufzeichnen (mündliche Einwilligung erforderlich, Sprechertrennung hilfreich). Das Diktieren minimiert die erhobene Datenmenge.
- 03Die Datei auf dem Rechner ablegenÜbertragen Sie die Audiodatei (WAV, MP3, M4A) in einen eigens dafür vorgesehenen, verschlüsselten Ordner. Ein kleines Skript überwacht den Ordner und startet die Verarbeitung.
- 04Pipeline startenDas Skript transkribiert, fasst zusammen, speichert den Bericht als Text neben der Audiodatei und protokolliert den Vorgang, ohne medizinische Inhalte in das Protokoll zu schreiben.
- 05Selbst gegenlesen und freigebenDer Arzt, der den Patienten gesehen hat, liest den Bericht nochmals durch, korrigiert ihn und übernimmt ihn anschließend in seine Praxisverwaltungssoftware. Eine dritte Person, die bei der Konsultation nicht anwesend war, kann die Halluzinationen nicht erkennen.
- 06Die unbearbeitete Audioaufnahme löschenSobald der Bericht freigegeben ist, löschen Sie die Audioaufnahme und die vorläufige Transkription: Die Daten erfüllen keinen Zweck mehr, und der Bericht wird mit der Patientenakte weitergeführt.
#Was bei der Durchsicht zu prüfen ist
| Element | Risiko | Prüfung |
|---|---|---|
| Medikamente und Dosierungen | Ähnlicher Name, Einheit oder Dosis geändert | Mit der tatsächlichen Verordnung vergleichen |
| Vorerkrankungen | Erfundene oder dem falschen Patienten zugeordnete Vorerkrankung | Mit der Patientenakte abgleichen |
| Negationen | Aus „Kein Fieber“ wurde „Fieber“ | Sätze mit Verneinungen erneut lesen |
| Leere Abschnitte | Plausible Annahme als Ersatz für „Nicht erwähnt“ | Prüfen, ob nichts ergänzt wurde |
| Datumsangaben und Dauerangaben | Falsche Behandlungsdauer oder falscher Zeitraum bis zur Nachkontrolle | Mit dem Gesagten abgleichen |
#Sicherheit, Aufbewahrung und Nachverfolgbarkeit
- Verzeichnis der Verarbeitungstätigkeiten
- Der Leitfaden der CNIL und des Ordre des médecins verlangt, ein Verzeichnis der Verarbeitungstätigkeiten zu führen; fügen Sie dort einen Eintrag hinzu, der diese lokale Pipeline und ihre Zwecke beschreibt.
- Aufbewahrungszeit
- Für den Bericht gilt dieselbe Aufbewahrungsdauer wie für die Patientenakte (20 Jahre nach der letzten Konsultation gemäß der Empfehlung der zuständigen Berufskammer). Die unbearbeitete Audioaufnahme wird gelöscht, sobald der Bericht freigegeben ist und sie nicht mehr benötigt wird.
- Verschlüsselung und Datensicherungen
- Verschlüsseln Sie das Laufwerk (FileVault, BitLocker, LUKS) und erstellen Sie regelmäßig Sicherungskopien auf einem verschlüsselten Datenträger, der außerhalb der Praxis aufbewahrt wird. Ein gestohlener Rechner mit unverschlüsselten Gesundheitsdaten stellt eine Datenschutzverletzung dar.
- Nachvollziehbarkeit
- Dokumentieren Sie die Aufklärung des Patienten, die Version der Tools und die Validierung durch den Arzt: Diese Aufzeichnungen dienen Ihnen bei einer Kontrolle als Nachweise.
- Medizinische Transkription und lokales LLM: regelkonformer Umgang mit Patientendaten
- Whisper + Ollama lokal: Transkription zu 100 % offline
- Zusammenfassung von Patientenakten
- Den Datenträger mit den Modellen verschlüsseln
- WhisperX: wortgenaue Zeitstempel und Sprecher
- System-Prompts beherrschen
- Quelle: Leitfaden von HAS und CNIL zum sachgerechten Einsatz von KI-Systemen in der Versorgung
- Quelle: Leitfaden von CNOM und CNIL zum Schutz von Patientendaten
- Quelle: faster-whisper
- Quelle: Modellbeschreibung Whisper large-v3
- Quelle : pyannote-audio
Kann eine medizinische Konsultation mit einer KI transkribiert werden?+
Ist die Einwilligung des Patienten erforderlich, um sein Behandlungsgespräch zu transkribieren?+
Ist für eine lokale Pipeline ein HDS-Hosting-Anbieter vorgeschrieben?+
Ist Whisper für das französische medizinische Vokabular zuverlässig?+
Kann eine medizinische Sekretärin den generierten Bericht freigeben?+
Welche Konfiguration benötigt man, um diese Pipeline zu betreiben?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.