Medizinische Transkription und lokales LLM: Datenkonformität patient
Eine Konsultation diktieren, eine saubere Transkription erhalten und anschließend einen SOAP-Bericht, der direkt in die Patientenakte eingefügt werden kann — ohne dass auch nur eine Sekunde Audio die Praxis verlässt. Dieses Versprechen setzt dieser Leitfaden in die Praxis um: eine HDS-konforme Pipeline für die medizinische Transkription mit einem lokalen LLM, aufgebaut auf Whisper-large-v3 und einem Modell mit mindestens 14 Milliarden Parametern (Llama 4 oder Qwen3), die darauf ausgelegt ist, die medizinische Schweigepflicht und die HDS-Vorgaben einzuhalten.
#HDS-Rahmen und medizinische Schweigepflicht
Die medizinische Schweigepflicht (Artikel L.1110-4 des französischen Gesetzbuchs für öffentliche Gesundheit) gilt für jedes Dokument, das Gesundheitsinformationen enthält, anhand derer eine Person identifiziert werden kann, einschließlich Transkriptionen von Audioaufnahmen. Sobald Patientendaten außerhalb der Praxis oder des Krankenhauses verarbeitet werden, muss der Hosting-Anbieter HDS-zertifiziert sein (nach dem ASIP/ANS-Referenzrahmen). Konkret bedeutet das: Wenn Sie eine Konsultation an eine Cloud-API ohne HDS-Zertifizierung senden — Whisper von OpenAI, Claude oder eine beliebige Plattform für die breite Öffentlichkeit —, bewegen Sie sich außerhalb des rechtlichen Rahmens, selbst bei einem Test.
Die Gegenmaßnahme: Weder die Audiodaten noch die Transkription jemals aus dem Bereich herausgeben, den Sie kontrollieren. Genau das ermöglicht eine lokale LLM-Pipeline für medizinische Transkription: Der Inferenzrechner steht in der Praxis, die Festplatte ist verschlüsselt, das Netzwerk ist isoliert. Kein Hosting-Anbieter, keine Zulassung zu beantragen.
#100 % lokale Architektur
Lokale KI am Arbeitsplatz bereitstellen: DSGVO, AI Act, Mehrbenutzerarchitektur, Kosten, Memo für die Leitung.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Die Pipeline besteht aus vier Bausteinen, die alle lokal laufen: Audioaufnahme → Whisper-large-v3 → LLM mit SOAP-Vorlage → Export in die Praxissoftware (LGC) oder das DMP.
- Aufnahme
- Ansteckmikrofon oder USB-Mikrofon mit Nierencharakteristik, zwischen behandelnder Person und Patient aufgestellt. Kein Bluetooth (Latenz und Kompression). Aufnahme im WAV-Format mit 16 kHz, mono.
- Transkription
- Whisper-large-v3 (OpenAI, offene Modellgewichte, MIT-Lizenz), ausgeführt über faster-whisper auf einer lokalen GPU. Das Modell ist in den Arbeitsspeicher geladen, die Audiodaten werden nach der Transkription gelöscht.
- Strukturierung
- Llama 4 Scout (17B-A2B, MoE) oder Qwen3-14B, bereitgestellt über Ollama. Das LLM verarbeitet die Transkription und erstellt einen SOAP-Bericht (Subjective, Objective, Assessment, Plan).
- Export
- Der Bericht wird über die Zwischenablage, einen HL7-CDA-Kurzbefehl oder eine API, sofern verfügbar, in das LGC (Weda, Medistory, AxiSanté, Doctolib Pro, Maiia) eingefügt.
#Hardware- und Software-Voraussetzungen
- GPU
- Mindestens eine RTX 4070 mit 12 GB; eine RTX 4080 mit 16 GB oder eine RTX 4090 mit 24 GB bietet komfortable Reserven. Whisper-large-v3 belegt etwa 3 GB VRAM, der 14B-LLM in Q4_K_M benötigt rund 9 GB.
- Alternative für Mac
- Ein Mac mini M4 Pro mit 48 GB vereinheitlichtem Arbeitsspeicher kann den gesamten Stack ausführen. Ideal für eine freiberufliche Praxis: leise, im Leerlauf ohne laufenden Lüfter, geringer Stromverbrauch.
- Speicher
- Mit LUKS (Linux), BitLocker (Windows Pro) oder FileVault (macOS) verschlüsselte NVMe-SSD. 100 GB reichen aus: Modelle ~25 GB, der Rest für temporäre Transkriptionen.
- Netzwerk
- Der Inferenzrechner befindet sich in einem VLAN, das vom Patienten-WLAN getrennt ist. Im Produktionsbetrieb ist kein ausgehender Internetzugriff erlaubt – nur während beaufsichtigter Updates.
- Software
- Ollama (≥ 0.5), um das LLM unter http://localhost:11434 bereitzustellen, faster-whisper (Python) für die Transkription, ffmpeg für die Audiokonvertierung.
#1. Whisper-large-v3 für französischsprachige medizinische Konsultationen
faster-whisper ist ein CTranslate2-basierter Fork, der bei gleicher Qualität 4- bis 5-mal schneller ist als die Python-Referenzimplementierung. Er unterstützt dieselben Modelle und stellt eine einfache API bereit.
Der Transkriptionscode selbst besteht aus wenigen Zeilen. Beachten Sie die Anweisung language='fr', die die automatische Spracherkennung deaktiviert und Fehlinterpretationen zu Beginn der Konsultation vermeidet.
Auf einer RTX 4080 lässt sich eine 15-minütige medizinische Konsultation in etwa 90 Sekunden transkribieren. Die ursprüngliche Audiodatei wird unmittelbar danach gelöscht – das Transkript reicht aus, die Audiodatei stellt ein unnötiges Risiko dar.
#2. LLM und SOAP-Vorlage
Der SOAP-Bericht ist der De-facto-Standard: Subjective (Anlass, Beschwerden des Patienten), Objective (klinische Untersuchung, Vitalparameter, ergänzende Untersuchungen), Assessment (Diagnose oder Hypothesen), Plan (Verordnungen, anstehende Untersuchungen, weitere Betreuung). Das LLM wird angewiesen, diese Vorlage strikt auszufüllen, ohne etwas zu erfinden.
Der System-Prompt gibt einen strengen Rahmen vor: keine erfundenen Inhalte, wörtliche Zitate bei Unsicherheit und medizinische Fachsprache auf Französisch.
#3. Ende-zu-Ende-Pipeline
Auf die Transkription folgt die Strukturierung über die lokale REST-API von Ollama. Das Skript bleibt kompakt und überprüfbar — etwa 40 Zeilen, und das ist Absicht: weniger Code, weniger Angriffsfläche.
Eine 15-minütige medizinische Konsultation durchläuft die gesamte Pipeline auf einer RTX 4080 in weniger als 3 Minuten. Der Bericht .soap.md ist bereit, in das LGC eingefügt zu werden.
#4. Integration in die Praxissoftware
Drei Integrationsstufen je nach Ihrem LGC:
- 01Ebene 1 — ZwischenablageDas Skript kopiert automatisch den Bericht (pyperclip). Die behandelnde Fachperson fügt ihn mit zwei Klicks in das LGC ein. Kompatibel mit 100 % der LGC, ohne Integration aufseiten des Softwareanbieters. Das ist der empfohlene Ausgangspunkt.
- 02Stufe 2 — Abkürzung über HL7 CDADer Markdown-Auswertung wird über ein pandoc-Skript mit XML-Vorlage in CDA R2 (Clinical Document Architecture) umgewandelt und anschließend über die Dokumentimportfunktion des LGC importiert. Kompatibel mit Weda, Medistory, AxiSanté, die CDA akzeptieren.
- 03Stufe 3 — Native API des LGCEinige Softwareanbieter (Doctolib Pro, Maiia) stellen eine API zum Eintragen medizinischer Beobachtungen bereit. Die Pipeline überträgt den Bericht direkt in die über die INS identifizierte Patientenakte. Das ist die bequemste Lösung, erfordert aber die Zustimmung des Anbieters und eine CPS-Authentifizierung.
#Compliance und Audit-Protokollierung
Die Nutzung eines Hilfsmittels zur Erstellung medizinischer Texte muss dokumentiert werden. Mindestens drei Angaben gehören in die Patientenakte:
- Hinweis auf KI-Unterstützung bei der Texterstellung
- Eine Zeile am Ende des Berichts: „Strukturierter Bericht, erstellt mit Unterstützung eines lokalen KI-Modells (Qwen3-14B, Version 2026-04-12). Validiert durch Dr. [...] am [Datum].“ Dieser Hinweis dient der Nachvollziehbarkeit.
- Zugriffsprotokoll
- Jede Ausführung der Pipeline wird lokal protokolliert (wer, wann, welche Audioaufnahme, welches Modell, Hash des Berichts). Das Protokoll lässt nur das Anhängen neuer Einträge zu, ist signiert und wird 10 Jahre lang aufbewahrt (Aufbewahrungsdauer der Patientenakte).
- Datenschutz-Folgenabschätzung nach DSGVO
- Stellen Sie eine Auswirkungsanalyse (Artikel 35 DSGVO) für die Verarbeitung „KI-gestützte Transkription“ ein. Die 100%-ige Lokalität vereinfacht die Analyse: Kein Datenübertragung außerhalb der EU, keine Drittverträge, eindeutige Zweckbestimmung.
- Information des Patienten
- Der Aushang im Wartezimmer und der Hinweis im Aufnahmeformular müssen auf den Einsatz eines Hilfsmittels zur Transkription hinweisen. Der Patient kann dies ablehnen – sehen Sie einen alternativen Workflow vor.
- Verschlüsselung ruhender Daten
- Der gesamte Datenträger ist verschlüsselt. Die Berichte werden im Patientenordner des LGC gespeichert, nicht im Dateisystem des Inferenzrechners. Löschen Sie die temporären .soap.md-Dateien am Ende des Tages.
- Überwachte Aktualisierungen
- Jede Modellaktualisierung (Whisper, LLM) löst eine erneute Validierung anhand eines Satzes von 10 anonymisierten Testkonsultationen aus. Bekannter Regressionsfehler = keine Bereitstellung.
#Weiterführende Informationen
Diese Pipeline deckt den täglichen Einsatz einer selbstständig tätigen klinischen Fachperson oder einer kleineren Krankenhausabteilung ab. Drei naheliegende Erweiterungen: die Bereitstellung auf mehreren Arbeitsplätzen mit Docker und einem Reverse Proxy für die CPS-Authentifizierung standardisieren, ein lokales RAG auf Basis der HAS-Empfehlungen zur Unterstützung des Assessments hinzufügen und die Netzwerksicherheit bis hin zur vollständigen Netzwerkisolierung (Air-Gap) verschärfen.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.