Sehr geehrter Herr Finkeisen,
danke für die Einordnung, dass bereits die großen Gemini-Modelle laufen und die Stellschraube in der Interaktion mit der Akte liegt, deckt sich mit unseren Messungen. Ich habe denselben Test im Mai (hatte ich Ihnen übermittelt) und im September gefahren, 20 protokollierte Durchläufe (allerdings OHNE Brief-Kommandos als Platzhalter): Die Struktur hielt in allen 20 Läufen wortgleich, wenn wir einen Lückentext vorgeben. Sämtliche relevanten Fehler lagen beim Auswählen, Datieren und Weglassen, also im Zugriff auf die Akte, nicht in der Sprachfähigkeit.
Warum unser Fall ein Sonderfall ist
Ein typischer Fall bei uns: ca. 1.030 Karteieinträge über sechs Jahre, rund 22.800 Wörter — etwa 60 DIN-A4-Seiten. Davon sind je Bericht etwa 50 Einträge relevant. Das ist für eine schmerzmedizinische Langzeitbetreuung normal, für die meisten Praxen aber sicher die Ausnahme; wer kürzere Akten hat, wird deutlich weniger von diesen Effekten sehen.
Erschwerend kommt bei uns hinzu, dass wir zwei Berichte mit gegenläufigem Filter aus derselben Akte brauchen: den psychotherapeutischen Kurzbericht ohne somatische Inhalte, und den ärztlichen Verlaufsbrief, in dem umgekehrt Inhalte aus Therapiesitzungen nicht auftauchen dürfen.
Der LLM-Textgenerator ist für uns der interessantere Hebel
Wir sind diesen Weg bereits gegangen: Für den ärztlichen Brief arbeiten wir nicht mehr über die Akte, sondern exportieren definierte, hart kodierte Einträge und übergeben nur diese. Der Freiheitsgrad des Modells sinkt damit auf das Formulieren — und dort ist es zuverlässig. Genau das ermöglicht der LLM-Textgenerator: strukturierten Kontext statt Volltext, was zugleich erheblich Tokens spart.
Die zwei Punkte, die uns im Kartei-Chat (Ohne Briefkommandos) am meisten kosten, wären auf diesem Weg strukturell gelöst statt nur unwahrscheinlicher:
- Vorfilterung nach Eintragstyp und Zeitraum, bevor der Kontext das Modell erreicht. Bei uns kippte der als Prompt formulierte Typfilter in 1 von 5 Läufen — 48 Einträge eines ausdrücklich ausgeschlossenen Typs landeten in der Auswahl. Als Datenbankoperation kann das nicht passieren.
- Hinterlegte Diagnosen als Positivliste im Kontext. Steht eine Diagnose nur im Klartext, ergänzt das Modell teils einen ICD-Code, der nirgends dokumentiert ist — in einem Lauf 5 von 6 Codes ohne Beleg. Mit einer mitgegebenen Codeliste ist das ausgeschlossen.
Wir können gern sprechen, aber ich glaube wir sind relativ deckungsgleich was die Richtung angeht
Schönes Wochenende, Richard Kupke