Eine im September 2026 veröffentlichte Arbeit stellte ObGynLongBench vor, einen Benchmark zur Bewertung von KI-Modellen bei klinischen Entscheidungen in Geburtshilfe und Gynäkologie anhand longitudinaler elektronischer Patientenakten.
Der Datensatz umfasst 1.500 klinische Entscheidungspunkte aus 976 Schwangerschaftsverläufen. Die Modelle schnitten besser ab, wenn relevante Evidenz direkt bereitgestellt wurde, und verloren an Genauigkeit, wenn sie diese in langen und komplexen Akten finden mussten.
Die Herausforderung liegt im richtigen Evidenzabruf
Die Arbeit zeigt eine wichtige Grenze klinischer Assistenten: Gute Antworten hängen davon ab, dass nur Informationen verwendet werden, die zum Zeitpunkt der jeweiligen Entscheidung verfügbar waren.
Quelle: ObGynLongBench, arXiv, 7. September 2026.

Español
English
Français
Deutsch
Русский