Une étude publiée en septembre 2026 a présenté ObGynLongBench, un benchmark destiné à évaluer des modèles d’IA sur des décisions cliniques en obstétrique et gynécologie à partir de dossiers médicaux longitudinaux.
Le benchmark comprend 1 500 points de décision issus de 976 historiques de grossesse. Les auteurs constatent que les modèles sont plus performants lorsque les preuves pertinentes sont fournies directement et perdent en précision lorsqu’ils doivent les retrouver dans des dossiers longs et complexes.
Le défi consiste à retrouver la bonne preuve
Le travail souligne une limite importante pour les assistants cliniques : la qualité dépend de la capacité à utiliser uniquement les informations disponibles au moment de la décision évaluée.
Source : ObGynLongBench, arXiv, 7 septembre 2026.

Español
English
Français
Deutsch
Русский