В сентябре 2026 года было опубликовано исследование ObGynLongBench — бенчмарка для оценки ИИ-моделей при клинических решениях в акушерстве и гинекологии на основе продольных электронных историй болезни.
Набор включает 1500 точек принятия решений из 976 историй беременности. Авторы обнаружили, что модели работают лучше, когда нужные данные предоставлены напрямую, и теряют точность, когда должны искать их в длинных и сложных историях.
Главная проблема — найти правильные доказательства
Работа показывает важное ограничение клинических ассистентов: необходимо использовать только информацию, доступную на момент оцениваемого решения, не смешивая её с более поздними событиями.
Источник: ObGynLongBench, arXiv, 7 сентября 2026 года.

Español
English
Français
Deutsch
Русский