OpenAI o1 превзошла врачей в диагностике

OpenAI o1 превзошла врачей в диагностике

Исследователи из Гарвардской медицинской школы и медицинского центра Beth Israel Deaconess опубликовали в журнале Science работу о том, как большие языковые модели справляются с медицинскими задачами. В одном из тестов модель OpenAI o1 показала более высокую точность, чем врачи при разборе реальных случаев из отделения неотложной помощи.

Авторы провели серию экспериментов, чтобы сравнить модели OpenAI с практикующими врачами. В одном из них они изучили 76 пациентов, поступивших в отделение неотложной помощи Beth Israel. Исследователи сопоставили диагнозы двух лечащих врачей с выводами моделей OpenAI o1 и 4o.

Оценку этих диагнозов проводили два других лечащих врача. Они не знали, какие ответы дали люди, а какие — ИИ.

Как говорится в исследовании, «на каждом этапе диагностики o1 либо показывала немного лучший результат, либо работала на уровне двух лечащих врачей и 4o». Авторы добавили, что разница была особенно заметна на первом этапе — во время начальной сортировки в приемном покое, когда информации о пациенте меньше всего, а решение нужно принимать быстро.

В пресс-релизе Гарвардской медицинской школы исследователи отдельно подчеркнули, что не проводили предварительную обработку данных. Модели получали ровно те же сведения, которые были доступны в электронных медкартах на момент постановки диагноза.

При такой постановке эксперимента модель o1 дала «точный или очень близкий диагноз» в 67% случаев на этапе сортировки. У одного врача этот показатель составил 55%, у второго — 50%.

«Мы проверили модель ИИ почти по всем ключевым метрикам, и она превзошла как предыдущие модели, так и наших врачей в контрольной группе», — сказал Арджун Манрай, руководитель лаборатории ИИ в Гарвардской медицинской школе и один из ведущих авторов исследования.

При этом авторы не утверждают, что ИИ уже готов принимать решения с риском для жизни в отделениях неотложной помощи. По их словам, результаты показывают «срочную необходимость в проспективных испытаниях», чтобы проверить такие технологии в реальной клинической практике.

Исследователи также уточнили, что изучали работу моделей только с текстовой информацией. В статье сказано, что текущие базовые модели пока хуже справляются с анализом нетекстовых данных.

Один из ведущих авторов исследования, врач Beth Israel Адам Родман, сказал The Guardian, что сейчас нет формальной системы ответственности за диагнозы, поставленные ИИ. Он добавил, что пациенты по-прежнему хотят, чтобы именно люди сопровождали их при решениях, связанных с риском для жизни, и при выборе сложного лечения.

Источник: Science, пресс-релиз Harvard Medical School, The Guardian.