В Тайване проведено исследование, которое выявило, что популярные AI-инструменты, включая ChatGPT, демонстрируют низкую точность при ответах на клинические вопросы, связанные с инсультом. Это вызывает серьезные опасения относительно надежности больших языковых моделей в медицинских ситуациях.
Исследование, представленное ассоциированным профессором Национального университета Тайваня, оценивало работу AI на четырех этапах ухода за пациентами с инсультом. Учитывая, что все больше пациентов обращаются к интернету и AI за медицинской информацией, важно тщательно оценивать точность этих инструментов.
В ходе исследования тестировались модели ChatGPT-4o, Claude 3 Sonnet и Gemini Ultra 1.0 с использованием смоделированных клинических сценариев. Применялись три метода запроса: Zero-Shot Learning, Chain of Thought и Talking Out Your Thoughts. Оценивались ответы на предмет точности, наличия галлюцинаций, специфичности, эмпатии и возможности применения.
Большинство AI-моделей не смогли преодолеть порог клинической компетентности в 60 баллов из 100. Модели часто не предоставляли действенные рекомендации, особенно в критических ситуациях, связанных с лечением инсульта, где ошибки и неполные ответы были обычным делом.
Профессор Ли отметил, что хотя AI может быть полезен для получения общей информации о здоровье, он ненадежен в экстренных или высокострессовых ситуациях, требующих профессионального суждения. Включение личной информации, такой как возраст, пол, семейная медицинская история и использование медикаментов, может повысить релевантность ответов, генерируемых AI.
Врач Национального университета Тайваня также подчеркнул, что AI-инструменты должны использоваться только как дополнительные источники информации, а не заменять медицинских специалистов.
Исследование показало, что каждый метод запроса имеет свои сильные стороны. Среди трех моделей GPT-4o показал лучшие результаты по точности, специфичности и возможности применения. Однако большие языковые модели все еще имеют значительные ограничения в предоставлении клинически релевантных и действенных рекомендаций. Исследователи пришли к выводу, что информация о здоровье, генерируемая AI, может не всегда соответствовать клиническим стандартам, что подчеркивает необходимость осторожного подхода пациентов к этим ресурсам.