НовостиАкцииНовое исследование медицинского ИИ выявило схожие ошибки пропусков в инструментах OpenEvidence, OpenAI, Anthropic и Doximity

Новое исследование медицинского ИИ выявило схожие ошибки пропусков в инструментах OpenEvidence, OpenAI, Anthropic и Doximity

Автор: Fortune Crypto·

Ключевые выводы

  • Оценка OpenEvidence выросла с $1 млрд в феврале до $12 млрд в январе после серии раундов финансирования на общую сумму около $700 млн.
  • ИИ-ассистент Ask от Doximity продается через платные корпоративные контракты и включает слой человеческой проверки PeerCheck.
  • Бенчмарк NOHARM протестировал 1,100 реальных клинических случаев в нескольких ИИ-системах и поставил Doximity Ask на первое место.
  • Среди протестированных систем 76.6% вредных ошибок были ошибками пропуска, а не неверными утверждениями.
  • FDA смягчило ограничения для некоторых ИИ-инструментов поддержки клинических решений, тогда как многие штаты приняли новые законы об ИИ в здравоохранении, требующие участия человека.
Новое исследование медицинского ИИ выявило схожие ошибки пропусков в инструментах OpenEvidence, OpenAI, Anthropic и Doximity

Ваш врач, вероятно, ищет симптомы на телефоне.

OpenEvidence, основанная в 2021 году, — это бесплатная ИИ-поисковая система для врачей с рекламной поддержкой, которая на месте оказания помощи извлекает ответы напрямую из рецензируемых медицинских журналов и указывает силу доказательств. Компания стала своего рода символом бума медицинского ИИ.

Оценка компании быстро росла. В феврале раунд под руководством Sequoia оценил OpenEvidence в $1 млрд. В последующие месяцы показатель вырос до $3.5 млрд к июлю, когда GV и Kleiner Perkins выступили со-лидерами, затем до $6 млрд в октябре и до $12 млрд в январе этого года в раунде, со-лидерами которого были Thrive Capital и DST Global. В сумме это составляет примерно $700 млн, привлеченных примерно за год.

Doximity пошла другим путем. Компания, наиболее известная как профессиональная сеть для врачей, теперь продает ИИ-ассистента под названием Ask, который помогает врачам суммировать заметки по пациентам, проверять взаимодействия лекарств и готовить документацию. Ask включен в платные корпоративные контракты более чем с 150 системами здравоохранения. Каждый ответ проходит через слой человеческой проверки под названием PeerCheck, где врачи сверяют вывод ИИ с исходными источниками, на которые он ссылается. Doximity сообщила о квартальной выручке $145.4 млн этой весной, что на 5% больше, чем годом ранее.

В середине июля новый независимый бенчмарк под названием NOHARM протестировал ИИ-инструменты Doximity и OpenEvidence, а также GPT-5.6 Sol от OpenAI и Claude Fable 5 от Anthropic. Бенчмарк, созданный исследователями из Stanford, Harvard и сети ARISE, прогнал через каждую модель 1,100 реальных клинических случаев и собрал примерно 13,000 аннотаций врачей для оценки вреда для пациентов. Первое место занял Doximity Ask. Однако OpenEvidence оспорила точность оценки Doximity.

«Мы считаем, что строгая методология исследования не позволяет ИИ с идеальной памятью просить о “повторных тестах”», — сказал мне по электронной почте CEO Daniel Nadler. «Мы подозреваем, что это не прошло бы рецензирование. Если говорить ясно, исследование NOHARM вообще не прошло рецензирование — базовое обязательное требование в медицине даже для самых слабых медицинских выводов».

Но суть результата не в том, кто «победил». Важно то, что даже самые сильные модели по-прежнему что-то упускают. Среди всех протестированных ИИ-систем 76.6% вредных ошибок были ошибками пропуска, то есть ИИ что-то не включил, а не сообщил фактически неверную информацию.

Eric Topol, кардиолог, ученый Scripps Research и сопредседатель программы PeerCheck Doximity, посвятил карьеру изучению диагностических ошибок. Он сказал, что это различие существенно: «Ошибки пропуска нужно довести как можно ближе к нулю», — сказал он мне, добавив, что современные модели сохраняют «иллюзию готовности», которая сопровождает медицинский ИИ даже по мере его совершенствования. При этом NOHARM все же отметил, что врачи, использующие ИИ, оказывали более качественную помощь, чем врачи без него.

Регуляторный фон делает момент публикации NOHARM особенно показательным. В январе FDA смягчило свою позицию по ИИ-инструментам поддержки клинических решений, предоставив им больше пространства для работы при условии, что врачи могут самостоятельно проверять логику ИИ. Штаты двинулись в противоположном направлении, приняв в 2026 году более дюжины новых законов, регулирующих использование ИИ в здравоохранении; большинство из них требуют подтверждения со стороны человека до того, как решение с участием ИИ достигнет пациента. Закон о врачебной ответственности не успевает ни за одной из тенденций: суды все еще определяют, на ком лежит ответственность — на враче, больнице или поставщике ИИ, — когда рекомендация модели оказывается неверной.

Эта правовая серая зона, вероятно, станет одним из первых сигналов того, что начнут спрашивать регуляторы, больничные системы и следующая волна инвесторов.

До завтра,

Lily Mae Lazarus X: @LilyMaeLazarus Email: [email protected] Submit a deal for the Term Sheet newsletter here.

Joey Abrams curated the deals section of today’s newsletter. Subscribe here.

This story was originally featured on Fortune.com