Что происходит в ИИ в медицине в июне 2026 года?
В медицинском ИИ и особенно в радиологии в последнее время затишье. Ну выходят иногда какие-то ЛЛМки, проходит очередной MICCAI или MIDL, кто-то купит кого-то. Особо даже и писать не о чем было. Но вдруг твиттер буквально в течение недели взорвался парой очень громких инфоповодов. Кажется, это хороший повод обсудить эти и другие интересные новости.
Midjourney жёстко захайпился с full-body ультразвуковым КТ
Внезапно компания Midjourney, которая раньше была известна своими сервисами по генерации картинок, объявила, что создаёт подразделение Midjourney Medical, и их первый проект - это ультразвуковой томограф. Идея не новая (авторы только за), и работает это примерно так:
- Пациента опускают в бак с водой, чтобы звук проникал внутрь тела, а не отражался от воздуха на коже
- В момент погружения 40 ультразвуковых чип-модулей Butterfly, расположенных кольцом вокруг бака, излучают и принимают звук
- Одно сканирование генерирует терабайты сырых данных (звуковых волн). Далее происходит реконструкция из множества ультразвуковых проекций сквозь объект. Вычислительно это очень дорогая операция, и она производится на удалённых серверах. В теории для ускорения реконструкции можно использовать нейронные сети, но сейчас всё работает на классических алгоритмах типа Full Waveform Inversion, ИИ используется только на этапе сегментации полученных сканов
- Никаких разрешений и FDA пока нет, поэтому пока заявляется, что будет анализироваться только состав тела - жир, мышцы

Ролик с запуском собрал миллионы просмотров - во-первых, многих удивила такая смена курса, но в основном шум поднялся из-за некоторых заявлений, которые были сделаны в блог-постах и в твиттере:
- Метод позиционируется как full-body сканирование для полного скрининга всего организма, хотя кости и газы почти полностью отражают звук, поэтому УЗИ почти не используется для мозга и лёгких
- Метод позиционируется как более дешёвая, безопасная и быстрая замена КТ и МРТ, хотя разрешение изображений пока хуже, а стоимость сканера и реконструкции - судя по всему приличная
- Метод позиционируется как lifetime-скрининг - можно каждый день делать скан и наблюдать изменения в организме. Но пока непонятно, как будут решаться многие проблемы - например, стоимость хранения данных. Можно, конечно, хранить только итоговую реконструкцию, но, возможно, ИИ лучше обучать на сырых сигналах. В любом случае пока выглядит как забава для очень богатых. Ещё один важный момент - плюсы и минусы скрининга в целом. Любой скрининг приводит к ложноположительным срабатываниям и бессимптомным инциденталомам, и в итоге за дополнительные находки мы платим лишними, часто инвазивными процедурами (такую же претензию часто высказывают и по отношению к ПО типа нашего)
- Пока нет никаких подтверждающих данных и клинических испытаний
Я думаю, что к голосам врачей-скептиков стоит прислушаться - особенно в эпоху гиперхайпа, когда компании склонны гиперболизировать свои достижения. Но мне тут даже интереснее в силу моей специализации подумать обо всём этом со стороны ML. В обработке этих огромных массивов данных (в статике и особенно в динамике) явно придётся использовать ИИ. И здесь перед нами опять встаёт интересная дилемма - тренировать специализированные модели под конкретные модальности и патологии (как это делаем мы в Цельсе) или пытаться собрать огромные массивы данных, связывать их с долгосрочными исходами и на всём этом тренировать большие модели. Звучит как разумный подход, но до сих пор, на мой скромный взгляд, он по разным причинам так пока и не сработал. Изменит ли тут что-то новый прибор? Сложно сказать.
Забавно, что ИИ-анализ исследований в динамике так пока и не доехал даже до стандартных рентгенов, КТ и МРТ. Кажется, в ближайшее время это изменится, но на текущий момент все исследования анализируются в статике. Причин у этого много:
- Инфраструктурная - надо загружать в ИИ-сервис не одно исследование, а целую пачку, что при размере в 300 мегабайт не так-то и просто
- MLьная - у компаний очень мало датасетов, где на одного пациента приходится несколько исследований во времени
- Юридическая - на текущий момент все исследования попадают к нам с рандомным идентификатором пациента. Если есть возможность связать несколько исследований пациента, то мы уже вступаем на тонкий лёд
В общем, резюмируя, штука интересная, но мне кажется, что пока это больше хайп. Вряд ли через год в ближайшем пункте выдачи вы, ожидая заказа, сможете сделать себе полнотельное УЗИ в баке с водой.
OpenEvidence vs ChatGPT
Ещё одно громкое событие - выход статьи General-purpose large language models outperform specialized clinical AI tools on medical benchmarks, в которой модели общего пользования (GPT-5.2, Gemini 3.1 Pro, Opus 4.6) обошли специализированные инструменты OpenEvidence и UpToDate по метрикам. Про OpenEvidence я кратко рассказывал на Дата-Ёлке - по сути это ChatGPT для врачей с оценкой в 12 миллиардов долларов, им уже очень активно пользуются в США, и главная его фишка - это жёсткий RAG на курируемом медицинском корпусе (NEJM, JAMA, клинические рекомендации, инструкции к лекарствам).

Эти самые продукты сравнили с обычными моделями на трёх бенчмарках - MedQA (вопросы с вариантами ответов), HealthBench (бенчмарк от OpenAI, тоже рассказывал про него на Дата-Ёлке) и RCQ (100 реальных запросов врачей к ИИ). Итог простой - обычные модели уделали специализированные продукты по всем направлениям. Этот результат вызвал очень бурные обсуждения в твиттере, причём врачи довольно сильно защищали OpenEvidence:
- По их словам OpenEvidence в реальной практике галлюцинирует намного реже ChatGPT
- Этот тест сравнивает системы чисто на бенчмарках и никак не измеряет реальный клинический эффект
- Большие генерализованные модели как раз и заточены, чтобы щёлкать бенчмарки
- Сам OpenEvidence тоже выкатил тред в свою защиту
Так или иначе, с точки зрения ML даже непонятно, что, собственно говоря, сравнивали. Что там под капотом у OpenEvidence - никто не знает. Поэтому делать вывод, что медицинские файнтюны не нужны, я бы не стал, особенно ярко это по нашему опыту проявляется на маленьких моделях, которые как раз часто используются на практике.
В тему измерений качества на бенчмарках как раз вышла ещё одна статья - Measuring Epistemic Resilience of LLMs Under Misleading Medical Context. Авторы подмешивали в популярные медицинские бенчмарки (включая тот же MedQA) различные искажения контекста - искажение референсов (например, добавление в контекст неверного порога нормы для анализа), ложный якорь (яркая, но нерелевантная для кейса деталь), отравление исключением (добавляют выдуманные противопоказания, которые якобы отменяют лучший план лечения) и другие. Источник ложной информации тоже варьировался - просто утверждение, мнение пациента или авторитетный источник.

Как вы можете догадаться, просадка в метриках очень сильная и для закрытых, и для опенсорсных моделей. Одна из техник, которая сильно помогает - это выдать моделям инструменты search_web и visit_web. Это как раз работает в пользу систем типа OpenEvidence, которые по дизайну сильно опираются на проверенные источники.
Интересный вопрос из реплаев в твиттере - а насколько бы просели результаты врачей, если им добавить такой же ложный контекст?
Кстати, по поводу скиллов - в недавнем посте я рассуждал, как экспансия ИИ-агентов влияет и будет влиять на развитие джунов и в целом на наши скиллы. В Nature как раз опубликовали статью на эту тему, которая опирается на октябрьское исследование про влияние ИИ для детекции полипов на скиллы эндоскопистов. Выяснилось, что если отнять у врача ИИ-инструмент после нескольких месяцев использования, то качество обнаружения аденом падает на 6 процентных пунктов.
Ну что тут скажешь. Если у меня сейчас отнять Claude Code, то у меня тоже работа замедлится, причём не на 6%, а в разы. Насколько это плохо? Да нисколько, наверное, так можно и до абсурда дойти - забрать интернет, компьютер, кальян. Как по мне, эта технология уже достаточно доступна (даже у нас, несмотря на все старания различных гадов), чтоб оправдать дистрофию части навыков. Что делать с молодыми врачами - тут, конечно, такой же сложный вопрос, что и с джунами. Например, можно использовать какие-то специальные режимы работы ИИ с встроенной проверкой и обучением.
Заключение
Как мы видим, в медицинском ИИ продолжается классическое столкновение двух миров. Айтишники пытаются изобрести серебряную пулю - универсальный сканер, универсальную модель, универсальный бенчмарк. А врачи в ответ напоминают, что в медицине за каждым красивым демо стоят реальные паценты, ложноположительные находки и ответственность. Где-то на этом стыке обычно и рождается что-то полезное - без инженерного оптимизма мы бы продолжали пользоваться проверенными, но устаревшими методами, а без врачебного скепсиса - уже бы поубивали кучу людей. Скучный, но вечный вывод - нужно дружить, искать компромиссы, искать доказательства эффективности новых технологий.