Google розпочала тестування свого дослідницького медичного агента AMIE (Articulate Medical Intelligence Explorer) у форматі відеоконсультацій — наступний крок після експериментів із текстовими та мультимодальними медичними діалогами, які команда Google DeepMind проводила з 2024 року. Ідея проста: перевірити, чи здатна модель вести діагностичну розмову не лише текстом чи статичними фото, а в живому відеодзвінку з пацієнтом, як це відбувається на звичайному телемедичному прийомі.

AMIE вже мала попередню історію публічних досліджень: спершу її тестували в симульованих текстових консультаціях за протоколом OSCE (Objective Structured Clinical Examination) — стандартом, яким медичні школи оцінюють майбутніх лікарів через розмови з акторами-пацієнтами. За результатами тих досліджень лікарі-фахівці, які рецензували діалоги, оцінювали роботу AMIE вище за лікарів первинної ланки за низкою критеріїв — від збору анамнезу до емпатії у спілкуванні, хоча йшлося про симульоване середовище, а не реальний прийом. Пізніше систему розширили мультимодальними можливостями — розпізнаванням знімків шкіри, документів і результатів аналізів, які пацієнт міг показати під час чату.

За даними AI News, наступним етапом стало тестування AMIE саме у форматі клінічних відеоконсультацій — тобто реального відеодзвінка, де модель має одночасно обробляти мову, зображення і, ймовірно, невербальні сигнали пацієнта.

Що саме Google перевіряє у відеоформаті?

Головне питання дослідження — чи впорається AMIE з веденням діагностичної розмови в реальному часі, коли інформація надходить не окремими репліками чи фотографіями, а безперервним відеопотоком. На відміну від текстового чату, де пацієнт формулює скарги письмово, відеодзвінок вимагає від моделі одночасно стежити за мовою, тоном голосу та візуальними ознаками — почервонінням шкіри, набряком, утрудненим диханням — і при цьому вести структурований збір анамнезу за медичним протоколом.

Чим це відрізняється від попередніх версій AMIE?

Еволюція AMIE рухається від найпростішого до найскладнішого формату вводу: спершу текст, потім текст плюс статичні зображення, тепер — відео. Кожен крок додає моделі складніший канал сприйняття, але й наближає взаємодію до того, як насправді відбувається телемедичний прийом. Текстовий чат легко логувати й оцінювати — репліки дискретні, їх можна порівнювати з рубрикою OSCE рядок за рядком. Відео такого зручного членування не має: сигнали накладаються одне на одного в часі, а модель має вирішувати, коли саме втрутитися з питанням, а коли просто слухати — задача, ближча до роботи живого лікаря, ніж до класичного диспетчеризованого чат-бота.

Наскільки цей підхід готовий до реальних клінік?

Поки що йдеться про дослідницьке тестування, а не про продукт, доступний пацієнтам чи лікарням. Попередні етапи AMIE також залишалися в межах симульованих OSCE-сценаріїв з акторами-пацієнтами — це контрольоване середовище, де немає юридичної відповідальності за реальний діагноз і немає тиску реального часу прийому. Перехід до відео додає практичних складнощів: якість відеозв'язку, конфіденційність відеоданих пацієнта, потреба в лікарі, який перевіряє висновки моделі, перш ніж вони впливають на лікування. Про клінічні випробування за участю реальних пацієнтів чи партнерство з конкретними медичними мережами в межах цього тестування не повідомлялося.

Висновок AiiN: що це означає для AI-білдерів у medtech?

За нашою оцінкою, головна цінність цього кроку Google — не в наближенні до «ШІ замінить лікаря», а в демонстрації того, що для медичних агентів потрібна окрема методологія оцінки під кожен канал вводу. Компанія, яка будує клінічного відео-агента, не може просто прогнати ту саму модель через стандартний LLM-бенчмарк і здати в продакшн — потрібен окремий протокол оцінки на кшталт OSCE для кожного нового каналу сприйняття: тексту, зображення, відео. Інакше метрики якості діагностичної розмови залишаться непорівнянними між версіями продукту. Для команд, що роблять телемедичні сервіси, практичний висновок такий: розширення мультимодальності — не косметичне оновлення промпту, а окремий цикл валідації з живими лікарями-рецензентами.

Чи означає це, що AMIE вже доступний пацієнтам?

Ні. AMIE лишається дослідницьким проєктом Google, а не публічним продуктом чи API. Про комерційний реліз або інтеграцію в конкретний телемедичний сервіс на момент цього тестування не повідомлялося.

Чим AMIE відрізняється від звичайного чат-бота для медичних питань?

AMIE створена й оцінюється спеціально під сценарій діагностичної консультації за клінічними протоколами на кшталт OSCE, тоді як універсальні асистенти на кшталт ChatGPT чи Gemini не проходять таку профільну медичну атестацію і не призначені вести структурований збір анамнезу як основну функцію.