Дослідники оприлюднили на arXiv (стаття 2608.30653, серпень 2026) новий бенчмарк, який точно вимірює галюцинації мультимодальних LLM у сценарії, коли модель обробляє кілька зображень одночасно, а не одне окреме фото.
Це не косметичне уточнення методології. Більшість наявних тестів на «правдивість» мультимодальних моделей — на кшталт класичних VQA-наборів — перевіряють, чи модель коректно описує одне зображення. Але реальні продукти дедалі частіше показують моделі одразу кілька кадрів: скріншоти діалогу, серію фотографій товару, сторінки одного документа, кадри з відео. У цьому режимі модель мусить не просто «побачити» картинку, а утримати в увазі, яка деталь належить якому саме зображенню — і саме тут, за нашою оцінкою, галюцинації трапляються найчастіше.
За даними arXiv, новий бенчмарк побудований так, щоб точно фіксувати саме цей тип помилок — коли модель приписує одному зображенню факт, який насправді належить іншому, або «вигадує» звʼязок між кадрами, якого не існує.
Що саме пропонують дослідники?
У центрі роботи — набір тестових завдань, у яких мультимодальна LLM отримує кілька зображень одночасно і має відповісти на питання, що вимагає порівняння або зіставлення інформації між ними. Бенчмарк оцінює не загальну «розумність» відповіді, а конкретно точність: чи не приписала модель зображенню №2 деталь із зображення №1, чи не вигадала обʼєкт, якого немає в жодному з кадрів.
Точність тут — ключове слово: погано відкалібрований тест галюцинацій легко дає хибний результат — або занижує кількість помилок, приймаючи розпливчасту відповідь за правильну, або, навпаки, штрафує модель за коректну відповідь, сформульовану інакше, ніж очікує анотація. Тому наголос саме на точності методики, а не лише на розмірі набору даних, і робить цей бенчмарк вартим уваги.
Чому кілька зображень — це інша задача, ніж одне?
З одним зображенням модель має один контекст для перевірки факту. З кількома — вона мусить утримувати окрему «картину світу» для кожного кадру і не змішувати їх, а це суттєво важча задача для механізму уваги в трансформерах. Практика показує, що саме на стику кількох джерел інформації моделі найчастіше «додумують» деталі, яких не бачили, — тому й потрібен окремий, точніший вимір цієї помилки, а не перенесення результатів single-image тестів.
- Плутанина, яке зображення містить яку деталь
- Вигаданий звʼязок або порівняння між кадрами, якого немає у вхідних даних
- Перенесення ознак одного обʼєкта на інший через схожість зображень
Кому цей бенчмарк знадобиться на практиці?
Найбільше — командам, що будують vision-агентів, які працюють одразу з кількома зображеннями: порівняння товарів у каталозі, аналіз серії скріншотів, обробка багатосторінкових документів або кадрів з відео. Без окремого виміру галюцинацій саме в мульти-image режимі такі команди досі орієнтувалися на загальні бенчмарки, які не показують, наскільки модель надійна, коли на вхід подають більше одного зображення одночасно.
- Рітейл-асистенти, що порівнюють кілька фото одного товару
- Агенти для аналізу багатосторінкових PDF та сканів документів
- QA-інструменти, що порівнюють скріншоти інтерфейсу до і після змін
Висновок AiiN: що робити з цим зараз?
Наша теза проста: якщо продукт показує моделі більше одного зображення за раз — а таких продуктів стає дедалі більше, від рітейл-асистентів до аналізу документів, — покладатися на бенчмарки з одним зображенням для оцінки надійності вже недостатньо. Перед тим як вивести vision-агента в продакшн, варто прогнати його саме на мульти-image тестах на кшталт цього, а не лише на класичних VQA-наборах, які просто не бачать цього класу помилок.
Що таке галюцинація мультимодальної моделі?
Це ситуація, коли модель впевнено видає факт про зображення, якого насправді на ньому немає, — вигаданий обʼєкт, неіснуючий текст або хибний звʼязок між кадрами. У режимі з кількома зображеннями до цього додається ще й ризик переплутати самі джерела інформації.
Чим цей бенчмарк відрізняється від попередніх тестів на галюцинації?
Попередні тести здебільшого перевіряли одне зображення за раз, тому не фіксували помилки, що виникають саме при зіставленні кількох кадрів між собою. Новий бенчмарк закриває цю прогалину, зосереджуючись саме на мульти-image сценарії.
Чи означає новий бенчмарк, що проблему галюцинацій уже розвʼязано?
Ні. Бенчмарк — це інструмент вимірювання, а не рішення. Він дає командам точнішу метрику, за якою можна порівнювати моделі й відстежувати прогрес, але саму схильність LLM до галюцинацій він не усуває.