GPT-6 Astra набирає 80% на FAB — бенчмарку Epoch AI, де модель аналізує фото трьох предметів IKEA зі свідомими помилками. Один знімок вона обробляє близько трьох хвилин.
Між листопадом 2025-го і сьогоднішнім результатом — десять місяців. Тоді найкращою вважали Claude Opus 4.5 з 28%.
За даними The Decoder, технологія ще заповільна для підказки в момент складання: три хвилини на фото не встигають за людським темпом. Дослідники додають, що схема, ймовірно, доведе до автоматичної допомоги з ремонтом авто та побутовою технікою.
Що саме перевіряє FAB?
Бенчмарк фотографує три предмети IKEA під час складання і свідомо псує їх. Модель отримує знімки та інструкцію, має знайти відхилення від інструкції й описати, що пішло не так.
Оцінюють саме здатність побачити помилку і правильно її описати. Прогрес тим більше вражає, що нещодавно моделі провалювали значно простіші візуальні завдання. Практичний висновок: якість сильно залежить від того, чи отримує модель інструкцію та історію етапів, а не тільки фото.
Наскільки Astra випередила конкурентів?
Astra — 80%. Далі Claude Fable 5.1 із 70% і Claude Opus 5 із 61%. Китайські open-weight моделі на кшталт Kimi K3 відстають від лідерів щонайменше на сім місяців. Водночас Astra сильна і на інших візуальних робототехнічних завданнях.
Для self-hosting сценаріїв сім місяців — це горизонт, на який варто планувати: ймовірно, відкриті моделі підтягнуться слідом за лідерами, але критичні перевірки зараз радніше будувати на закритих API.
Що це змінює для сервісів з камерою?
Поки що нічого в реальному часі: три хвилини на фото не встигають за темпом складання. Реалістичний сценарій — асинхронна перевірка після етапу, де клієнт надсилає фото вузла, система звіряє його з мануалом і повертає крок виправлення. Оператор підключається лише у спірних випадках, що знімає частину навантаження з першої лінії.
Окремо заміряйте на власних фото час відповіді, розподіл помилок за типами етапів і частку хибних спрацювань — саме ці три метрики покажуть, чи витримає ваш сценарій затримку.
Що робити зараз?
Прямий ефір із керуванням руками доведеться відкласти. Почати варто з даних і вимірювання затримки:
- Додайте фотофіксацію після кожного етапу складання чи ремонту та зберігайте пари «фото + інструкція».
- Протестуйте звʼязку «фото, інструкція, вимога назвати помилку» на своїх реальних кейсах і заміряйте точність та час відповіді.
- Закладіть асинхронний сценарій: користувач надсилає фото, отримує розбір і виправляє помилку до наступного кроку.
- Логуйте хибні спрацювання до і після виправлення, щоб мати датасет для регресії.