# GPT-6 Astra набирає 80% на бенчмарку складання IKEA

> GPT-6 Astra набирає 80% на бенчмарку складання меблів IKEA проти 28% десять місяців тому. Час тестувати асинхронні перевірки фото в ремонті та складанні.

- Опубліковано: 26 вересня 2026 р. (2026-09-26T13:56:46.395725+00:00)
- Розділ: AI-дослідження
- На основі публікації: [The Decoder](https://the-decoder.com/openais-gpt-6-astra-can-now-tell-you-exactly-where-you-screwed-up-your-ikea-shelf/)
- Видання: AiiN (https://aiin.news)
- URL: https://aiin.news/article?slug=gpt-6-astra-%D0%BD%D0%B0%D0%B1%D0%B8%D1%80%D0%B0%D1%94-80-%D0%BD%D0%B0-%D0%B1%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D1%83-%D1%81%D0%BA%D0%BB%D0%B0%D0%B4%D0%B0%D0%BD%D0%BD%D1%8F-ikea

---

GPT-6 Astra набирає **80%** на FAB — бенчмарку Epoch AI, де модель аналізує фото трьох предметів IKEA зі свідомими помилками. Один знімок вона обробляє близько трьох хвилин.

Між листопадом 2025-го і сьогоднішнім результатом — десять місяців. Тоді найкращою вважали Claude Opus 4.5 з 28%.

[За даними The Decoder](https://the-decoder.com/openais-gpt-6-astra-can-now-tell-you-exactly-where-you-screwed-up-your-ikea-shelf/), технологія ще заповільна для підказки в момент складання: три хвилини на фото не встигають за людським темпом. Дослідники додають, що схема, ймовірно, доведе до автоматичної допомоги з ремонтом авто та побутовою технікою.

## Що саме перевіряє FAB?

Бенчмарк фотографує три предмети IKEA під час складання і свідомо псує їх. Модель отримує знімки та інструкцію, має знайти відхилення від інструкції й описати, що пішло не так.

Оцінюють саме здатність побачити помилку і правильно її описати. Прогрес тим більше вражає, що нещодавно моделі провалювали значно простіші візуальні завдання. Практичний висновок: якість сильно залежить від того, чи отримує модель інструкцію та історію етапів, а не тільки фото.

## Наскільки Astra випередила конкурентів?

Astra — 80%. Далі Claude Fable 5.1 із 70% і Claude Opus 5 із 61%. Китайські open-weight моделі на кшталт Kimi K3 відстають від лідерів щонайменше на сім місяців. Водночас Astra сильна і на інших візуальних робототехнічних завданнях.

Для self-hosting сценаріїв сім місяців — це горизонт, на який варто планувати: ймовірно, відкриті моделі підтягнуться слідом за лідерами, але критичні перевірки зараз радніше будувати на закритих API.

## Що це змінює для сервісів з камерою?

Поки що нічого в реальному часі: три хвилини на фото не встигають за темпом складання. Реалістичний сценарій — асинхронна перевірка після етапу, де клієнт надсилає фото вузла, система звіряє його з мануалом і повертає крок виправлення. Оператор підключається лише у спірних випадках, що знімає частину навантаження з першої лінії.

Окремо заміряйте на власних фото час відповіді, розподіл помилок за типами етапів і частку хибних спрацювань — саме ці три метрики покажуть, чи витримає ваш сценарій затримку.

## Що робити зараз?

Прямий ефір із керуванням руками доведеться відкласти. Почати варто з даних і вимірювання затримки:

- Додайте фотофіксацію після кожного етапу складання чи ремонту та зберігайте пари «фото + інструкція».
- Протестуйте звʼязку «фото, інструкція, вимога назвати помилку» на своїх реальних кейсах і заміряйте точність та час відповіді.
- Закладіть асинхронний сценарій: користувач надсилає фото, отримує розбір і виправляє помилку до наступного кроку.
- Логуйте хибні спрацювання до і після виправлення, щоб мати датасет для регресії.

---

Теги: AI, OpenAI, Claude, компʼютернийзір, AR

Джерело: AiiN — https://aiin.news/article?slug=gpt-6-astra-%D0%BD%D0%B0%D0%B1%D0%B8%D1%80%D0%B0%D1%94-80-%D0%BD%D0%B0-%D0%B1%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D1%83-%D1%81%D0%BA%D0%BB%D0%B0%D0%B4%D0%B0%D0%BD%D0%BD%D1%8F-ikea. Цитуючи, посилайтесь на канонічний URL.
