Модель GPT-6 Astra від OpenAI пройшла відеогру Portal, витративши на інференс $571 у токенах — цей результат став новим орієнтиром для оцінки агентних здібностей великих мовних моделей у задачах з довгим часовим горизонтом. На відміну від чат-бенчмарків, де модель відповідає на одне питання, Portal вимагає десятків послідовних кроків: орієнтації у просторі, планування траєкторії руху, запам'ятовування стану кімнати та виправлення власних помилок без підказки ззовні.
Для індустрії AI-агентів це не просто цікавинка. Ігри на кшталт Portal чи Pokemon вже кілька років використовують як неформальний тест на «агентність» — здатність моделі діяти автономно протягом тривалого часу, а не видавати одну коректну відповідь. За даними Mezha, GPT-6 Astra впоралася із завданням повністю, і головним предметом обговорення стала саме вартість — $571 у токенах за одне проходження.
Що саме зробила GPT-6 Astra в Portal?
Модель самостійно пройшла гру Portal від початку до кінця, витративши $571 на токени під час ігрової сесії. Portal — це головоломка від першої особи, де гравець переміщається між кімнатами за допомогою порталів, розв'язуючи фізичні задачі без текстових підказок. Для мовної моделі це означає постійну інтерпретацію візуального або описового стану сцени, вибір дії та перевірку результату — цикл, який повторюється сотні разів поспіль.
Чому проходження відеогри — показовий бенчмарк для AI-агентів?
Такі тести цінні саме тому, що їх не можна «вивчити напам'ять» із тренувальних даних у прямому сенсі — кожна ігрова сесія розгортається по-своєму залежно від дій моделі. Це виявляє слабкі місця, які не видно на статичних бенчмарках:
- здатність утримувати контекст про стан середовища протягом тривалої взаємодії;
- вміння відновлюватися після помилкового кроку, а не застрягати в циклі;
- просторове мислення — розуміння геометрії рівня без явного текстового опису.
Саме тому провідні лабораторії регулярно публікують подібні демонстрації: вони простіше комунікуються широкій аудиторії, ніж чергова таблиця з відсотками на MMLU чи GPQA.
Скільки коштує $571 у токенах і кому це важливо?
Для AI-білдерів, які проєктують власних агентів, цифра $571 за одне проходження гри — це насамперед сигнал про те, як швидко зростає вартість довгих агентних циклів. Кожен крок у грі — це новий виклик моделі з накопиченим контекстом попередніх дій, і чим довша сесія, тим дорожче коштує кожен наступний токен через зростання розміру промпту. У продакшн-агентах — рекомендаційних системах, автоматизації тестування, дослідницьких асистентах — та сама механіка діє: без обмеження горизонту планування чи стиснення контексту вартість інференсу може вийти з-під контролю ще до того, як задача буде виконана.
Що робити з цим AI-білдерам зараз?
Практичний висновок для тих, хто будує агентів на GPT-6 Astra чи подібних моделях, — закладати бюджет на токени як окрему змінну проєктування, а не постфактум. Варто тестувати задачі на коротших епізодах перед масштабуванням, використовувати кешування контексту там, де це підтримує API, і розбивати довгі агентні цикли на підзадачі з чіткими контрольними точками, щоб помилка на 80-му кроці не коштувала стільки ж, скільки весь прогін заново. Ми вже розбирали перші враження від моделі в матеріалі GPT-6 Astra: перші враження і що з ними робити AI-білдерам — там більше конкретики про поведінку моделі поза ігровим контекстом.
Висновок AiiN
За нашою оцінкою, головна цінність цього епізоду не в самому факті проходження Portal, а в тому, що OpenAI і подібні лабораторії почали публічно озвучувати вартість агентних сесій у доларах, а не лише у відсотках успіху. Це зміщує фокус розмови з «чи вміє модель» на «за яку ціну вона це вміє» — і саме друге питання визначатиме, які агентні застосунки стануть комерційно життєздатними, а які лишаться ефектними демонстраціями.
Що таке агентний бенчмарк?
Агентний бенчмарк — це тест, який оцінює здатність моделі самостійно виконувати багатокрокові задачі в динамічному середовищі, а не давати одну правильну відповідь на статичне запитання. Проходження відеогри — один з наочних варіантів такого тесту.
Чи означає це, що GPT-6 Astra готова до складних автономних задач у продакшні?
Прямо з новини це не випливає: проходження однієї гри демонструє потенціал у просторових багатокрокових задачах, але не є доказом надійності в довільних робочих сценаріях. Ймовірно, для продакшн-використання знадобляться додаткові тести на стабільність і контроль вартості.