ThinkingBox — спільний бенчмарк Microsoft і Hugging Face — прогнав агентів через 507 бізнес-процесів, кожен по 20 незалежних спроб з чистого стану бекенду. Більшість провалів при цьому виглядала чисто.

Клієнтка чекала кухонний прилад за $745, який 15 днів висів у статусі exception на складі кур'єра в Нашвіллі. Агент зробив дев'ять коректних викликів: витягнув замовлення, перевірив трекінг, підняв профіль клієнта, двічі пошукав політику відшкодувань, переконався, що тікета немає, відкрив його, задокументував таймлайн — і закрив тікет як solved із відповіддю, що запит вирішено. За даними Microsoft і Hugging Face, єдиний чек, який не проходить у цій задачі, — статус тікету: замість обов'язкового hold там стоїть solved. Клієнтка при цьому не отримала відповіді на своє питання, а виняток перевізника лишився відкритим.

У спільному замірі на 121 680 коректних спробах для 12 моделей 79 853 спроби не пройшли перевірки, що виконуються кодом. Серед цих провалів 67,24% завершились чисто, викликали інструмент зі зміною стану і не показали фінальної помилки — тобто агент виглядав успішним. Перевірки стану знайшли в цих спробах хибні значення полів у 77,61% випадків, небажані побічні ефекти — у 43,30%, відсутні обов'язкові ефекти — у 25,36%; ці категорії частково накладаються.

Чому виклик інструмента ще не результат?

Фінальна відповідь і коректний виклик інструмента — лише посередники: агент може звучати правильно, але залишити неправильне значення, змінити не той запис або створити зайвий побічний ефект. ThinkingBox трактує траєкторію як твердження, а записи, які агент залишив у базі, — як доказ.

Скільки успіху витримує 20 повторів?

ThinkingBox запускає кожну задачу 20 разів з однакового чистого стану бекенду, тож кожна спроба — незалежна перевірка, а не продовження попередньої.

pass@1 у ThinkingBox — оцінка результату однієї спроби, і саме її найчастіше публікують у рейтингах. Найкращий результат показала модель Claude Opus 5.5: 67,16%, на дві третіх пункту вище Claude Opus 5. Найсильніша модель з відкритими вагами — Kimi-K3 — тримається в межах одного пункту від GPT-6 Astra. Розкриття за доменами різке: Claude Opus 4.6 набирає 68,62% на ритейлі й 8,30% на автострахуванні.

Двадцять повторів з'їдають більшість результату. GPT-6 Astra зберігає 78% свого pass@1, Claude Opus 5.5 і Claude Opus 5 — по 71%. Моделі GLM-5.1, Kimi-K2.6 і DeepSeek-V4-Pro утримують близько 8%.

Що важливіше: покриття чи стабільність?

Kimi-K3 розв'язує найбільше задач хоча б раз, а Claude Opus 5 — найбільше задач у всіх 20 спробах. Ці дві метрики дають різні відповіді на питання, чи можна віддати агенту гроші клієнта.

Модель Kimi-K3 розв'язує хоча б раз 476 із 507 задач, тобто 93,89%, і лише 31 задача їй не дається взагалі. На ритейлі вона перша з 82,24% за pass@1, попереду всіх пропрієтарних моделей. Але 20 із 20 спроб їй даються лише на 68 задачах — 13,41%.

Модель Claude Opus 5 розв'язує хоча б раз менше: 79,09%, і 106 задач її зупиняють повністю. Натомість усі 20 спроб вона витримує на 47,53% бенчмарку. Модель Claude Opus 5.5 набирає 67,16% проти 66,50% у Claude Opus 5 і розв'язує більше задач хоча б раз, але задач з результатом 20 із 20 у двох моделей рівно 241: пів пункту в pass@1 не додали жодної стабільної задачі. У цифрах: Kimi-K3 бере на 75 задач більше хоча б раз, а Claude Opus 5 витримує 20 із 20 на 173 задачах більше.

Що перевірити перед релізом агента?

ThinkingBox вимірює стан бекенду на момент завершення, тож таку перевірку можна вбудувати в кожен реліз, а сам бенчмарк — запустити самостійно через OpenEnv.