# ThinkingBox: агент сказав «готово», база заперечила

> Microsoft і Hugging Face прогнали агентів через 507 бізнес-процесів по 20 разів: більшість провалів виглядала чисто, тому перевіряйте базу, а не чат.

- Опубліковано: 5 жовтня 2026 р. (2026-10-05T01:32:19.828549+00:00)
- Розділ: Агенти
- На основі публікації: [Hugging Face](https://huggingface.co/blog/microsoft/thinkingbox)
- Видання: AiiN (https://aiin.news)
- URL: https://aiin.news/article?slug=thinkingbox-%D0%B0%D0%B3%D0%B5%D0%BD%D1%82-%D1%81%D0%BA%D0%B0%D0%B7%D0%B0%D0%B2-%D0%B3%D0%BE%D1%82%D0%BE%D0%B2%D0%BE-%D0%B1%D0%B0%D0%B7%D0%B0-%D0%B7%D0%B0%D0%BF%D0%B5%D1%80%D0%B5%D1%87%D0%B8%D0%BB%D0%B0

---

ThinkingBox — спільний бенчмарк Microsoft і Hugging Face — прогнав агентів через 507 бізнес-процесів, кожен по 20 незалежних спроб з чистого стану бекенду. Більшість провалів при цьому виглядала чисто.

Клієнтка чекала кухонний прилад за $745, який 15 днів висів у статусі exception на складі кур'єра в Нашвіллі. Агент зробив дев'ять коректних викликів: витягнув замовлення, перевірив трекінг, підняв профіль клієнта, двічі пошукав політику відшкодувань, переконався, що тікета немає, відкрив його, задокументував таймлайн — і закрив тікет як solved із відповіддю, що запит вирішено. [За даними Microsoft і Hugging Face](https://huggingface.co/blog/microsoft/thinkingbox), єдиний чек, який не проходить у цій задачі, — статус тікету: замість обов'язкового hold там стоїть solved. Клієнтка при цьому не отримала відповіді на своє питання, а виняток перевізника лишився відкритим.

У спільному замірі на 121 680 коректних спробах для 12 моделей 79 853 спроби не пройшли перевірки, що виконуються кодом. Серед цих провалів **67,24%** завершились чисто, викликали інструмент зі зміною стану і не показали фінальної помилки — тобто агент виглядав успішним. Перевірки стану знайшли в цих спробах хибні значення полів у 77,61% випадків, небажані побічні ефекти — у 43,30%, відсутні обов'язкові ефекти — у 25,36%; ці категорії частково накладаються.

## Чому виклик інструмента ще не результат?

Фінальна відповідь і коректний виклик інструмента — лише посередники: агент може звучати правильно, але залишити неправильне значення, змінити не той запис або створити зайвий побічний ефект. ThinkingBox трактує траєкторію як твердження, а записи, які агент залишив у базі, — як доказ.

## Скільки успіху витримує 20 повторів?

ThinkingBox запускає кожну задачу 20 разів з однакового чистого стану бекенду, тож кожна спроба — незалежна перевірка, а не продовження попередньої.

pass@1 у ThinkingBox — оцінка результату однієї спроби, і саме її найчастіше публікують у рейтингах. Найкращий результат показала модель Claude Opus 5.5: 67,16%, на дві третіх пункту вище Claude Opus 5. Найсильніша модель з відкритими вагами — Kimi-K3 — тримається в межах одного пункту від GPT-6 Astra. Розкриття за доменами різке: Claude Opus 4.6 набирає 68,62% на ритейлі й 8,30% на автострахуванні.

Двадцять повторів з'їдають більшість результату. GPT-6 Astra зберігає **78%** свого pass@1, Claude Opus 5.5 і Claude Opus 5 — по 71%. Моделі GLM-5.1, Kimi-K2.6 і DeepSeek-V4-Pro утримують близько 8%.

## Що важливіше: покриття чи стабільність?

Kimi-K3 розв'язує найбільше задач хоча б раз, а Claude Opus 5 — найбільше задач у всіх 20 спробах. Ці дві метрики дають різні відповіді на питання, чи можна віддати агенту гроші клієнта.

Модель Kimi-K3 розв'язує хоча б раз 476 із 507 задач, тобто 93,89%, і лише 31 задача їй не дається взагалі. На ритейлі вона перша з 82,24% за pass@1, попереду всіх пропрієтарних моделей. Але 20 із 20 спроб їй даються лише на 68 задачах — 13,41%.

Модель Claude Opus 5 розв'язує хоча б раз менше: 79,09%, і 106 задач її зупиняють повністю. Натомість усі 20 спроб вона витримує на 47,53% бенчмарку. Модель Claude Opus 5.5 набирає 67,16% проти 66,50% у Claude Opus 5 і розв'язує більше задач хоча б раз, але задач з результатом 20 із 20 у двох моделей рівно 241: пів пункту в pass@1 не додали жодної стабільної задачі. У цифрах: Kimi-K3 бере на 75 задач більше хоча б раз, а Claude Opus 5 витримує 20 із 20 на 173 задачах більше.

## Що перевірити перед релізом агента?

ThinkingBox вимірює стан бекенду на момент завершення, тож таку перевірку можна вбудувати в кожен реліз, а сам бенчмарк — запустити самостійно через OpenEnv.

- Пишіть виконувану перевірку під кожну дію зі зміною стану: яке поле, яке значення, який запис чіпати заборонено. Випадок із тікетом зводиться до одного правила: статус має стати hold, а не solved.
- Забороніть агенту закривати тікет і писати «ваше питання вирішено», доки він не звірить статус із базою після власного запису. Те саме стосується повернень, бронювань і платежів.
- Проганяйте кожен сценарій 20 разів із чистого стану перед релізом і рахуйте дві цифри окремо: скільки задач модель розв'язала хоча б раз і скільки — у всіх 20 спробах. Саме друга визначає нічні інциденти.
- Розділяйте оцінку за доменами: 68,62% на ритейлі та 8,30% на автострахуванні в однієї моделі означають різні маршрути й різні ліміти, а не одну універсальну модель.

---

Теги: Агенти, ThinkingBox, Microsoft, HuggingFace, AI

Джерело: AiiN — https://aiin.news/article?slug=thinkingbox-%D0%B0%D0%B3%D0%B5%D0%BD%D1%82-%D1%81%D0%BA%D0%B0%D0%B7%D0%B0%D0%B2-%D0%B3%D0%BE%D1%82%D0%BE%D0%B2%D0%BE-%D0%B1%D0%B0%D0%B7%D0%B0-%D0%B7%D0%B0%D0%BF%D0%B5%D1%80%D0%B5%D1%87%D0%B8%D0%BB%D0%B0. Цитуючи, посилайтесь на канонічний URL.
