# TokenCast прогнозує витрати токенів в LLM-агентах

> Метод TokenCast знижує похибку прогнозу витрат токенів на 14,5% і витрачає на 21,3% менше токенів за фіксаний бюджет — без жодного додаткового виклику LLM.

- Опубліковано: 29 вересня 2026 р. (2026-09-29T09:11:51.607073+00:00)
- Розділ: Агенти
- На основі публікації: [arXiv](http://arxiv.org/abs/2609.35760v1)
- Видання: AiiN (https://aiin.news)
- URL: https://aiin.news/article?slug=tokencast-%D0%BF%D1%80%D0%BE%D0%B3%D0%BD%D0%BE%D0%B7%D1%83%D1%94-%D0%B2%D0%B8%D1%82%D1%80%D0%B0%D1%82%D0%B8-%D1%82%D0%BE%D0%BA%D0%B5%D0%BD%D1%96%D0%B2-%D0%B2-llm-%D0%B0%D0%B3%D0%B5%D0%BD%D1%82%D0%B0%D1%85

---

TokenCast прогнозує споживання токенів LLM-агента до старту задачі й оновлює оцінку під час виконання: у різних запусках однієї задачі споживання може відрізнятися більш ніж на порядок.

Автори подали метод на arXiv 28 вересня 2026 року. [За даними arXiv](http://arxiv.org/abs/2609.35760v1), TokenCast вчиться на окремих сегментах виконання й перераховує прогноз без додаткових викликів LLM. Для команди, яка запускає мультистепових агентів у проді, це означає, що бюджет можна закладати до старту, а не гасити перевитрати постфактум.

## Чому витрати одного агента стрибають на порядок?

Стрибок у споживанні пояснюється двома механіками. Агент обирає наступний крок за відгуком інструментів і проміжними результатами, тому одна й та сама задача щоразу йде іншим маршрутом.

Друга механіка — зростання контексту. Кожен наступний виклик зчитує накопичений контекст заново, тож вхідний розмір запитів зростає з кожним кроком. Разом ці дві причини роблять підсумкові витрати непередбачуваними до запуску: прогноз доводиться переглядати просто під час виконання.

## Як TokenCast враховує повторне зчитування контексту?

Метод будує для кожного сегмента виконання окреме витратне представлення. Таке представлення фіксує власне споживання сегмента і приріст контексту, який сегмент залишає після себе.

Сусідні сегменти складаються в накопичену оцінку. Складання враховує додаткову вхідну вартість, зумовлену тим, що кожен пізніший виклик перечитує контекст ранніх сегментів. Новоспостережені дані під час виконання оновлюють прогноз без нових звернень до LLM.

## Що дають 14,5% і 21,3%?

Оцінювали TokenCast на 4 наборах задач і 6 агентних моделях. Зниження середньої абсолютної похибки щодо найсильнішого порівнюваного методу становить **14,5%** у середньому за 96 оцінених комбінацій.

Прогноз забирає **32,8 мс** сукупного часу на запуск на SWE-bench Verified. В офлайн-прогоні контролю бюджету TokenCast витрачає на **21,3%** менше токенів, ніж політика з фіксованим бюджетним лімітом, за однакової частки завершених трас.

## Що робити команді, яка запускає агентів

З цих результатів випливають три кроки, які варто перевірити на власних записах.

- Логуйте витрати не лише за запуск, а за сегментами: власні токени кроку плюс приріст контексту.
- Замініть єдиний фіксований ліміт на перегляд прогнозу під час виконання й ранню зупинку дорогих трас.
- Зіставте політику з фіксованим лімітом і TokenCast на власних трасах — ще до того, як привʼязувати це до оплати.

---

Теги: Агенти, LLM, TokenCast, БюджетAI, AIcosts

Джерело: AiiN — https://aiin.news/article?slug=tokencast-%D0%BF%D1%80%D0%BE%D0%B3%D0%BD%D0%BE%D0%B7%D1%83%D1%94-%D0%B2%D0%B8%D1%82%D1%80%D0%B0%D1%82%D0%B8-%D1%82%D0%BE%D0%BA%D0%B5%D0%BD%D1%96%D0%B2-%D0%B2-llm-%D0%B0%D0%B3%D0%B5%D0%BD%D1%82%D0%B0%D1%85. Цитуючи, посилайтесь на канонічний URL.
