Nvidia показала SoL-Pi — систему, яка автоматично оптимізує harness агента для кодування. Найекономніша конфігурація витрачає на 49% менше токенів і зберігає 93,7% результату базової обв'язки Pi.
Для команд, які ганяють агентів у CI та на великих записах, це питання собівартості. Знижки на самі токени не допомагають, коли керуючий шар генерує зайві виклики моделі.
Де губляються токени?
Harness — це контрольний шар між моделлю та середовищем: він визначає, що агент бачить у кожному кроці, коли викликає інструмент і як обробляє відповідь. Так побудовані Codex, Claude Code та OpenClaw.
Досі економію шукали на рівні моделі: пришвидшували attention-ядра, застосовували квантування, підставляли дешевші моделі. Оптимізувати сам harness складніше, бо робота з інструментами, керування контекстом, перевірка результату й логіка зупинки тісно пов'язані — зміна в одному місці дає збої в іншому. Зазвичай інженер читає довгі трейси агента й переписує логіку за повторюваними помилками. За даними The Decoder, SoL-Pi робить це автоматично: дослідник спостерігає за трейсами іншого агента, пропонує зміни й перевіряє їх у підготовлених середовищах, а кандидатів відсіюють перевірки спроможності та економічності.
Масштаб пошуку був таким самим, який витримує ручна робота: 535 середовищ, 152 напрями, понад 3 000 запусків і понад 60 000 взаємодій агента із середовищем — зокрема на 495 задачах, зібраних із пар issue–pull request на GitHub, і 40 синтетичних кейсах. Щоб harness не підганявся під тренувальні задачі, оцінювання відокремили від пошуку: EdgeBench закрили від пошуку повністю, 11 із 51 публічної задачі віддали на одноразову перевірку готових кандидатів, а 40 залишили для фінальної оцінки — ці результати не поверталися в пошук.
Що прибирає зайву роботу?
Пошук дав чотири механізми, кожен прибирає свій тип повторів.
- Action Fusion зливає два сусідні кроки в один — правку коду й запуск тестів — і знімає цілий виклик моделі.
- Online Context Compact спрацьовує після кожного кроку планування та підчищає накопичений контекст, не втрачаючи важливого.
- ObservationPack архівує довгі виводи інструментів, а на наступних кроках підставляє коротке саммарі замість повного тексту.
- Evidence-Preserving Reducer віддає великі логи помилок і тестів дешевшій моделі, яка стислює їх до ключових знахідок; автоматична перевірка ловить важливі підказки, які проскочили.
Скільки це дає в грошах?
Усі чотири механізми разом — це найекономніша конфігурація: 49% менше токенів і 93,7% результату Pi на 51 публічній задачі EdgeBench. Коли пріоритет у якості, достатньо одного найсильнішого механізму: він обходить Pi на 5,3% і все одно економить токени. Сумарно по двох варіантах економія становить 44,7–49%.
Автори оцінюють економію у $8,75–$13,50 за годину проти власних harness у Codex і Claude Code та у $4,36–$5,71 за годину проти Pi, за поточними цінами API.
Систему збирали лише на GPT-5.6 Sol, а потім перенесли без жодних змін на Opus 5: там вона втримала 94,3% результату Pi з подібною економією, але механізми спрацьовували рідше й м'якше — автори списують це на те, що оптимізували під траєкторії однієї моделі.
За межами EdgeBench картина строката. На 63 CPU-задачах Terminal-Bench 4 SoL-Pi розв'язує 15 задач проти 18 у Codex і Pi, витрати при цьому нижчі приблизно на чверть. На шести формально верифікованих задачах IMO 2026 у Lean 4 система розв'язала три з шести за найнижчою ціною розв'язку, а в експерименті з оптимізацією ядра 20 паралельних SoL-Pi-агентів витратили на 26,8% менше, ніж порівнянна команда на Pi.
Схожий ефект показав серпневий тест tooling-компанії Composio: Deepseek V4 Flash у чотирьох агентських фреймворках, зокрема Claude Code та Oh My Pi на базі Pi, дав розкид ціни за розв'язок майже в три рази. Тим часом аналітик OpenRouter Peter Walker фіксує зростання агентського споживання токенів у 14 разів з лютого 2026 року, причому майже 70% припадає на кешовані промпти.
Що перенести у свою обв'язку?
Перенесіть у свою обв'язку те, що дешево вимірюється, і міряйте ефект у грошах за розв'язок, а не лише в токенах.
- Злийте правку й запуск тестів в один виклик, а довгі виводи інструментів архівуйте і підставляйте на наступних кроках коротке саммарі.
- Чистіть контекст після кроку планування, а великі логи помилок проганяйте через дешеву модель з автоматичною перевіркою, чи не втрачено ключових підказок.
- Тримайте фінальне оцінювання окремо від пошуку налаштувань, інакше обв'язка підганяється під тренувальні задачі.
- Стежте за повторним використанням кешу промптів: коротший контекст зменшує його перевикористання, тож частина економії може зникнути на рахунку.