SPO++ (Stream-Aligned Policy Optimization) — так називається новий метод асинхронного reinforcement learning для навчання AI-агентів, який дослідники описали в препринті на arXiv у серпні 2026 року. Метод відповідає на конкретну інженерну проблему: як тренувати агента через RL, коли середовище відповідає з різною і непередбачуваною швидкістю, а не синхронно та детерміновано.

За коротким викладом статті, SPO++ покращує стабільність RL-навчання агентів саме в асинхронних середовищах — там, де крок взаємодії (виклик інструменту, запит до зовнішнього API, очікування відповіді браузера чи іншого агента) може тривати від часток секунди до десятків секунд. За даними arXiv, дослідники позиціюють метод як спосіб узгодити оновлення політики з потоком трасекторій, що надходять нерівномірно, замість очікування на синхронізований батч.

Раніше асинхронне тренування агентів було компромісом між швидкістю і стабільністю: масштабування через паралельні воркери прискорювало збір даних, але застарілі (stale) градієнти та розбіжність між поточною і тією політикою, що збирала дані, ламали збіжність навчання. SPO++ претендує на те, щоб зняти цей компроміс.

Що саме пропонує SPO++?

Відповідь — вирівнювання оновлень політики з потоком даних, а не з фіксованим розкладом синхронізації. Замість того, щоб зупиняти всіх воркерів і чекати, поки найповільніший з них завершить крок середовища, SPO++ дозволяє політиці оновлюватися по мірі надходження трасекторій, коригуючи вагу кожного оновлення залежно від того, наскільки «застарілою» була політика на момент збору цих даних. Наш погляд: саме асинхронне RL-навчання — ключ до масштабованого тренування агентів без блокування на повільних кроках середовища, і будь-який метод, що знижує цю ціну застарілості, безпосередньо впливає на економіку тренувальних циклів.

Чому асинхронність досі була вузьким місцем RL для агентів?

Класичні алгоритми на кшталт PPO проєктувалися під синхронний збір досвіду: усі паралельні середовища роблять крок, батч збирається, політика оновлюється — і цикл повторюється. Для агентів, які викликають зовнішні інструменти, читають довгі документи чи чекають на відповідь іншого сервісу, ця модель погано масштабується: один повільний крок середовища блокує весь батч, і дорогий compute простоює. Спроби просто прибрати синхронізацію без додаткових механізмів стабілізації зазвичай призводили до розбіжності політики — навчання ставало нестабільним або взагалі не збігалося.

Це узгоджується з ширшим трендом у розробці агентів: post-training через reinforcement learning стає стандартним етапом після supervised fine-tuning, а не експериментальною надбудовою. Чим дешевший і стабільніший цикл RL-тренування, тим частіше команди зможуть дозволити собі повторні ітерації політики замість одноразового запуску.

Кому і коли це стане в пригоді?

Практична цінність такого методу — не в лабораторному бенчмарку, а в вартості тренувального циклу для команд, що будують RL-агентів поверх LLM. Ідеться не про разовий приріст якості моделі, а про кількість експериментів, які команда може провести за той самий бюджет compute — а це, за нашою оцінкою, найбільш недооцінений важіль прогресу в агентному RL сьогодні. Це особливо актуально для:

Ми вже розбирали суміжну тему — чому довгі контекстні вікна вимагають нового шару інференсу — і асинхронне RL-навчання логічно продовжує цю лінію: інфраструктура під агентів усе більше відходить від синхронних, пакетних патернів у бік потокових.

Висновок AiiN

За нашою оцінкою, головна цінність SPO++ не в конкретних цифрах бенчмарків, а в тому, що метод визнає: агентне RL-навчання за своєю природою асинхронне, і стабільність варто вбудовувати в алгоритм оновлення політики, а не намагатися штучно синхронізувати інфраструктуру під старі алгоритми. Якщо цей підхід підтвердиться на практиці, він знизить бар'єр входу для команд, які не мають ресурсів Google DeepMind чи OpenAI для побудови ідеально синхронізованих RL-кластерів — асинхронність перестане бути технічним боргом і стане архітектурним рішенням за замовчуванням.

Що таке асинхронне RL-навчання агентів?

Це підхід до reinforcement learning, за якого паралельні воркери збирають досвід незалежно один від одного і не чекають, поки всі завершать крок середовища одночасно. Політика оновлюється по мірі надходження даних, а не за фіксованим синхронним розкладом.

Чим SPO++ відрізняється від класичного PPO?

Класичний PPO і подібні алгоритми передбачають синхронний збір батчів досвіду перед кожним оновленням політики. SPO++, за коротким викладом дослідників, вирівнює оновлення з потоком трасекторій, що надходять асинхронно, і завдяки цьому зберігає стабільність навчання без очікування на найповільніший крок середовища.