Огляд на arXiv, опублікований у вересні 2026 року під ідентифікатором 2609.01597, документує оформлення verbal reinforcement learning — навчання мовних моделей через словесний, а не числовий, фідбек — в окремий напрям reinforcement learning для LLM. За даними arXiv, дослідники систематизували десятки робіт, де модель отримує текстову критику своєї відповіді замість скалярної оцінки-нагороди, і на основі цієї критики коригує наступні відповіді.
Це відрізняється від класичного RLHF (Reinforcement Learning from Human Feedback), де людські оцінювачі порівнюють пари відповідей, а їхні рейтинги перетворюються на числову нагороду для навчання окремої reward-моделі. Побудова такого reward-моделя і збір достатньої кількості людських порівнянь — одна з найдорожчих частин донавчання великих мовних моделей.
Verbal RL пропонує інший маршрут: модель (або сама LLM-суддя) описує словами, що не так у відповіді — «аргумент у другому абзаці не підкріплений джерелом», «тон надто категоричний» — і ця критика напряму використовується як сигнал для наступної ітерації. Для команд, які донавчають агентів на власних, вузьких даних, це потенційно дешевший шлях, ніж повний RLHF-пайплайн.
Чим verbal reinforcement learning відрізняється від RLHF?
Головна відмінність — формат сигналу зворотного зв'язку. У RLHF сигнал завжди зводиться до числа: скор reward-моделі, який потім проганяють через алгоритм на кшталт PPO чи DPO. У verbal RL сигнал лишається природною мовою — і саме мовна модель, а не окремий числовий класифікатор, інтерпретує цю критику й коригує поведінку.
- RLHF: людина/AI оцінює → скор → reward-модель → policy-оптимізація
- Verbal RL: людина/AI пише критику → модель читає критику як контекст → генерує покращену відповідь
За даними огляду, цей підхід прибирає з пайплайна окрему стадію тренування reward-моделі — саме ту стадію, яка вимагає найбільше розмічених людьми даних і найчастіше стає вузьким місцем масштабування RLHF.
Як це працює під капотом?
У більшості описаних в огляді підходів словесний фідбек не замінює навчання вагами моделі напряму — він працює як проміжний крок: критика потрапляє в контекст моделі (як частина промпту або memory), модель генерує покращену версію відповіді, і вже ця пара «оригінал → покращена версія» використовується для supervised fine-tuning або дистиляції. Тобто reinforcement відбувається не через градієнт від скалярної нагороди, а через ітеративне самовиправлення, зафіксоване в даних для донавчання.
Це наближає verbal RL до self-critique і constitutional-подібних технік, які великі лабораторії вже застосовують окремо, — але огляд на arXiv вперше збирає їх в один парасольковий напрям reinforcement learning, а не трактує як допоміжний трюк промпт-інжинірингу.
Кому це реально здешевить донавчання?
Найбільше виграють команди, які донавчають агентів на вузьких, специфічних для домену даних — де найняти окремий штат розмічувачів для попарних порівнянь економічно невиправдано. Замість цього словесну критику може генерувати сама модель-суддя (LLM-as-judge) або невелика команда доменних експертів, яка пише текстові зауваження, а не виставляє бали.
- Стартапи й продуктові команди без бюджету на масштабний RLHF-пайплайн
- Донавчання агентів під вузькі корпоративні задачі (внутрішні tool-calling сценарії, специфічний тон бренду)
- Ітеративне покращення промптів і few-shot прикладів на основі накопиченої словесної критики користувачів
Ймовірно, для задач, де важлива тонка каліброваність між багатьма варіантами відповідей (наприклад, ранжування творчих текстів), скалярний RLHF-скор все ще даватиме точніший сигнал, ніж узагальнена словесна критика, — але це наша оцінка, а не теза самого огляду.
Що з цим робити зараз: погляд AiiN
Наша теза: verbal reinforcement learning стає привабливим не тому, що він точніший за RLHF, а тому, що він знижує поріг входу в донавчання для команд без ресурсів великих лабораторій. Якщо ваш агент уже отримує текстові зауваження від користувачів чи ревюерів — ви, по суті, вже сидите на сировині для verbal RL, і питання лише в тому, чи є в пайплайні крок, який перетворює цю критику назад у навчальні дані. Перш ніж запускати такий цикл на продакшн-агенті, варто розуміти, як взагалі оцінюють готовність агента до реальних задач — про це ми писали в матеріалі хто перевірить навички AI-агента, перш ніж він зіпсує продакшн.
Чи можна поєднувати verbal RL з класичним RLHF?
Так, огляд описує їх швидше як доповнення, ніж заміну: команда може використовувати скалярний reward для грубого відбору кращих кандидатів-відповідей, а словесну критику — для точнішого пояснення, що саме виправити в наступній ітерації.
Чи потрібен для verbal RL окремий reward-фреймворк?
Ні, ключова перевага підходу в тому, що словесна критика обробляється тією ж мовною моделлю, без окремої reward-архітектури — це і скорочує інженерні витрати порівняно з класичним RLHF-пайплайном.