У серпні 2026 року на arXiv з'явився препринт «Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Cont…» — заголовок у джерелі обривається саме на «Long-Cont», що майже напевно продовжується як «Long-Context» (довгий контекст). Судячи з формулювання назви, автори пропонують відмовитися від класичного сигналу дистиляції великих мовних моделей — сирої правдоподібності токенів учителя — на користь «групово каліброваного» сигналу в межах on-policy навчання.

Дистиляція — стандартний спосіб перетворити дорогу «вчительську» модель на дешевшого й швидшого «учня»: студент тренується наближати розподіл імовірностей учителя над наступним токеном. За даними arXiv, нова робота ставить під сумнів саме цей базовий принцип — і робить це в контексті довгих послідовностей, де моделі дедалі частіше працюють із вікном на сотні тисяч токенів.

Для команд, які будують власні дистильовані моделі — від агентів до RAG-пайплайнів, — питання не абстрактне: якість дистиляції напряму визначає, скільки можна зекономити на інференсі, не втративши якість відповіді.

Що саме пропонує нова робота?

Заголовок статті прямо називає два зсуви відносно базової методики. По-перше, тренувальний сигнал будується не на «сирій» правдоподібності токенів учителя (teacher likelihood), а на «групово каліброваному» сигналі. По-друге, дистиляція описана як on-policy — тобто студент навчається на власних згенерованих послідовностях, а не лише копіює готові приклади від учителя. Поєднання цих двох ідей, судячи з назви, орієнтоване саме на задачі з довгим контекстом.

Чому правдоподібність учителя — слабке місце?

У класичній дистиляції студент мінімізує розбіжність (зазвичай KL-дивергенцію) між своїм розподілом токенів і розподілом учителя. Такий підхід добре працює на коротких прикладах, але має відомий недолік: правдоподібність токена — це локальна, посимвольна оцінка, яка мало що каже про якість усієї відповіді загалом. За нашою оцінкою, у довгих послідовностях ця проблема лише посилюється — похибки калібрування на ранніх токенах накопичуються, а сама впевненість учителя може «пливти» на тисячах токенів контексту. Саме цю прогалину в заголовку окреслює фраза «beyond teacher likelihood» — вихід за межі точкової правдоподібності.

Як може працювати групова калібрація на практиці?

Термін «групова калібрація» перегукується з логікою GRPO (Group Relative Policy Optimization) — підходу, що здобув популярність завдяки навчанню reasoning-моделей на кшталт DeepSeek-R1. Там сигнал для оновлення політики рахують не абсолютно, а відносно групи паралельних семплів: кілька відповідей моделі порівнюють між собою, і саме відносний ранг, а не сира оцінка, стає навчальним сигналом. Ймовірно, автори переносять цю саму ідею в дистиляцію: замість довіряти абсолютній правдоподібності вчителя для одного семпла, метод калібрує сигнал усередині групи on-policy семплів студента. Це припущення, засноване на самому формулюванні назви, — деталі архітектури й експериментів залишаються в тексті статті, якого ми не відтворюємо.

Кому і навіщо це може знадобитися?

Найбільше від точнішої дистиляції можуть виграти команди, які тренують компактні моделі саме для довгоконтекстних задач:

За нашою оцінкою, якщо групова калібрація справді стабілізує сигнал на довгих послідовностях, це відкриває шлях до дешевших студентських моделей, які не втрачають якість там, де раніше «пливли», — у пізніх токенах довгого контексту. Для AI-білдерів практичний висновок простий: варто стежити за релізом коду й ваг цієї роботи, якщо у продакшн-пайплайні вже є або планується дистиляція під довгий контекст.

Висновок AiiN: до чого веде ця тенденція

Наша теза: ця робота — ще один симптом того, як прийоми з post-training reasoning-моделей (групові, відносні сигнали на кшталт GRPO) просочуються в суміжні техніки, включно з дистиляцією. Ще торік groupwise-калібрація асоціювалася майже виключно з RL-тюнінгом; тепер той самий математичний трюк — порівнювати семпли всередині групи замість довіри одній абсолютній оцінці — застосовують і там, де раніше вистачало звичайної крос-ентропії. Якщо тенденція триватиме, дистиляція та RL-post-training поступово зійдуться в одну методологічну сім'ю прийомів, а не залишаться двома окремими етапами пайплайна.

Що таке on-policy дистиляція?

Це спосіб тренування моделі-студента, коли навчальні приклади генерує сама модель-студент, а вчитель лише оцінює або спрямовує ці власні генерації. На відміну від класичної off-policy дистиляції, де студент просто копіює готові приклади вчителя, on-policy підхід ближчий до того, як тренують reasoning-моделі через RL.

Чим групова калібрація відрізняється від звичайної дистиляції?

Звичайна дистиляція порівнює розподіл студента з абсолютною правдоподібністю, яку видає вчитель для кожного токена. Групова калібрація, судячи із заголовка роботи, натомість оцінює сигнал відносно групи паралельних семплів — подібно до того, як GRPO рахує відносну перевагу відповідей усередині групи під час RL-тюнінгу.

Де можна прочитати статтю повністю?

Препринт доступний на arXiv за посиланням у джерелі нижче. Варто пам'ятати: це препринт без рецензування, тож фінальні висновки й бенчмарки можуть змінитися до публікації в рецензованому виданні.