У серпні 2026 року на arXiv з'явився препринт «Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Cont…» — заголовок у джерелі обривається саме на «Long-Cont», що майже напевно продовжується як «Long-Context» (довгий контекст). Судячи з формулювання назви, автори пропонують відмовитися від класичного сигналу дистиляції великих мовних моделей — сирої правдоподібності токенів учителя — на користь «групово каліброваного» сигналу в межах on-policy навчання.
Дистиляція — стандартний спосіб перетворити дорогу «вчительську» модель на дешевшого й швидшого «учня»: студент тренується наближати розподіл імовірностей учителя над наступним токеном. За даними arXiv, нова робота ставить під сумнів саме цей базовий принцип — і робить це в контексті довгих послідовностей, де моделі дедалі частіше працюють із вікном на сотні тисяч токенів.
Для команд, які будують власні дистильовані моделі — від агентів до RAG-пайплайнів, — питання не абстрактне: якість дистиляції напряму визначає, скільки можна зекономити на інференсі, не втративши якість відповіді.
Що саме пропонує нова робота?
Заголовок статті прямо називає два зсуви відносно базової методики. По-перше, тренувальний сигнал будується не на «сирій» правдоподібності токенів учителя (teacher likelihood), а на «групово каліброваному» сигналі. По-друге, дистиляція описана як on-policy — тобто студент навчається на власних згенерованих послідовностях, а не лише копіює готові приклади від учителя. Поєднання цих двох ідей, судячи з назви, орієнтоване саме на задачі з довгим контекстом.
Чому правдоподібність учителя — слабке місце?
У класичній дистиляції студент мінімізує розбіжність (зазвичай KL-дивергенцію) між своїм розподілом токенів і розподілом учителя. Такий підхід добре працює на коротких прикладах, але має відомий недолік: правдоподібність токена — це локальна, посимвольна оцінка, яка мало що каже про якість усієї відповіді загалом. За нашою оцінкою, у довгих послідовностях ця проблема лише посилюється — похибки калібрування на ранніх токенах накопичуються, а сама впевненість учителя може «пливти» на тисячах токенів контексту. Саме цю прогалину в заголовку окреслює фраза «beyond teacher likelihood» — вихід за межі точкової правдоподібності.
Як може працювати групова калібрація на практиці?
Термін «групова калібрація» перегукується з логікою GRPO (Group Relative Policy Optimization) — підходу, що здобув популярність завдяки навчанню reasoning-моделей на кшталт DeepSeek-R1. Там сигнал для оновлення політики рахують не абсолютно, а відносно групи паралельних семплів: кілька відповідей моделі порівнюють між собою, і саме відносний ранг, а не сира оцінка, стає навчальним сигналом. Ймовірно, автори переносять цю саму ідею в дистиляцію: замість довіряти абсолютній правдоподібності вчителя для одного семпла, метод калібрує сигнал усередині групи on-policy семплів студента. Це припущення, засноване на самому формулюванні назви, — деталі архітектури й експериментів залишаються в тексті статті, якого ми не відтворюємо.
Кому і навіщо це може знадобитися?
Найбільше від точнішої дистиляції можуть виграти команди, які тренують компактні моделі саме для довгоконтекстних задач:
- сумаризація великих документів і корпоративних баз знань;
- робота з великими кодовими базами в межах одного контекстного вікна;
- багатокрокові агенти з довгою історією діалогу чи інструментальних викликів.
За нашою оцінкою, якщо групова калібрація справді стабілізує сигнал на довгих послідовностях, це відкриває шлях до дешевших студентських моделей, які не втрачають якість там, де раніше «пливли», — у пізніх токенах довгого контексту. Для AI-білдерів практичний висновок простий: варто стежити за релізом коду й ваг цієї роботи, якщо у продакшн-пайплайні вже є або планується дистиляція під довгий контекст.
Висновок AiiN: до чого веде ця тенденція
Наша теза: ця робота — ще один симптом того, як прийоми з post-training reasoning-моделей (групові, відносні сигнали на кшталт GRPO) просочуються в суміжні техніки, включно з дистиляцією. Ще торік groupwise-калібрація асоціювалася майже виключно з RL-тюнінгом; тепер той самий математичний трюк — порівнювати семпли всередині групи замість довіри одній абсолютній оцінці — застосовують і там, де раніше вистачало звичайної крос-ентропії. Якщо тенденція триватиме, дистиляція та RL-post-training поступово зійдуться в одну методологічну сім'ю прийомів, а не залишаться двома окремими етапами пайплайна.
Що таке on-policy дистиляція?
Це спосіб тренування моделі-студента, коли навчальні приклади генерує сама модель-студент, а вчитель лише оцінює або спрямовує ці власні генерації. На відміну від класичної off-policy дистиляції, де студент просто копіює готові приклади вчителя, on-policy підхід ближчий до того, як тренують reasoning-моделі через RL.
Чим групова калібрація відрізняється від звичайної дистиляції?
Звичайна дистиляція порівнює розподіл студента з абсолютною правдоподібністю, яку видає вчитель для кожного токена. Групова калібрація, судячи із заголовка роботи, натомість оцінює сигнал відносно групи паралельних семплів — подібно до того, як GRPO рахує відносну перевагу відповідей усередині групи під час RL-тюнінгу.
Де можна прочитати статтю повністю?
Препринт доступний на arXiv за посиланням у джерелі нижче. Варто пам'ятати: це препринт без рецензування, тож фінальні висновки й бенчмарки можуть змінитися до публікації в рецензованому виданні.