Модель Fable 5 від Anthropic самостійно закрила 81,7% розриву до рекорду швидкості тренування GPT-подібної моделі — розриву, який відкрита спільнота проєкту NanoGPT Speedrun вибудовувала понад рік, знизивши час тренування з 45 хвилин до менш ніж 75 секунд на восьми GPU H100. Це сталося не в лабораторному звіті й не в маркетинговому пресрелізі, а в бенчмарку NanoGPT Speedrun Frontier, який дослідницька команда Prime Intellect опублікувала, зібравши 153 автономні прогони 18 фронтир-моделей — від Anthropic до xAI, Moonshot, DeepSeek, Alibaba, Zhipu та кількох менш відомих команд.

Сам NanoGPT Speedrun — не новина сама собою. Проєкт існує з травня 2024 року як відкрите змагання інженерів, які по черзі публікують патчі, що прискорюють тренування невеликої GPT-2-подібної моделі до фіксованого рівня якості. За даними HackerNews, саме навколо цього проєкту влітку 2026-го сформувався новий фронтир: замість питання «хто з людей найкращий інженер» тепер перевіряють, наскільки близько AI-агент здатен підійти до найкращого людського рішення — без жодної підказки, самостійно читаючи код, ставлячи експерименти і виправляючи власні помилки.

Це має значення прямо зараз, бо «AI прискорює AI-дослідження» — одна з найгучніших і водночас найменш вимірюваних тез індустрії. Лабораторії говорять про це в блог-постах і safety-фреймворках, але рідко дають перевірювану, відтворювану цифру. NanoGPT Speedrun Frontier — один із небагатьох публічних бенчмарків, де є чіткий, задокументований роками еталон людської майстерності: кожен рекорд — з датою, автором і публічним логом — і формула, яка нормалізує результат агента відносно цього еталона.

У цьому матеріалі — що саме відбувається під капотом тренувального пайплайна, який за півтора року пришвидшився у понад 36 разів; чому Prime Intellect перетворила людське змагання на тест для машин; хто з фронтир-моделей реально виграє цю гонку і за яку ціну; і чого цифра 81,7% насправді не доводить.

Звідки взявся NanoGPT Speedrun?

Витоки проєкту — в роботі Andrej Karpathy. У травні 2024 року він опублікував llm.c — реалізацію тренування GPT-2 (124 млн параметрів) на чистому C/CUDA, яка досягала cross-entropy втрати 3,28 на валідаційному наборі FineWeb за 45 хвилин на 8 GPU H100, використавши 10 млрд токенів. Дослідник Keller Jordan форкнув цей код у репозиторій modded-nanogpt і перетворив фіксовану ціль (втрата ≤3,28) на відкрите змагання: хто швидше її досягне.

З того моменту рекорд падав практично щотижня. Кілька віх із задокументованої історії проєкту:

За майже три десятки задокументованих рекордів список авторів виріс до кількох десятків імен — це справді відкрита, неоплачувана спільнота, а не команда однієї компанії. Офіційний хронометраж рекордів проводиться на обчислювальній платформі Prime Intellect — і саме тому компанія мала прямий доступ і стимул побудувати на цій базі власний бенчмарк для AI-агентів.

Як це працює під капотом?

Прискорення у понад 36 разів — не один трюк, а нашарування трьох класів оптимізацій: новий оптимізатор, перекроєна архітектура і жорстка системна інженерія.

Оптимізатор Muon: чому AdamW — це ще не межа

Головний технічний внесок спільноти — оптимізатор Muon (Momentum Orthogonalized by Newton-Schulz), який Keller Jordan та Jeremy Bernstein представили в жовтні 2024-го як патч для третього за ліком рекорду. Ідея: замість того, щоб застосовувати momentum-оновлення ваг «як є», як робить AdamW, Muon ортогоналізує матрицю оновлення через кілька ітерацій Ньютона — Шульца — по суті вирівнює «енергію» кроку рівномірно по всіх сингулярних напрямках ваги. Це дає краще обумовлений крок оптимізації, що дозволяє використовувати вищий ефективний learning rate і збігатися швидше. Застосовується Muon лише до двовимірних матриць прихованих шарів; ембеддинги, вихідна голова і скалярні параметри й далі тренуються звичайним AdamW.

Цей трюк не залишився іграшкою одного бенчмарку. Moonshot AI використала похідну Muon — MuonClip — для тренування Kimi K2, моделі зі щільністю понад трильйон параметрів у сумі експертів. Коли оптимізатор, народжений у змаганні на моделі розміром з GPT-2, витримує масштабування до продакшн-моделі такого рівня, це один із небагатьох випадків, коли трюк зі спортивного «спідрану» реально переносний за межі гри.

Архітектурні зрізання кутів

Паралельно з оптимізатором мінялася архітектура: rotary positional embeddings замість навчених позиційних, QK-Norm для стабільності уваги, ReLU² замість GeLU, прибрані bias-параметри, розв'язані матриці ембеддингу і виходу, skip-конекшени у стилі U-Net між блоками трансформера та FlexAttention з патерном «довге-коротке» вікно уваги, натхненним Gemma 2, разом із розігрівом розміру вікна. Жоден із цих прийомів не унікальний — усі вже траплялися в академічній літературі, — але спільнота speedrun-у першою системно перевірила, які саме комбінації дають вимірний виграш на фіксованому бюджеті часу, а не просто покращують метрику десь у папері.

Половина виграшу — не в алгоритмі, а в інженерії

Показово, що частина найпізніших рекордів 2025 року — це взагалі не нові ідеї про те, як вчити мережу, а суто системна робота: FP8-точність для голови й проходу через MLP, розподілення оверхеду Muon між GPU, заміна градієнтного all_reduce на reduce_scatter, перекриття обчислень і мережевої комунікації. Останній порядок виграшу народився не з нової математики, а з того, що хтось акуратно прибрав простій GPU, поки вони чекають одне одного по мережі.

Саме на цей репозиторій Prime Intellect і поставила AI-агентів. Кожній моделі — під різними «харнесами»: claude-code, codex, grok-cli, kimi-code, qwen-code, muse-code і фірмовий prime-agent — дають вихідний код modded-nanogpt, фіксований обчислювальний бюджет і повну автономію: читай код, запускай тренування, дивись на криву втрат, редагуй, повторюй. Результат прогону — фінальна validation loss у межах бюджету. Щоб порівнювати моделі однією шкалою, Prime Intellect нормалізує цю втрату між двома точками: базовою лінією (умовний бал 3290, що відповідає початковій втраті приблизно 3,29) і поточним рекордом людей (2600, тобто приблизно 2,60). «Закритий розрив» — це просто (базова − результат) / (базова − рекорд людей) у відсотках; для Fable 5 це (3290−2726)/(3290−2600) = 81,7%.

Чим це відрізняється від інших AI R&D бенчмарків?

NanoGPT Speedrun Frontier — не перша спроба виміряти, наскільки AI-агент здатен самостійно провадити ML-дослідження. OpenAI ще 2024 року випустила MLE-bench — набір Kaggle-подібних змагань, де агент має самостійно побудувати весь пайплайн: від препроцесингу даних до вибору моделі. METR веде RE-Bench і ширшу лінійку оцінок «autonomy uplift», які радше вимірюють, наскільки довгий за часом ланцюжок автономних дій агент здатен утримати без збою, ніж конкретну якість рішення. UK AI Safety Institute проводить власні фронтир-оцінки в схожому дусі для безпекових звітів лабораторій.

Відмінність підходу Prime Intellect — вузькість і вимірюваність. Замість розмитого «побудуй хороший ML-пайплайн» тут одна змінна — validation loss на фіксованому датасеті й залізі — і рухомий, але задокументований еталон: рекорд живих людей із датою й іменем автора кожного покращення. Це один із небагатьох публічних бенчмарків, де можна буквально сказати: агент X досяг Y% від того, що зробила відкрита інженерна спільнота за 15 місяців.

Сам лідерборд показує розкид, який важливіший за перше місце. Fable 5 (харнес claude-code, режим high) лідирує з результатом 81,7%; Opus 5 (claude-code, max) — другий із 53,6%. Далі — і це цікавіше — та сама модель Kimi K3 показує 52,2% під харнесом prime-agent і лише 45,8% під kimi-code: сам скафолдинг навколо моделі важить майже стільки ж, скільки сама модель. У середині таблиці — кілька конфігурацій GPT-5.6 (11–36%), Sonnet 5 (26,8%), Grok 4.5 і 4.6 (10–25%), Qwen3.8 Max (24,6%), GLM 5.2 (20,3%), DeepSeek V4 Pro (12,3%). Одна з моделей, GLM 5.3, не потрапила в таблицю з валідним результатом узагалі — жоден її прогін не встиг завершитися в межах бюджету.

Ще показовіша різниця — не в результаті, а у витраченому на нього ресурсі. GPT-5.6 Sol під харнесом codex закрив 35,9% розриву, згенерувавши за прогін порядку 2,9 млрд токенів контексту і майже тисячу викликів інструментів за понад шість годин автономної роботи; Grok 4.5 дійшов до порівнянних 24,6% приблизно за 46 млн токенів і 2,7 години — на два порядки дешевше за трохи гірший результат. Для тих, хто рахує компʼютерний бюджет, ця різниця важить більше за різницю в позиціях лідерборду.

Що це дає тим, хто будує на цьому зараз?

Перший практичний сценарій — якщо ви тренуєте модель з нуля чи файнтюните на обмеженому GPU-бюджеті, самі трюки speedrun-у переносні незалежно від агентського шару: реалізація Muon відкрита в репозиторії KellerJordan/Muon, рецепт «RoPE + QK-Norm + ReLU² + без bias + розв'язані ембеддинги» вже де-факто став стандартом сучасних відкритих архітектур, а заміна all_reduce на reduce_scatter — рутинна, але часто пропущена оптимізація в саморобних тренувальних скриптах.

Другий сценарій — якщо ви думаєте, чи пускати агентів на кшталт claude-code чи codex у власну тренувальну інфраструктуру. Цей бенчмарк — непоганий проксі-сигнал того, що фронтир-агенти вже здатні автономно налагоджувати й покращувати тренувальний цикл без постійного нагляду людини. Але дивитися варто не на місце в топі, а на пару «результат до витраченого compute» — саме вона показує, чи агент справді ефективний, чи просто перебирає варіанти, поки не вичерпає бюджет.

Третій сценарій — якщо вас цікавить, наскільки правдива теза «AI прискорює AI-дослідження». Цей лідерборд — одне з небагатьох публічних, відтворюваних і регулярно оновлюваних джерел цифр на цю тему, а не маркетингового твердження. Варто повертатися до нього раз на квартал і дивитися, наскільки зрушує топ і медіана результатів.

Що може піти не так?

Висновок AiiN

Це одна з найконкретніших і найвідтворюваніших цифр, які індустрія поки що дала на тезу «AI прискорює AI-дослідження» — саме тому, що успіх виміряний відносно живого, задокументованого людського еталона на спільному, перевірюваному завданні, а не відносно розмитого self-report лабораторії.

Але це вузький зріз. Закриття розриву на добре задокументованому іграшковому спідрані каже більше про здатність агента надійно відтворювати й комбінувати відомі рішення в коді, ніж про здатність вести справді нове дослідження в невизначеному просторі.

Наш прогноз на 6–12 місяців: по-перше, сам лідерборд NanoGPT Speedrun Frontier, найімовірніше, насититься — якась модель зрівняється або перевершить людський рекорд 2,60 протягом двох-трьох циклів оновлення. По-друге, Prime Intellect та конкуренти на кшталт METR і внутрішніх evals-команд OpenAI й Anthropic запустять наступників на менш контамінованих, більш відкритих завданнях з оптимізації тренування. По-третє, вендори агентських кодинг-інструментів почнуть продавати їх ML-командам саме під задачі інфраструктурної оптимізації, і «результат на долар compute» стане стандартною метрикою порівняння — а не просто відсоток пройдених задач.

Найцікавіша цифра в цьому релізі — не 81,7% Fable 5, а розрив у витраченому ресурсі між моделями з майже однаковим результатом. Саме він, а не позиція в топі, визначить, які агенти реально почнуть оптимізувати тренувальні пайплайни в продакшні — бо там рахунок за GPU-години виставляють по-справжньому.