Anthropic випустила оновлені моделі Claude Fable 5.1 та Mythos 5.1, позиціонуючи реліз як апгрейд насамперед для кодингу та дослідницьких задач. Компанія заявляє про SOTA-результати на профільних бенчмарках — але цифра, яка цікавить AI-білдерів більше за будь-який рейтинг, це вартість кешування: вона впала на 75%.
Другий параметр релізу — ліміт вихідних токенів, який зріс на 70%. Разом ці дві зміни означають не «розумнішу» модель у побутовому сенсі, а помітно дешевший і місткіший продакшн-контур для агентів, які тримають довгий контекст і генерують великі відповіді. За даними Latent Space, саме цей економічний аспект Anthropic підкреслює окремо від бенчмарків.
Що саме анонсувала Anthropic?
Anthropic випустила дві моделі одночасно — Claude Fable 5.1 та Mythos 5.1 — і обидві заявлені як такі, що досягають SOTA-результатів (state-of-the-art) на релевантних тестах. Позиціонування чітке: апгрейд для кодингу та досліджень, тобто задач, де модель довго тримає контекст, читає документацію чи кодову базу і повертає розгорнуту відповідь або патч.
Ключові технічні зміни релізу:
- Вартість кешування промптів знижена на 75%
- Ліміт вихідних токенів збільшено на 70%
- Обидві моделі показують SOTA-результати на бенчмарках кодингу та досліджень
Обидва показники Anthropic подає без деталізації тарифів по конкретних моделях лінійки — у комунікації йдеться про відносні зміни (-75% на кеш, +70% на вихід), а не про абсолютні цифри в доларах чи токенах. Для порівняння вартості власного use case AI-білдерам варто підставити ці відсотки в поточний рахунок за API, а не орієнтуватися на середні по індустрії показники.
Чому дешевший кеш важливіший за новий бенчмарк?
Кешування промптів — це механізм, який дозволяє моделі повторно використовувати вже оброблену частину контексту (системний промпт, документацію, історію діалогу) замість того, щоб «читати» її заново щоразу. Для агентів, які виконують багато послідовних кроків над одним і тим самим великим контекстом — наприклад, ітеративно правлять код у репозиторії — саме повторні читання контексту, а не генерація відповіді, часто формують основну частину рахунку.
Зниження цієї статті витрат на 75% напряму зменшує вартість кожного кроку такого агента, незалежно від того, наскільки «розумнішою» стала сама модель. У поєднанні зі збільшеним лімітом вихідних токенів це знімає ще одне практичне обмеження: агенти, які генерують великі артефакти — довгі патчі, звіти, тестові набори — раніше впиралися в стелю токенів і мусили розбивати відповідь на кілька викликів.
Кому це реально здешевить інференс?
Найбільше виграють команди, що вже тримають production-агентів на API Claude з довгим і повторюваним контекстом:
- Coding-агенти, які багаторазово перечитують одну кодову базу протягом сесії
- Дослідницькі pipeline з великими корпусами документів у контексті
- Сервіси з довгими системними промптами й інструкціями для інструментів (tool use), які кешуються між викликами
Для одноразових коротких запитів ефект від зниження ціни кешування буде помітно меншим — цей апгрейд адресований саме архітектурам, побудованим на повторному використанні контексту, а не на разових запитах до моделі.
Що з цим робити AI-білдерам зараз?
Наша теза в AiiN проста: цей реліз варто читати не як черговий раунд бенчмарків, а як сигнал про напрямок, куди Anthropic веде економіку продакшн-агентів. Дешевший кеш і більший ліміт виводу знижують вартість саме тих патернів використання, які вже стали стандартом для агентних систем — довгий контекст, багато ітерацій, об'ємний вивід. Якщо ваш агент побудований на Claude і активно використовує prompt caching, варто перерахувати юніт-економіку зараз: різниця в 75% на статті витрат, яка раніше могла домінувати в рахунку, здатна зробити рентабельним сценарій, який ще місяць тому таким не був. Це продовжує ширшу тенденцію в індустрії — здешевлення продакшн-контуру AI-систем, про яку ми вже писали, розбираючи чому verbal reinforcement learning стає дешевшою альтернативою RLHF.
Що таке кешування промптів у Claude?
Це механізм, який дозволяє моделі зберігати оброблену частину контексту між викликами API й не рахувати її вартість повторно при кожному наступному запиті. Для агентів, що працюють з великим і стабільним контекстом (документація, системні інструкції, історія), це одна з головних статей економії.
Чи означає SOTA-результат, що Fable 5.1 та Mythos 5.1 кращі за попередні моделі в усіх задачах?
Anthropic заявляє SOTA-результати саме на бенчмарках кодингу та досліджень — це не універсальне лідерство в усіх категоріях задач, а позиціонування релізу під конкретні сценарії використання.