Anthropic випустила оновлені моделі Claude Fable 5.1 та Mythos 5.1, позиціонуючи реліз як апгрейд насамперед для кодингу та дослідницьких задач. Компанія заявляє про SOTA-результати на профільних бенчмарках — але цифра, яка цікавить AI-білдерів більше за будь-який рейтинг, це вартість кешування: вона впала на 75%.

Другий параметр релізу — ліміт вихідних токенів, який зріс на 70%. Разом ці дві зміни означають не «розумнішу» модель у побутовому сенсі, а помітно дешевший і місткіший продакшн-контур для агентів, які тримають довгий контекст і генерують великі відповіді. За даними Latent Space, саме цей економічний аспект Anthropic підкреслює окремо від бенчмарків.

Що саме анонсувала Anthropic?

Anthropic випустила дві моделі одночасно — Claude Fable 5.1 та Mythos 5.1 — і обидві заявлені як такі, що досягають SOTA-результатів (state-of-the-art) на релевантних тестах. Позиціонування чітке: апгрейд для кодингу та досліджень, тобто задач, де модель довго тримає контекст, читає документацію чи кодову базу і повертає розгорнуту відповідь або патч.

Ключові технічні зміни релізу:

Обидва показники Anthropic подає без деталізації тарифів по конкретних моделях лінійки — у комунікації йдеться про відносні зміни (-75% на кеш, +70% на вихід), а не про абсолютні цифри в доларах чи токенах. Для порівняння вартості власного use case AI-білдерам варто підставити ці відсотки в поточний рахунок за API, а не орієнтуватися на середні по індустрії показники.

Чому дешевший кеш важливіший за новий бенчмарк?

Кешування промптів — це механізм, який дозволяє моделі повторно використовувати вже оброблену частину контексту (системний промпт, документацію, історію діалогу) замість того, щоб «читати» її заново щоразу. Для агентів, які виконують багато послідовних кроків над одним і тим самим великим контекстом — наприклад, ітеративно правлять код у репозиторії — саме повторні читання контексту, а не генерація відповіді, часто формують основну частину рахунку.

Зниження цієї статті витрат на 75% напряму зменшує вартість кожного кроку такого агента, незалежно від того, наскільки «розумнішою» стала сама модель. У поєднанні зі збільшеним лімітом вихідних токенів це знімає ще одне практичне обмеження: агенти, які генерують великі артефакти — довгі патчі, звіти, тестові набори — раніше впиралися в стелю токенів і мусили розбивати відповідь на кілька викликів.

Кому це реально здешевить інференс?

Найбільше виграють команди, що вже тримають production-агентів на API Claude з довгим і повторюваним контекстом:

Для одноразових коротких запитів ефект від зниження ціни кешування буде помітно меншим — цей апгрейд адресований саме архітектурам, побудованим на повторному використанні контексту, а не на разових запитах до моделі.

Що з цим робити AI-білдерам зараз?

Наша теза в AiiN проста: цей реліз варто читати не як черговий раунд бенчмарків, а як сигнал про напрямок, куди Anthropic веде економіку продакшн-агентів. Дешевший кеш і більший ліміт виводу знижують вартість саме тих патернів використання, які вже стали стандартом для агентних систем — довгий контекст, багато ітерацій, об'ємний вивід. Якщо ваш агент побудований на Claude і активно використовує prompt caching, варто перерахувати юніт-економіку зараз: різниця в 75% на статті витрат, яка раніше могла домінувати в рахунку, здатна зробити рентабельним сценарій, який ще місяць тому таким не був. Це продовжує ширшу тенденцію в індустрії — здешевлення продакшн-контуру AI-систем, про яку ми вже писали, розбираючи чому verbal reinforcement learning стає дешевшою альтернативою RLHF.

Що таке кешування промптів у Claude?

Це механізм, який дозволяє моделі зберігати оброблену частину контексту між викликами API й не рахувати її вартість повторно при кожному наступному запиті. Для агентів, що працюють з великим і стабільним контекстом (документація, системні інструкції, історія), це одна з головних статей економії.

Чи означає SOTA-результат, що Fable 5.1 та Mythos 5.1 кращі за попередні моделі в усіх задачах?

Anthropic заявляє SOTA-результати саме на бенчмарках кодингу та досліджень — це не універсальне лідерство в усіх категоріях задач, а позиціонування релізу під конкретні сценарії використання.