Writer, компанія, що будує генеративний AI для великих організацій, 13 серпня 2026 року представила нову модель та оновлений agent harness — програмну «обв'язку», яка керує тим, як модель викликає інструменти, зберігає контекст і формує відповіді. За даними TechCrunch, головна мета оновлення — стримати витрати на токени, які накопичуються під час роботи AI-агентів у продакшні.
Це не про чергову модель, яка «розумніша за попередню». Йдеться про інфраструктурну проблему, яку відчув майже кожен, хто розгортав агентів у enterprise-середовищі: багатокроковий агент, що читає документи, викликає API й перевіряє власні відповіді, здатний за одну сесію «зʼїсти» токенів на порядки більше, ніж звичайний чат-запит. Рахунок за інференс росте швидше, ніж цінність, яку агент реально приносить бізнесу.
Writer — не наймедійніша компанія в AI-гонці порівняно з OpenAI чи Anthropic, але вона роками позиціонує себе саме як постачальника enterprise-рішень: моделі родини Palmyra, орієнтовані на корпоративні кейси — від маркетингових текстів до автоматизації бек-офісу. Крок у бік контролю токен-витрат логічно продовжує цю стратегію.
Що саме анонсувала Writer?
Компанія випустила нову AI-модель разом з оновленою версією свого agent harness — на момент публікації TechCrunch деталей про конкретну назву моделі, її розмір чи бенчмарки джерело не наводить. Ключовий і підтверджений факт — заявлена мета релізу: зменшити споживання токенів у агентних сценаріях, а не просто підняти якість відповідей.
Це важливий сигнал сам по собі: постачальник моделі публічно визнає, що вартість інференсу під час роботи агентів — окрема інженерна задача, яку недостатньо вирішити «швидшим GPU» чи дешевшим тарифом за токен.
Чому harness важливіший за саму модель?
Harness — це шар оркестрації навколо моделі: він вирішує, коли викликати інструмент, скільки історії діалогу тримати в контексті, коли стиснути чи відкинути частину даних, скільки разів дозволити агенту «передумати» перед фінальною відповіддю. Саме тут, а не в вагах моделі, найчастіше ховається перевитрата токенів.
- Погано спроєктований harness змушує модель повторно «перечитувати» весь контекст на кожному кроці агента.
- Він може дозволяти нескінченні цикли самоперевірки без ліміту.
- Він рідко стискає або кешує проміжні результати між викликами інструментів.
Тому індустрія все частіше оптимізує саме цей рівень: схожу логіку компактизації контексту використовує Anthropic у Claude Code, OpenAI цього літа розганяла інференс режимом Ultrafast, а Google вдвічі знизила ціну за токен для Gemini 3.7 Flash — усе це ознаки одного тренду: економити не лише на прайсі, а й на самій архітектурі виклику моделі.
Чому токени стали головною статтею витрат в enterprise AI?
Проблема не в ціні за токен — вона стабільно падає роками. Проблема в кількості токенів, яку споживає один агентний цикл. Що складніший робочий процес — пошук у документах, виклик кількох API, ланцюжок міркувань, перевірка результату — то більше проміжних токенів генерується і повторно подається назад у контекст моделі.
Для компанії, що масштабує агентів на тисячі співробітників чи мільйони запитів на день, ця різниця перетворюється на рядок у бюджеті, який фінансовий директор бачить і про який ставить питання. Саме тому постачальники моделей — від великих лабораторій до нішевих enterprise-гравців на кшталт Writer — почали продавати не лише «якість», а й передбачуваність витрат.
Висновок AiiN
Наша теза: релізи на кшталт цього — ознака того, що ринок enterprise AI переходить у фазу операційної зрілості, де перемагає не найрозумніша модель, а найдешевша при однаковій якості відповіді. Компанії, які продають агентів бізнесу, змушені оптимізувати harness так само ретельно, як раніше оптимізували сам текст промпту — бо саме оркестрація, а не модель, визначає фінальний рахунок. Для AI-білдерів це означає: перш ніж міняти провайдера моделі в пошуках економії, варто спершу проаудитувати власний harness — скільки контексту реально потрібне на кожному кроці агента і чи не платите ви за токени, які модель просто перечитує вкотре.
Що робить компанія Writer?
Writer — американська компанія, що розробляє генеративний AI для корпоративних клієнтів, зокрема модельну лінійку Palmyra та інструменти для автоматизації текстової й агентної роботи в enterprise-середовищі.
Що таке agent harness простими словами?
Це програмна обв'язка навколо AI-моделі, яка керує викликами інструментів, памʼяттю розмови та форматом відповідей — тобто визначає, скільки токенів агент фактично витрачає на виконання завдання, а не сама модель.
Чим оновлення Writer відрізняється від простого зниження ціни за токен?
Зниження ціни за токен — це маркетинговий чи інфраструктурний крок постачальника. Оптимізація harness — це зміна того, скільки токенів взагалі витрачається на завдання, тож ефект накопичується навіть без перегляду прайсу.