Anthropic перевела власного AI-агента Claude Code на щоденний режим обслуговування свого коду, і команда приймає 46% запропонованих агентом правок без ручного доопрацювання. Це не разовий експеримент, а рутинна практика всередині компанії, яка сама розробляє модель, що стоїть за агентом.

За даними The Decoder, Claude Code тепер регулярно відкриває зміни у внутрішніх репозиторіях Anthropic, а інженери компанії переглядають і зливають ту частину, яка відповідає їхнім стандартам якості. Показник 46% — це частка правок, що проходять цей контроль без додаткового редагування людиною.

Важливо, що йдеться саме про власний продакшн-код Anthropic, а не про демо-репозиторій чи тестовий полігон. Коли компанія довіряє агенту підтримку інфраструктури, на якій тримається її бізнес, це інший рівень ставок, ніж типовий приклад «агент написав застосунок за 10 хвилин».

Що означає «щоденне обслуговування» коду на практиці?

Формулювання «maintenance» в індустрії зазвичай позначає рутинні, низькоризикові завдання: оновлення залежностей, дрібні виправлення багів, прибирання технічного боргу, синхронізацію конфігурацій. За наявною інформацією, саме такий клас задач Claude Code бере на себе щодня, а не розробку нових функцій із нуля — це принципова різниця для оцінки показника 46%.

Механіка проста: агент сканує кодову базу, пропонує зміну, відкриває pull request, а людина або зливає його, або відхиляє чи допрацьовує. Те, що майже половина пропозицій проходить без правок, означає не просто «агент вміє писати код», а що він вміє влучати в конкретні внутрішні конвенції конкретної команди — стиль, тести, культуру рев’ю.

Наскільки вражає показник 46%?

За нашою оцінкою, 46% merge rate — це високий результат саме тому, що йдеться про внутрішній код розробника моделі, а не про синтетичний бенчмарк. Автономні агенти зазвичай показують кращі результати на ізольованих задачах із чіткими критеріями успіху — пройшов тест чи ні, — і гірші на реальних репозиторіях із живою історією рішень, недокументованими залежностями й людським фактором рев’юера.

Порівнювати цей показник із «середньою по ринку» цифрою складно, бо більшість компаній не розкривають подібну статистику про власне агентне кодування — і це саме по собі свідчить, наскільки рідко хтось публічно демонструє таку прозорість про роботу агентів у продакшені.

Те, що майже кожна друга пропозиція агента виявляється прийнятною одразу, свідчить радше про зрілість пари «модель плюс інструментарій навколо неї» — контекст репозиторію, доступ до тестів, лінтери — ніж лише про якість самої мовної моделі.

Що з цього винести командам, які впроваджують агентне кодування?

На практиці з цього випливає конкретний план дій для команд, а не абстрактне «спробуймо агентів»:

Для команд, які вже масштабують агентні процеси, корисно тримати в полі зору й ширший ринковий контекст — наприклад, як Anthropic і OpenAI змінюють цінову політику під тиском конкурентів, бо економіка щоденних прогонів агента напряму залежить від вартості токенів.

Висновок AiiN: що це насправді змінює?

Наша теза проста: перехід Claude Code від демонстраційних кейсів до щоденної рутинної підтримки продакшн-коду Anthropic — важливіший сигнал зрілості агентного кодування, ніж будь-який окремий бенчмарк. Це показує, що поточне покоління coding-агентів уже готове до вузького, але реального класу задач — обслуговування, а не творення нового з нуля. Компаніям варто копіювати не сам показник 46%, а модель впровадження: спершу низькоризикові рутинні завдання з чіткою метрикою успіху, і лише потім — поступове розширення периметра довіри до агента.

Що таке Claude Code?

Claude Code — це агентний інструмент розробки від Anthropic, який працює в терміналі або через SDK і здатен самостійно читати кодову базу, вносити зміни й відкривати pull request-и під наглядом людини.

Що означає «46% merge rate» для агентного кодування?

Це частка змін, запропонованих агентом, які команда приймає без ручного доопрацювання. Показник відображає не лише якість моделі, а й те, наскільки добре налаштовано контекст репозиторію, тести та процес рев’ю навколо неї.