Anthropic випустила модель Claude Fable 5.1, яка за замовчуванням часто ігнорує вбудований інструмент пошуку в інтернеті й натомість покладається на внутрішню здогадку — навіть тоді, коли доступ до мережі технічно увімкнено. За даними ITC.ua, користувачі помітили цю поведінку на практиці й уже знайшли способи змусити модель шукати активніше.
На перший погляд це виглядає як дрібна деталь UX. Але для тих, хто будує продукти поверх Claude API — RAG-пайплайни, дослідницьких агентів, чат-ботів із доступом до актуальних даних — це пряма загроза точності відповідей. Модель, яка «здогадується» замість того, щоб перевірити факт, видає впевнену відповідь без жодного маркера непевності, і відрізнити галюцинацію від перевіреного факту користувачу складно.
Проблема цікава ще й тим, що вона суперечить очікуваній логіці: чим потужніша модель, тим менше їй потрібен зовнішній інструмент, бо вона «і так знає». Насправді ж саме ця впевненість і є ризиком — Fable 5.1 має доступ до пошуку, але не використовує його там, де він реально потрібен.
Чому модель уникає пошуку, навіть маючи до нього доступ?
Судячи з опису поведінки, Fable 5.1 за замовчуванням оцінює, чи «достатньо» їй власних знань для відповіді, і в багатьох випадках вирішує, що виклик інструменту пошуку — зайвий крок. Це узгоджується із загальним трендом останніх поколінь моделей: менше зайвих tool calls означає швидшу відповідь і нижчу вартість інференсу для провайдера. Але побічний ефект — модель тихо підміняє перевірений факт вірогідною реконструкцією, особливо там, де інформація могла змінитися після дати навчання.
Як користувачі змушують Fable 5.1 шукати активніше?
За інформацією ITC.ua, спільнота вже виробила прийоми, що підвищують частоту звернень моделі до пошуку. Практично це зводиться до explicit-інструкцій у промпті, а не до сподівання на дефолтну поведінку моделі:
- Пряма вказівка в системному промпті: «завжди перевіряй факти пошуком, перш ніж відповідати», а не загальне «маєш доступ до пошуку»
- Явна заборона відповідати з пам'яті для категорій запитів, де дані можуть бути застарілими (ціни, версії ПЗ, поточні події)
- Вимога цитувати джерело в кожній відповіді — це змушує модель фактично виконати пошук, а не імітувати цитування
Спільне в цих прийомах одне: вони перетворюють пошук із опції, яку модель обирає сама, на обов'язковий крок пайплайну.
Що це означає для тих, хто будує агентів на Claude?
Якщо у вашого агента підключений інструмент пошуку, але промпт формулює його як «доступний за потреби», Fable 5.1, ймовірно, використовуватиме його рідше, ніж ви очікуєте — це наше припущення на основі описаної поведінки, і його варто перевірити на власних логах tool calls. Практичний висновок: для будь-якого продукту, де точність важливіша за швидкість відповіді (юридичні, медичні, фінансові кейси, дослідницькі агенти), варто аудитувати, скільки відсотків релевантних запитів реально доходять до виклику пошуку, а не покладатися на замовчування моделі. Це особливо актуально для команд, що вже стикалися з непередбачуваною автономною поведінкою агентів — подібні патерни ми розбирали, коли аналізували ризики автономних AI-агентів, що вже торгують на біржах.
Що робити з цим прямо зараз?
Наша теза в AiiN проста: типовий дефолт LLM щодо інструментів — не нейтральний, а optimize-for-cost, і про це варто пам'ятати кожного разу, коли ви підключаєте новий tool до агента, а не лише в момент першого запуску. Перед тим як вважати інтеграцію пошуку «готовою», перевірте промпт на явний тригер пошуку та переконайтеся, що для критичних категорій запитів модель не має шляху відповісти без виклику інструмента. Це п'ять хвилин роботи з системним промптом проти годин розбору помилкових відповідей у проді.
Чи стосується ця поведінка лише Claude Fable 5.1?
Джерело новини описує цю поведінку саме для Fable 5.1; наявних даних про те, чи властива вона іншим моделям лінійки Claude, у матеріалі немає, тож поширювати висновок на інші версії передчасно.
Як перевірити, чи мій агент справді використовує пошук?
Найнадійніший спосіб — подивитися логи tool calls API за реальний трафік і порахувати частку запитів із категорій, де факти можуть бути застарілими, які фактично викликали інструмент пошуку, а не покластися на суб'єктивне враження від кількох тестових промптів.