DeepSeek випустив експериментальну модель Flash із підтримкою vision у серпні 2026 року — і за першими агентними бенчмарками вона впритул наближається до Claude Opus 4.8 від Anthropic, залишаючись, за попередніми оцінками, суттєво дешевшою за токен. Йдеться не про черговий текстовий чат-бот, а про модель, орієнтовану на задачі, де AI-агент самостійно планує кроки, викликає інструменти та обробляє зображення в межах одного робочого циклу.
За даними The Decoder, Flash показує результати, порівнянні з флагманською моделлю Anthropic саме в агентних сценаріях — а не в класичних тестах на знання чи математику, де розрив між лабораторіями традиційно найпомітніший.
Ми вже писали, що DeepSeek системно скорочує розрив у мультимодальності з Claude Opus 4.8, і Flash виглядає як продовження тієї самої стратегії: не наздоганяти лідера ринку по всіх напрямках одразу, а точково закривати саме ті задачі, за які бізнес готовий платити вже зараз.
Що саме випустив DeepSeek?
Flash — це експериментальна vision-модель: вона поєднує обробку зображень із агентними здібностями, тобто вмінням послідовно виконувати багатокрокові задачі із викликом зовнішніх інструментів. Статус «експериментальна» важливий сам по собі — це не фінальний production-реліз, а модель для тестування ринком, як і робили попередні покоління DeepSeek перед стабільними версіями.
Ключова заявка компанії — не абсолютний рекорд, а конкурентний результат в агентних бенчмарках проти Claude Opus 4.8, однієї з найсильніших моделей Anthropic для складних мультикрокових задач. Для лабораторії, яка ще торік асоціювалася переважно з дешевими текстовими моделями, це помітний крок у бік мультимодальних агентів.
Чому саме агентні бенчмарки, а не звичні рейтинги?
Агентні бенчмарки перевіряють інше, ніж класичні тести на знання: здатність моделі планувати послідовність дій, коректно викликати інструменти, обробляти проміжні результати і виправляти власні помилки без втручання людини. Це набагато ближче до того, як моделі реально використовують у продакшн-агентах — браузерних помічниках, кодогенераторах, системах автоматизації документообігу.
Саме тому конкуренція в цій категорії важливіша для AI-білдерів, ніж черговий бал у загальному лідерборді: вона напряму говорить про те, яка модель витримає довгий ланцюжок дій без розвалу логіки. Якщо Flash справді наближається до Opus 4.8 на такому типі задач, це сигнал, що розрив між провідними лабораторіями США і Китаю в агентному сегменті вужчає швидше, ніж у звичайних чат-функціях.
Кому це здешевить інференс?
Найбільше виграють команди, які будують агентів із високим обсягом викликів моделі — там, де вартість токена множиться на тисячі кроків планування та інструментальних викликів за сесію. Для таких продуктів різниця в ціні за токен впливає на юніт-економіку прямо, а не абстрактно.
- Стартапи, що будують vision-агентів для обробки документів і скріншотів
- Команди з високочастотними агентними пайплайнами, де ціна токена помножена на тисячі викликів
- Продукти, для яких Claude Opus 4.8 економічно виправданий лише в частині запитів, а решту можна маршрутизувати на дешевшу модель
Ймовірно, найпрактичніший сценарій — не повна заміна Opus 4.8, а гібридна маршрутизація: складні або критичні кроки лишаються на дорожчій моделі, а рутинні агентні дії переносяться на дешевший Flash. Втім, слово «експериментальна» тут ключове: DeepSeek поки не публікував повного технічного звіту з методологією тестування, тож порівняння варто сприймати як заявку компанії, а не як незалежно підтверджений результат — це важливо враховувати перш ніж переносити продакшн-навантаження.
Що з цього робити AI-білдерам зараз?
Наша теза в AiiN проста: конкуренція в агентному сегменті вже не про «хто розумніший у чаті», а про те, хто дешевше витримує довгі ланцюжки дій без деградації якості — і саме там DeepSeek зараз тисне найсильніше. Для команд, які проєктують агентні системи, це привід закладати в архітектуру можливість швидко перемикати провайдера моделі, а не хардкодити один API.
Практично це означає: тестуйте агентні воркфлоу не лише на флагманській моделі, а й на дешевших альтернативах з подібними бенчмарками, і рахуйте вартість не за запит, а за завершену задачу end-to-end.
Чим Flash відрізняється від попередніх релізів DeepSeek?
Flash додає підтримку vision і націлена саме на агентні сценарії, тоді як попередні моделі DeepSeek здобували популярність насамперед у текстових і кодогенераційних задачах за низької ціни.
Чи означає це, що DeepSeek завжди дешевший за Anthropic?
Ні: мова про результати в конкретних агентних бенчмарках при нижчій ціні за токен, а не про повну цінову перевагу в усіх типах задач чи гарантовану якість поза тестовим середовищем.