DeepSeek представила експериментальну модель V4 Flash, яка обробляє зображення та візуальні промпти на рівні, близькому, за словами компанії, до Claude Opus 4.8 від Anthropic — і при цьому залишається помітно дешевшою за флагманські моделі OpenAI та Anthropic. За даними Techmeme, це перший публічний сигнал, що китайська лабораторія скорочує розрив саме у мультимодальності — здатності моделі розуміти не лише текст, а й зображення, — а не тільки в текстових бенчмарках, де DeepSeek конкурувала й раніше.

Для AI-білдерів це не чергове рядкове оновлення в переліку моделей. Мультимодальність — один із небагатьох напрямків, де західні лабораторії довго тримали чітку перевагу: розпізнавання діаграм, скріншотів інтерфейсів, рукописного тексту чи складних UI-макетів вимагає окремого тренувального конвеєра і суттєвих обчислювальних ресурсів. Якщо V4 Flash справді наближається до рівня Opus 4.8 у таких задачах, різниця в ціні перетворюється на конкретний аргумент при виборі постачальника для продакшн-пайплайнів з аналізом зображень.

Що саме показала DeepSeek у V4 Flash?

DeepSeek представила V4 Flash як експериментальну модель з мультимодальними можливостями — вона розуміє візуальні промпти, тобто приймає на вхід зображення поряд з текстом і відповідає на запитання про їхній вміст. Компанія заявляє, що якість цього розуміння наближається до рівня Claude Opus 4.8. Ключова відмінність від флагманів OpenAI та Anthropic — ціна: V4 Flash залишається значно дешевшою у використанні.

Статус «експериментальна» тут важливий сам по собі: DeepSeek традиційно випускає моделі саме в такому форматі перед повноцінним релізом, збираючи фідбек спільноти розробників і коригуючи ваги за результатами. Це той самий підхід, який лабораторія вже застосовувала для попередніх версій лінійки V-моделей.

Чому мультимодальність саме зараз стала ключовим полем битви?

Текстові бенчмарки — кодування, математика, reasoning — вже давно перетворилися на поле, де відкриті китайські моделі регулярно наздоганяють закриті західні. Мультимодальність залишалася останнім помітним рубежем, де OpenAI та Anthropic могли обґрунтовувати преміальну ціну своїх моделей: аналіз документів, скріншотів, графіків і фото вимагає окремих датасетів і дорогого тренування саме під ці сценарії.

Скорочення цього розриву — навіть якщо йдеться про заявлені, а не незалежно верифіковані бенчмарки — означає, що аргумент «платіть більше за якість візуального розуміння» працює слабше. Для команд, що будують продукти з обробкою скріншотів, сканів документів чи візуального QA, з'являється реальна дешевша альтернатива для частини навантаження.

На чию маржу це тисне найбільше?

Найвразливішими виглядають продукти, де мультимодальність — не другорядна фіча, а основа ціноутворення: API-плани для аналізу документів, візуальні агенти для автоматизації браузера, інструменти для розпізнавання інтерфейсів. Якщо дешевша модель закриває більшість таких задач на прийнятному рівні якості, частина трафіку неминуче перетікає туди, де дешевше.

Це продовжує тенденцію, яку ми вже фіксували раніше: китайські лабораторії системно демпінгують ціну там, де досягають паритету якості, а не намагаються перегнати лідерів у абсолютних показниках. За нашою оцінкою, це радше стратегія тиску на маржу через ціну, ніж спроба технологічного лідерства саме в мультимодальності. Схожий тиск на економіку флагманських моделей ми розбирали, коли GPT-5.6 Sol розганяв виручку OpenAI й тиснув на Anthropic — тепер тиск приходить ще й з протилежного, дешевшого фланга.

Що з цим робити AI-білдерам зараз?

Висновок AiiN

Головний факт тут не в тому, чи справді V4 Flash дорівнює Opus 4.8 — незалежної верифікації поки немає. Головне те, що сама заява DeepSeek звужує простір, у якому OpenAI та Anthropic можуть виправдовувати преміальну ціну мультимодальних продуктів винятково якістю. Коли розрив у сприйнятій якості скорочується, а розрив у ціні залишається кратним, ринок реагує на ціну — і саме це, а не сирі бенчмарки, варто відстежувати найближчі місяці.

Що таке мультимодальна модель?

Мультимодальна модель — це нейромережа, яка приймає на вхід не лише текст, а й інші типи даних, найчастіше зображення, і здатна відповідати на запитання про їхній вміст у межах одного діалогу. Це принципово відрізняється від текстових LLM, яким для роботи зі скріншотами чи сканами потрібен окремий OCR-крок.

Чи можна вже використовувати V4 Flash у продакшні?

Оскільки DeepSeek позиціонує модель як експериментальну, для критичних продакшн-сценаріїв варто почекати стабільного релізу або провести власне тестування на репрезентативній вибірці задач, перш ніж переносити на неї продакшн-трафік.