Команда Qwen (Alibaba) у серпні 2026 року виклала на Hugging Face FP8-квантовану версію Qwen3.8-27B — dense-модель на 27 мільярдів параметрів, яка на бенчмарку computer-use OSWorld-Verified набрала 84,3 бала, обійшовши навіть флагманський закритий Opus4.6 Max від Anthropic із його 72,7. Для моделі, яку можна розгорнути на одній workstation-карті, а не в дата-центрі гіперскейлера, це не рядковий результат у прес-релізі — це сигнал, що агентні задачі (computer use, browser use, тривалі coding-сесії) більше не є монополією найбільших закритих API.

Питання, яке варто поставити: чому раптом 27B-модель обходить моделі на порядок дорожчі в inference? Відповідь — не в кількості параметрів, а в архітектурі. Qwen3.8-27B побудована на гібридній схемі, де більшість шарів використовують лінійну увагу (Gated DeltaNet) замість квадратичної, а класична, дорожча attention-механіка залишена лише для кожного четвертого блоку. Це дає моделі природний контекст у 262 144 токени з можливістю розширення до мільйона — і водночас істотно менший апетит до VRAM на inference, ніж у моделей порівнюваного класу з класичною трансформерною увагою по всіх шарах.

Для практиків, що будують агентні продукти — coding-асистентів, RPA-ботів, довгі multi-step workflow — це важливо просто зараз, а не «колись у майбутньому». Ринок AI-агентів у 2026 році вперся не в брак «розуму» моделей, а у вартість і надійність виконання довгих ланцюжків дій: відкрити термінал, прочитати помилку, поправити код, перезапустити тести, повторити двадцять разів без втрати контексту. Саме на цих задачах — Terminal-Bench, SWE-bench Pro, OSWorld — Qwen3.8-27B демонструє показники, які ще рік тому асоціювалися винятково з найдорожчими закритими моделями.

Третій момент, який робить цей реліз цікавим не лише інженерам, а й тим, хто рахує бюджети: ваги викладені у FP8 з тонкогранульованим квантуванням (блок 128), а не лише в оригінальному BF16. Це готовий до продакшену чекпоінт, який можна одразу віддати на vLLM або SGLang без власного квантування — і, за словами розробників, майже без втрати якості порівняно з повнорозрядною версією.

Звідки взявся Qwen3.8 і що змінилося порівняно з Qwen3.5 та Qwen3.6?

Qwen3.8 — це вже шосте за рахунком велике оновлення лінійки Qwen3 за менш ніж два роки: за Qwen3.5 і Qwen3.6 команда Alibaba традиційно тримає темп кількох релізів на рік, нарощуючи не так «сирий IQ» моделей, скільки їхню здатність доводити довгі задачі до кінця. За даними HackerNews, у картці моделі прямо сказано: Qwen3.8 побудований «на архітектурному фундаменті Qwen3.5» — тобто це не новий дизайн з нуля, а еволюція гібридної схеми, яку Qwen вперше публічно обкатала в лінійці Qwen3-Next з Gated DeltaNet ще у 2025 році.

Цікавий нюанс — цитування в самій картці моделі посилається на матеріал під назвою «Qwen3.8-Max: A New Bar for Coding and Cowork». Тобто модель, яку ми тут розглядаємо, Qwen3.8-27B, судячи з усього, не єдиний і не найбільший член сімейства: назва блогпосту натякає на існування старшого «Max»-флагмана (ймовірно, MoE або хмарного розміру), а 27B-dense — це компактний, deployment-friendly варіант тієї самої архітектури для тих, хто хоче запускати модель у себе, а не через API. Це узгоджується зі стратегією Qwen останніх релізів: спершу відкриті ваги малих і середніх dense/MoE-варіантів, потім — платний хмарний флагман через Qwen Cloud.

Фокус розробників зміщений на конкретні класи задач: coding, «професійна робота», дослідницькі завдання і, окремим пунктом, «long-horizon agentic tasks» — задачі, що вимагають десятків і сотень послідовних кроків з обробкою фідбеку середовища. Це не абстрактне побажання: саме тут решта індустрії — від Anthropic з Claude Code до OpenAI з Codex — б'ється за utility metric, який реально монетизується: скільки задач агент довів до кінця без втручання людини.

Як влаштована гібридна архітектура Qwen3.8-27B під капотом?

Формула шарів, яку Qwen публікує в картці моделі, виглядає так: 16 повторень блоку «3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)». Іншими словами, з кожних чотирьох послідовних шарів три використовують лінійну увагу (Gated DeltaNet), і лише один — класичну softmax-attention із group-query attention (24 голови на запит, 4 — на ключ/значення, розмірність голови 256, RoPE-розмірність 64). Разом це 64 шари при прихованій розмірності 5120 та FFN-проміжному шарі 17 408.

Практичний ефект такого мікшування: лінійна увага масштабується лінійно за довжиною послідовності й майже не «роздуває» KV-кеш, тоді як повна attention — квадратично, зате краще утримує точні, довільно розкидані по контексту факти (так званий «needle-in-haystack retrieval»). Гібрид на кшталт «3 лінійних шари на 1 повний» — це компроміс, який уже показав себе в моделях типу Qwen3-Next, Jamba (AI21) чи RecurrentGemma: більшу частину «розуміння» переносять на дешеву лінійну увагу, а точний пошук по всьому контексту делегують нечисленним повним шарам. Саме тому Qwen3.8-27B заявляє нативний контекст 262 144 токени з розширенням до мільйона через YaRN — без гібридної схеми утримання такого вікна на dense-моделі такого розміру коштувало б непропорційно дорого.

Окремо варто відзначити multi-token prediction (MTP) — модель тренована передбачати одразу кілька токенів наперед, що на inference дає прискорення через spec-decoding-подібні техніки без окремої draft-моделі.

FP8-квантування: що саме залили на Hugging Face

Репозиторій Qwen/Qwen3.8-27B-FP8 — це не оригінальні BF16-ваги, а окремий пост-тренований чекпоінт, квантований у fine-grained FP8 з розміром блоку 128. За словами команди, метрики якості «практично ідентичні» оригінальній моделі. На практиці це означає, що 27–28 мільярдів параметрів у FP8 займають близько 28 ГБ пам'яті замість приблизно 56 ГБ у BF16 — різниця, яка вирішує, чи влізе модель на одну карту з 48 ГБ VRAM разом із запасом під KV-кеш, чи ні. Формат тензорів на сторінці моделі позначений як «BF16 F8_E4M3» — тобто частина тензорів (ймовірно, ембединги, нормалізаційні шари) залишена у BF16, а основна маса матриць ваг переведена в E4M3-варіант FP8.

Чим Qwen3.8-27B відрізняється від Qwen3.7-Plus, Muse Glimmer-30B і Opus4.6 Max?

У бенчмарк-таблиці, яку Qwen публікує разом з моделлю, порівняння йде одразу з чотирма орієнтирами: попередником Qwen3.6-27B, більшою моделлю власної лінійки Qwen3.7-Plus, стороннім відкритим конкурентом Muse Glimmer-30B і закритим флагманом Opus4.6 Max. Картина неоднорідна, і саме в цьому — головний практичний висновок.

На агентних і coding-задачах Qwen3.8-27B регулярно очолює таблицю серед відкритих моделей і подекуди обходить Opus4.6 Max: SWE-bench Pro — 61,7 проти 53,4 в Opus, QwenSWEBench (внутрішній бенчмарк Qwen) — 79,0 проти 63,8, DeepSWE 1.1 — 42,2 проти показника, який в Opus взагалі не наведено. У мультимодальній агентній категорії розрив ще виразніший: OSWorld-Verified (керування комп'ютером) — 84,3 проти 72,7, AndroidWorld (керування мобільним) — 81,9 проти 62,0, Vision2Web — 62,9 проти показника, який для Opus не публікується.

Але на задачах «сирого» знання й багатодисциплінарного міркування розрив працює у зворотний бік: Humanity's Last Exam (HLE) — 30,8 бала в Qwen3.8-27B проти 40,0 у Opus4.6 Max, GPQA Diamond — 89,2 проти 91,3. Це не сюрприз і не провал моделі — це очікуваний трейдофф dense 27B-моделі проти набагато більшого закритого флагмана: глибина енциклопедичних знань і складних наукових міркувань масштабується разом із розміром і обсягом претренування сильніше, ніж навичка «довести конкретну задачу до кінця».

Порівняно з Muse Glimmer-30B — судячи з таблиці, ще одним відкритим конкурентом приблизно того ж класу параметрів — Qwen3.8-27B виграє практично по всіх опублікованих метриках, часто з великим відривом (наприклад, Terminal-Bench 2.1: 73,0 проти 51,7). У багатьох рядках для Glimmer-30B узагалі немає даних — ознака або вужчого евал-покриття, або того, що модель просто не тестувалася на цих задачах публічно.

Важливе методологічне застереження, яке Qwen сама зазначає дрібним шрифтом під таблицею: для SWE-bench Pro всі моделі, крім Opus4.6 Max, оцінювалися через Claude Code harness, тоді як для Opus узято офіційно опубліковане число. Це означає, що частина порівняння — не яблука до яблук: різні харнеси (обв'язки промптів, інструментів, ретраїв) можуть давати різницю в кілька пунктів незалежно від «сирої» здатності моделі.

Що це дає командам, які будують AI-продукти просто зараз?

Практичний сенс релізу — не в тому, що зʼявилася ще одна модель у списку, а в тому, що зʼявився конкретний, готовий до self-hosting чекпоінт для класу задач, де раніше домінували дорогі API. Три сценарії, де це відчутно вже сьогодні:

Self-hosted coding- і термінал-агенти

Показники Terminal-Bench 2.1 (73,0) і SWE-bench Pro (61,7) означають, що команда, яка будує внутрішній аналог Claude Code чи Devin для власного репозиторію, може розгорнути Qwen3.8-27B-FP8 на власній інфраструктурі через vLLM або SGLang (обидва мають готові рецепти-cookbook під цю модель) і отримати порівнянну з фронтир-рівнем якість виконання без плати за токен стороннього провайдера. Для команд із політикою «код не залишає периметр» — це не опція, а часто єдиний прийнятний шлях узагалі підключити агентне кодування.

Computer-use і browser-use автоматизація

Результати OSWorld-Verified (84,3) і WebArena-Verified (64,8) роблять модель кандидатом для RPA-подібних продуктів: автоматизація роботи з легасі-десктоп-софтом, заповнення форм у застарілих веб-інтерфейсах, наскрізне тестування UI. Тут головна перевага перед закритими API — не тільки ціна, а й контроль над latency та можливість тонко налаштовувати reasoning_effort (xhigh за замовчуванням, з опціями medium і low) під конкретний крок: складне планування — на xhigh, рутинний клік по кнопці — на low, щоб не платити зайву затримку.

Довгі документо- та відеоцентричні задачі

Нативний контекст у 262 144 токени (і до мільйона через YaRN) разом з показниками OmniDocBench 1.5 (91,1) та підтримкою годинних відео відкриває сценарії на кшталт аналізу повного архіву юридичних документів компанії або перегляду годинного запису наради з вибіркою релевантних фрагментів за одне звернення до моделі — без ручного чанкінгу вхідних даних, який досі є типовим болем у RAG-пайплайнах.

Окремо варто відзначити параметр preserve_thinking (увімкнений за замовчуванням): модель зберігає reasoning-трейс з попередніх ходів діалогу в багатокрокових агентних сценаріях, що, за описом розробників, покращує узгодженість рішень і використання KV-кешу. Для агентів, які виконують задачу в 30–50 кроків, це пряма економія — не потрібно щоразу «пере-думувати» контекст із нуля.

Що може піти не так із цим релізом?

Висновок AiiN: прогноз на 6–12 місяців

Наша теза проста: Qwen3.8-27B-FP8 — це не «ще одна відкрита модель», а підтвердження того, що рецепт «гібридна лінійна увага плюс FP8-native реліз плюс агентний фокус тренування» став де-факто стандартом для класу моделей 20–30B, які претендують конкурувати із закритими флагманами саме на execution-задачах, а не на глибині енциклопедичних знань. Розрив у HLE й GPQA (30,8 і 89,2 проти 40,0 і 91,3 в Opus4.6 Max) показує, де закриті лабораторії поки утримують перевагу — і, найімовірніше, утримуватимуть її й далі, бо глибина міркувань масштабується разом із розміром моделі й обсягом обчислень на претренуванні жорсткіше, ніж навичка виконання інструкцій.

Але саме execution-навички — доведення багатокрокової задачі до кінця в терміналі, браузері чи на робочому столі — вже зараз монетизуються сильніше за «сирий IQ» у більшості комерційних продуктів. Якщо тренд, який видно в цьому релізі, збережеться, протягом наступних 6–12 місяців варто очікувати: подальше звуження розриву на агентних бенчмарках між топовими відкритими 20–30B моделями і закритими флагманами при стабільному розриві на «чистому» знанні; масовий перехід продуктів середнього класу (внутрішні coding-агенти, RPA, документообіг) на self-hosted відкриті ваги просто тому, що економіка на масштабі перестає сходитися з платою за токен; і появу підтвердженого старшого члена сімейства Qwen3.8 — натяк на «Max» у назві цитованого блогпосту, ймовірно MoE-флагмана, доступного спершу лише через Qwen Cloud.

Для команд, які будують продукти на цьому, практична порада проста: якщо ваш продукт — про доведення довгих ланцюжків дій до результату, а не про написання енциклопедичних відповідей, Qwen3.8-27B-FP8 уже сьогодні виправдовує тестовий деплой на vLLM чи SGLang — і, ймовірно, здешевить інференс агентного продукту на порядок порівняно з підпискою на закритий frontier API.