Qwen-Image-2.1-Turbo від Alibaba генерує й редагує зображення за 8 кроків замість 40. Ваги мають дослідницьку ліцензію, за даними MarkTechPost.

Наведені технічні характеристики й тарифи походять із матеріалу MarkTechPost. Первинні документи Qwen та Alibaba для цієї статті не перевіряли.

Що змінилося порівняно з базовою Qwen-Image-2.1?

Qwen-Image-2.1-Turbo скорочує кількість кроків усунення шуму з 40 до 8, зберігаючи архітектуру базової моделі. Це у 5 разів менше кроків, але не доказ п’ятикратного прискорення: матеріал не містить замірів часу генерації на GPU.

Генератор має 7B параметрів і 32 шари та використовує single-stream DiT — дифузійний трансформер з одним потоком обробки. Інструкції та референсні зображення кодує Qwen3-VL 8B. Автоенкодер має 64 канали, працює з RGBA та стискає просторові розміри у 16 разів, забезпечуючи підтримку прозорості.

Модель використовує prefix KV caching — кешування контексту тексту та референсних зображень. Вона обчислює цей контекст на першому кроці й повторно використовує його на наступних. За замовчуванням чекпойнт працює з CFG=1.

Turbo підтримує генерацію у 2K; пресети охоплюють формати від 2048×2048 до 2752×1536 зі співвідношенням сторін 16:9. Модель зберігає функції редагування базової версії. Базова Qwen-Image-2.1 приймає до 10 референсних зображень і підтримує локальні правки за допомогою кіл, намальованих позначок чи масок.

Скільки коштує API і чи можна запускати модель комерційно?

API qwen-image-2.1-turbo в Alibaba Cloud Model Studio коштує CNY 0,1 за зображення у більшості регіонів і має ліміт 120 запитів на хвилину. Версія qwen-image-2.1-pro коштує CNY 0,25 за зображення з лімітом 20 запитів на хвилину. Отже, Turbo коштує у 2,5 раза менше й має у 6 разів вищий ліміт запитів.

Дослідницька ліцензія ваг Turbo вимагає окремого дозволу для комерційного self-hosting — запуску моделі на власній інфраструктурі. Alibaba Cloud також пропонує доступ до моделі через API.

Що потрібно для локального запуску?

Qwen-Image-2.1-Turbo потребує Diffusers із вихідного коду з підтримкою PR #14950 та transformers версії 5.17.0 або новішої. Модель завантажується через QwenImage21Pipeline і працює на CUDA GPU у форматі BF16. PR додає підтримку розкладу кроків усунення шуму, заданого в конфігурації пайплайна.

Мінімальний запуск у Python після встановлення залежностей:

import torch; from diffusers import QwenImage21Pipeline; pipe = QwenImage21Pipeline.from_pretrained("Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16).to("cuda"); image = pipe(prompt="A ceramic teapot on a wooden table, soft window light", width=2048, height=2048, use_kv_cache=True).images[0]

Для редагування потрібно передати зображення через image=input_image, а інструкцію — через prompt.

Qwen не публікує мінімальних вимог до відеопам’яті для Turbo. Наведені в матеріалі оцінки Unsloth стосуються базової Qwen-Image-2.1: 11 ГБ VRAM для GGUF і 24 ГБ для INT8/FP8.

Параметр num_inference_steps сам по собі не змінює розклад, збережений у чекпойнті. Його можна перевизначити лише явним аргументом sigmas. За наведеним у матеріалі застереженням Qwen, інші розклади не перевірені.

Що відомо про якість Turbo?

Qwen-Image-2.1-Turbo поки не має окремого бенчмарка, як повідомляє MarkTechPost. Результат 60,28 на Qwen-Image-Bench належить базовій Qwen-Image-2.1. Qwen називає його найвищим серед моделей із відкритими вагами у своїх звітах; наданий матеріал не містить незалежної перевірки цього порівняння. Переносити результат базової моделі на Turbo підстав немає.