Anthropic, Google, Z.ai та Alibaba оновили свої флагманські лінійки моделей — Claude, Gemini, GLM і Qwen відповідно — практично в межах одного вересня, і зробили це майже синхронно. За даними Speka, огляд зібрав ключові релізи місяця в одному місці — від закритих американських флагманів до відкритих китайських моделей.
Для AI-білдера це одночасно подарунок і головний біль. Подарунок — бо вибір реально є: чотири незалежні лінійки, чотири різні бізнес-моделі, чотири набори trade-off-ів. Головний біль — бо порівняти їх «на око» не вийде: у кожного вендора власна цінова політика, власна ліцензія і власний набір бенчмарків, у яких саме він виграє.
Ми не переказуємо релізноути вендорів — нижче каркас, за яким можна прогнати будь-яку четвірку моделей за 10 хвилин, а не витрачати день на окремий research.
Що саме сталося у вересні?
Чотири великі вендори випустили оновлення своїх флагманів практично паралельно: Anthropic — чергову версію Claude, Google — оновлений Gemini, Z.ai — нову модель лінійки GLM, Alibaba — чергове покоління Qwen. Це не координований реліз, а збіг циклів розробки, який трапляється на ринку LLM дедалі частіше: компанії відстежують одна одну і намагаються не відставати з анонсами більше ніж на пару тижнів.
Ключова відмінність вже на цьому рівні — хто саме ці моделі випускає. Claude і Gemini лишаються закритими продуктами, доступними лише через API або хмарні платформи вендора. GLM і Qwen виходять у форматі відкритих ваг — їх можна завантажити, доробити під себе і розгорнути на власній інфраструктурі.
Чим принципово відрізняються ці чотири моделі?
Різниця не зводиться до того, «хто розумніший» — вона в тому, під яку задачу і бюджет модель узагалі створена:
- Claude (Anthropic) — закрита модель з акцентом на агентні сценарії, виклик інструментів і роботу з кодом; підтримка на рівні enterprise, вища ціна за токен.
- Gemini (Google) — закрита модель, глибоко інтегрована в екосистему Google (Search, Workspace, Cloud), сильна сторона — мультимодальність і робота з довгим контекстом.
- GLM (Z.ai) — відкриті ваги, ліцензія дозволяє комерційне використання й self-hosting, помітно нижча вартість інференсу за рахунок відсутності маржі API-провайдера.
- Qwen (Alibaba) — теж відкриті ваги, лінійка розмірів від компактних до великих, широка мовна підтримка і велика спільнота на Hugging Face.
Відкриті ваги (open weights) — практика, коли вендор публікує файли навченої моделі у вільному доступі: їх можна завантажити, доопрацювати на власних даних і розгорнути на своєму обладнанні, не сплачуючи за кожен виклик API.
Як ми вже розбирали, коли писали про дешеві альтернативи GPT і Claude, відкриті китайські моделі закривають переважно ту саму нішу: близька якість на масових задачах за суттєво нижчу вартість токена, але без такого рівня supported tooling і safety-гарантій, як у закритих вендорів.
За якими критеріями звіряти релізи під свій кейс?
Замість того щоб читати чотири окремі бенчмарк-таблиці, AI-білдеру достатньо прогнати кожну модель через п'ять питань:
- Ціна за токен і чи є безкоштовний tier для прототипування.
- Розмір контекстного вікна — критично для RAG і роботи з довгими документами.
- Якість агентних/tool-use сценаріїв — якщо продукт будується навколо AI-агента, а не одноразового чат-запиту.
- Умови ліцензії — чи дозволяє вона комерційне використання, fine-tuning, self-hosting.
- Доступність і латентність у вашому регіоні — API-моделі залежать від інфраструктури вендора, self-hosted — від вашого заліза.
Ці п'ять пунктів закривають більшість практичних рішень «яку модель ставити в продакшн» — решта вирішується власним A/B-тестом на реальних промптах, а не читанням маркетингових релізноутів.
Що робити з цим прямо зараз?
За нашою оцінкою, вересневий кластер релізів закріплює поділ ринку не за якістю моделей, а за бізнес-моделлю дистрибуції: закриті API з high-touch підтримкою від Anthropic і Google — проти відкритих ваг і self-hosting від Z.ai та Alibaba. Для більшості продуктових команд це означає, що вибір моделі стає питанням інфраструктурної стратегії — готові ви керувати власним інференсом заради економії токена, чи платите за те, щоб про це не думати.
Практична порада: не мігруйте на нову модель одразу після релізу. Прогоніть її через власний набір тестових промптів і порівняйте з поточною — вересневі релізи вигідно оцінювати паралельно, а не послідовно.
Чи варто одразу переходити на нову модель після релізу?
Ні, якщо у вас уже є стабільний прод-пайплайн. Спершу прогоніть нову модель на власному наборі тестових промптів і порівняйте якість і вартість з поточним рішенням — релізноути вендора описують кращі кейси, а не ваш.
Що вигідніше для команди з обмеженим бюджетом — Claude/Gemini чи GLM/Qwen?
Якщо навантаження передбачуване й велике за обсягом, self-hosted GLM або Qwen зазвичай дешевші за токен у довгостроковій перспективі. Якщо навантаження нерівномірне або команда не хоче керувати інфраструктурою, закритий API з оплатою за факт використання лишається простішим стартом.
Де перевіряти актуальні бенчмарки цих моделей самостійно?
Орієнтуйтеся на публічні leaderboard-и (на кшталт LMSYS Chatbot Arena) і на власні тестові промпти з реального продукту — універсальні бенчмарки погано передбачають поведінку моделі на вашому специфічному датасеті.