# Prime Inference: серверлес і резерв для відкритих моделей

> Prime Intellect запустила Prime Inference: серверлес-ендпоїнти й резерв потужностей для відкритих моделей, що до релізу тримали майже трильйон токенів на день.

- Опубліковано: 5 жовтня 2026 р. (2026-10-04T23:25:30.130004+00:00)
- Розділ: AI-інструменти
- На основі публікації: [MarkTechPost](https://www.marktechpost.com/2026/10/02/prime-intellect-launches-prime-inference-serverless-and-reserved-serving-for-frontier-open-models/)
- Видання: AiiN (https://aiin.news)
- URL: https://aiin.news/article?slug=prime-inference-%D1%81%D0%B5%D1%80%D0%B2%D0%B5%D1%80%D0%BB%D0%B5%D1%81-%D1%96-%D1%80%D0%B5%D0%B7%D0%B5%D1%80%D0%B2-%D0%B4%D0%BB%D1%8F-%D0%B2%D1%96%D0%B4%D0%BA%D1%80%D0%B8%D1%82%D0%B8%D1%85-%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9

---

Prime Intellect запустила Prime Inference — платформу інференсу для відкритих моделей, яка до публічного релізу обробляла майже трильйон токенів на день.

Ці потоки — RL-ролаути, генерація синтетичних даних, оцінювання та довготривалі кодові агенти — [за даними MarkTechPost](https://www.marktechpost.com/2026/10/02/prime-intellect-launches-prime-inference-serverless-and-reserved-serving-for-frontier-open-models/), йшли всередині компанії до відкритого доступу. Серверний шар замикає цикл: трейси з розгорнутих моделей можуть повертатися в тренування через prime-rl, verifiers і sandboxes.

## Що вміє Prime Inference?

Prime Inference пропонує два режими: серверлес-ендпоїнти для змінного попиту та зарезервовану потужність на власних GPU Prime у кількох дата-центрах. Трафік автоматично перемикається на здорові розгортання, компанія заявляє 100% доступність від запуску. За даними Prime, ендпоїнт моделі GLM-5.3 входить до найшвидших на OpenRouter, а частка помилок у викликах інструментів залишається близькою до нуля.

Звернення йдуть через OpenAI-сумісний API за адресою https://api.pinference.ai/api/v1, тож будь-який OpenAI SDK працює без переписування. Оплата зведена в один білінг із трекінгом витрат на рівні команди. Апаратна база — NVIDIA Blackwell, Vera Rubin заявлена як наступна. Ціни за окремими моделями в документації поки опубліковані не повністю.

## Як стек тримає агентське навантаження?

Prime Inference будує серверний стек на NVIDIA Dynamo, vLLM, Mooncake та FlashInfer. Над ним працювали разом з Inferact і NVIDIA, а виправлення команда віддає в апстрим.

Цільове навантаження агентське: типовий крок агента додає близько 6 тис. токенів до промпту на 140 тис. токенів. Таку суміш Prime Intellect міряє бенчмарком SemiAnalysis AgentX з інжектованими холодними запитами.

Prime Inference розносить префіл і декод на окремі групи GPU. Dynamo керує маршрутизацією, vLLM виконує модель на кожній групі, а декодери підтягують обчислений KV через NIXL. У тестах компанії це дало майже на 40% меншу p90 затримку між токенами.

Маршрутизатор Dynamo зважає на перетин кешованого префікса і черги, а сесії між кроками залишаються на тому самому декодері. Mooncake додає другий рівень KV у DRAM хоста, тож довгий контекст не рахується заново на кожному кроці.

Команда Prime Intellect додала в Dynamo білдер структурних тегів під формат інструментів GLM, а vLLM через xgrammar маскує токени, що порушують схему інструмента. Окремо виправили баги парсингу, зокрема декодування < у коді як <.

## Що показують цифри GLM-5.3 на GB200 NVL72?

Інтерактивною ціллю були 100 вихідних токенів на секунду на користувача. На цій планці співвідношення префілу до декоду 1:4 обслужило найбільше користувачів: 66 сесій на префіл-групу при 101 токені на секунду на користувача і 100 вихідних токенів на секунду на GPU.

Топологія префілу DEP8 дає приблизно у 5 разів більше корисної ємності префікс-кешу, ніж TEP8 на тому самому залізі. Менший бюджет префілу теж допоміг: скорочення з 8 тис. до 4 тис. токенів на крок на GPU зрізало медіанне очікування в черзі з 550 мс до 110 мс, а медіанний час до першого токена впав приблизно на 20%.

Стиснення NVFP4 KV зменшило рядок MLA-кешу з 576 до 352 байтів, а кількість кешованих токенів на декодер зросла з **1,09 млн до 1,63 млн**. Нативне sparse-MLA ядро показало близько 12,0 мкс при 15 токенах запиту проти 17,7 мкс у етапній версії та 13,7 мкс у FP8 — Prime Intellect підкреслює, що результат залежить від навантаження.

Розкладка BLHNC KV скоротила кількість дескрипторів передачі з 19 559 до близько 1 940, а середній час передачі впав зі 146 мс до 78 мс.

## Що робити зараз

Найімовірніше, вигода проявиться там, де довгі контексти й часті виклики інструментів зараз дають черги та рвану видачу.

- Переведіть одного кодового агента на OpenAI-сумісний ендпоїнт і порівняйте час до першого токена та p90 між токенами з нинішнім провайдером.
- Прогоніть контекст на 140 тис. токенів із кроком 6 тис. токенів і перевірте стабільність викликів інструментів.
- Розділіть навантаження: серверлес для піків, зарезервована потужність для рівного фону, витрати — на рівні команди.
- Стежте за roadmap: batch inference і деплої в один клік для окремих моделей ще не запущені.

---

Теги: AI, інференс, OpenSource, агенти, GPU

Джерело: AiiN — https://aiin.news/article?slug=prime-inference-%D1%81%D0%B5%D1%80%D0%B2%D0%B5%D1%80%D0%BB%D0%B5%D1%81-%D1%96-%D1%80%D0%B5%D0%B7%D0%B5%D1%80%D0%B2-%D0%B4%D0%BB%D1%8F-%D0%B2%D1%96%D0%B4%D0%BA%D1%80%D0%B8%D1%82%D0%B8%D1%85-%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9. Цитуючи, посилайтесь на канонічний URL.
