Коли стартап збирає черговий мільярдний раунд через кілька місяців після попереднього — це не просто сигнал інвесторського ентузіазму. Це вказівка на те, де саме зараз концентрується найбільша цінність у всьому AI-стеку. За даними TechCrunch, Baseten — компанія, що спеціалізується на inference-інфраструктурі для ML-моделей — веде переговори щодо залучення $1,5 млрд у новому раунді, і це лише за кілька місяців після попереднього великого фінансування.
Для тих, хто стежить за ринком не через заголовки, а через технічний контекст: Baseten — це не черговий AI-обгортковий стартап. Компанія будує саме ту частину стеку, без якої жодна LLM, дифузійна модель чи мультимодальна система не зможе потрапити до кінцевого користувача з прийнятною затримкою і вартістю. Їхній продукт — це оркестрація inference-воркфлоу, зокрема через Truss (відкритий фреймворк для упаковки моделей) та власну платформу для масштабованого деплою.
Inference — нова лінія фронту в AI-гонці
Протягом 2023–2024 років більшість капіталу в AI йшла у тренування: гігантські GPU-кластери, синтетичні датасети, RLHF-конвеєри. Але у 2025–2026 роках ця динаміка кардинально змінилась. Моделі вже є — десятки відкритих і закритих. Питання тепер не «яку модель навчити», а «як подати її мільйону запитів одночасно з latency під 200 мс і вартістю, яка не з'їдає маржу».
Саме тут inference-інфраструктура стає бізнес-критичною. І саме тому в цьому сегменті зараз найгарячіша конкуренція:
- Швидкість autoscaling — модель має масштабуватися від нуля до тисяч паралельних запитів за секунди, а не хвилини.
- Підтримка спеціалізованих архітектур — mixtral-like MoE, vision-language моделі, аудіо-pipeline вимагають різних hardware-профілів і батчинг-стратегій.
- Вартість GPU-часу — при ціні H100 від $2,5/год кожна неефективно використана секунда — це пряма втрата маржі для клієнта.
- Observability і debugging — inference у продакшені ламається інакше, ніж під час розробки; потрібні спеціалізовані інструменти моніторингу.
Baseten закриває більшість із цих потреб і при цьому залишається нейтральним до конкретних хмарних провайдерів — що стратегічно важливо для enterprise-клієнтів, які хочуть уникнути vendor lock-in.
Чому $1,5 млрд — це не переоцінка, а ставка на швидкість
На перший погляд, два мегараунди поспіль звучать як класичний венчурний перегрів. Але якщо розкласти по складових — логіка стає зрозумілою.
По-перше, inference-інфраструктура — це капіталомісткий бізнес. На відміну від SaaS-продуктів, де маргінальна вартість додаткового клієнта близька до нуля, тут потрібні реальні GPU-кластери, мережева інфраструктура, контракти з постачальниками обладнання. $1,5 млрд — це не просто оцінка компанії; значна частина піде на залізо і prepaid capacity-угоди з Nvidia, AMD або хмарними провайдерами.
По-друге, вікно для захоплення ринку вузьке. Modal, Together.ai, Replicate, Fireworks.ai, Cerebrium — список конкурентів у сегменті inference-платформ росте щомісяця. Хто першим підпише довгострокові контракти з великими enterprise-клієнтами та закріпить інтеграції у їхніх production-стеках — той виграє довгострокову частку ринку. У цій гонці капітал напряму конвертується у швидкість зростання.
По-третє, структура попиту змінюється. Якщо ще рік тому inference-витрати стартапів були передбачуваними і відносно невеликими, то сьогодні компанії будують агентські pipeline, де одна кінцева дія користувача може тригерити десятки LLM-викликів у фоні. Inference-витрати зростають не лінійно, а експоненційно — разом із складністю продуктів.
Що це означає для AI-білдерів прямо зараз
Практична інтерпретація цього раунду для тих, хто будує AI-продукти:
- Inference-вартість — це продуктова проблема, не DevOps-проблема. Якщо ваша команда не має виділеної людини, яка думає про GPU-ефективність і оптимізацію batching — ви, скоріш за все, переплачуєте в рази.
- Managed inference-платформи виправдані для більшості стартапів. Будувати власну inference-інфраструктуру з нуля при сьогоднішній складності моделей — це місяці роботи і значні капітальні витрати. Baseten, Modal та подібні сервіси дають time-to-market, який важко переоцінити.
- Слідкуйте за конкуренцією у сегменті. Великі раунди таких гравців як Baseten неминуче прискорять гонку фіч і знизять ціни для кінцевих клієнтів — це позитивно для всіх, хто будує продукти поверх чужої inference-інфраструктури.
- Вибір inference-провайдера — стратегічне рішення. Враховуйте не лише поточну ціну за токен, але й roadmap, надійність SLA і те, наскільки легко мігрувати при потребі.
Висновок AiiN
Мегараунд Baseten — це ще один доказ того, що реальна цінність у поточному AI-циклі акумулюється не у фундаментальних моделях (де виграють кілька гравців з мільярдними бюджетами на тренування), а в інфраструктурних шарах, які роблять ці моделі доступними, швидкими і економічно виправданими у продакшені.
Для AI-білдерів це означає одне: вибір inference-стратегії — це більше не технічна деталь у архітектурному документі. Це бізнес-рішення, яке впливає на юніт-економіку, швидкість ітерацій і конкурентоспроможність продукту. А те, що у цей сегмент ллються мільярди — лише підтверджує: хто контролює inference, той контролює AI-продакшен наступного десятиліття.