Коли OpenAI оголосила про розробку власного чіпа під кодовою назвою Jalapeño, перша реакція ринку була стримана: ще один гравець намагається кинути виклик NVIDIA. Але деталі архітектури розкривають дещо важливіше — це не про тренування моделей, а про математику inference на масштабі мільярдів запитів на день.

Inference — це та частина AI-стеку, яку традиційно недооцінюють. Навчання GPT-4 коштувало десятки мільйонів доларів і відбулося один раз. Але відповідати на сотні мільйонів запитів щодня — це постійний, незупинний потік операційних витрат. За приблизними оцінками аналітиків, OpenAI витрачає на inference у рази більше, ніж на тренування. Саме тут Jalapeño і атакує проблему.

За даними AI News, економіка стоїть за розробкою Jalapeño не менш важлива, ніж технічна складова: кожен відсоток зниження вартості inference в масштабі ChatGPT — це сотні мільйонів доларів економії щорічно. І саме ця арифметика пояснює, чому OpenAI вкладає мільярди у власний silicon.

Чому inference — головний кост-центр AI-компаній

Більшість розмов про AI-чіпи крутяться навколо training: H100, B200, матриця FLOPS, пам'ять HBM. Але для комерційних AI-платформ реальна математика виглядає інакше.

Тренування — одноразова капітальна витрата. Inference — операційна витрата, що масштабується разом із кожним новим користувачем. Коли у вас 200 мільйонів активних користувачів ChatGPT, навіть економія $0.001 на запит дає астрономічний ефект за рік. Класичний GPU на кшталт NVIDIA H100 проектувався як універсальний обчислювальний інструмент: він добре тренує моделі, але для inference-задач несе надлишок — велика матрична пам'ять, гнучка архітектура, підтримка безлічі типів обчислень. Усе це коштує і в грошах, і в енергоспоживанні.

ASIC (application-specific integrated circuit), заточений під inference трансформерних моделей, може бути принципово ефективнішим. Зокрема:

Архітектура Jalapeño — що відомо

Jalapeño — inference ASIC, розроблений у партнерстві з Broadcom і вироблений на потужностях TSMC. На відміну від тренувальних акселераторів, він не потребує надвеликої HBM-пам'яті для зберігання градієнтів — inference потребує значно менше пам'яті, зате з вищою пропускною здатністю для autoregressive generation.

Ключові принципи дизайну, що випливають з архітектурних підходів до inference:

Якщо OpenAI досягне хоча б 40% зниження cost-per-token порівняно з NVIDIA H100 на inference-навантаженнях, це радикально змінить конкурентне становище компанії — і тиск на ціни у всій галузі.

Що це означає для AI-білдерів і ринку

Для тих, хто будує продукти на API OpenAI, короткострокові наслідки прямі: нижча вартість inference означає нижчу ціну API, а отже — менші витрати на продукт. OpenAI вже кілька разів знижувала ціни на GPT-4o та o-series — і власний чіп дає технічну основу продовжувати цю тенденцію.

Але є ширший ефект. Коли Microsoft, Google і Anthropic також мають власний silicon (TPU v5, Trainium/Inferentia, Google TPU Pod), API-ціна стає стратегічною зброєю, а не просто відображенням витрат. OpenAI без власного чіпа була структурно вразливою: 100% залежність від NVIDIA означала, що кожне зростання попиту — це зростання витрат поза контролем компанії.

Jalapeño змінює це рівняння. Для AI-білдерів, що вибирають між провайдерами — OpenAI, Anthropic, Google, Mistral — конкурентна ціна inference стає дедалі вагомішим аргументом поруч із якістю моделі.

Висновок AiiN

Jalapeño — це не просто черговий чіп. Це системна ставка OpenAI на вертикальну інтеграцію: від дизайну моделей до кремнієвого субстрату, на якому вони запускаються. Компанії, що контролюють весь стек, мають структурну перевагу в ціноутворенні, надійності та швидкості інновацій — і це те, що OpenAI намагається відтворити за прикладом Google з TPU.

Для AI-білдерів головний сигнал такий: inference economics покращуватимуться і далі, а компанії з власним silicon матимуть структурну перевагу на довгій дистанції. Слідкуйте за ціновими трендами API — вони розкажуть про стратегію OpenAI більше, ніж будь-який прес-реліз.