Nvidia оприлюднила слайд, на якому стверджує, що чип для інференсу Groq 3 LPX обробляє запити вчетверо швидше за конкурента Cerebras. Порівняння з'явилося в маркетингових матеріалах компанії й миттєво привернуло увагу спільноти AI-інженерів — не тому, що цифра «4x» вражає сама по собі, а тому, що методика, яка стоїть за нею, виявилася далеко не такою прозорою.

Обидві компанії — і Groq, і Cerebras — роками змагаються за титул найшвидшого чипа для інференсу великих мовних моделей, пропонуючи альтернативу класичним GPU від Nvidia. Те, що саме Nvidia раптом виступила арбітром у цій суперечці, додає ситуації додаткової іронії: компанія, чиї GPU обидва стартапи намагаються витіснити з ринку інференсу, тепер публікує порівняння їхніх власних продуктів.

За даними The Decoder, математика, що стоїть за заявленим чотирикратним відривом, виявилася складнішою, ніж здається на перший погляд.

Що саме заявила Nvidia про Groq 3 LPX і Cerebras?

Nvidia порівняла швидкість інференсу двох чипів, спеціалізованих саме на обробці запитів до вже навчених моделей, а не на тренуванні. Groq будує свої LPU (Language Processing Unit) на детермінованій архітектурі з передбачуваною затримкою, тоді як Cerebras робить ставку на фізично гігантський Wafer Scale Engine, що вміщує цілу модель на одному кристалі. Висновок зі слайда Nvidia — Groq 3 LPX випереджає Cerebras учетверо — виглядає як однозначна перемога, поки не заглибитися в умови, за яких вимірювалася швидкість.

Чому порівняння швидкості інференсу викликає сумніви?

Бенчмарки інференс-чипів чутливі до десятків параметрів, і зміна будь-якого з них здатна перевернути результат:

Коли порівняння швидкості публікує сторона, зацікавлена в конкретному наративі — а Nvidia прямо зацікавлена показати, що ринок альтернативних інференс-чипів нестабільний і суперечливий, — умови тесту рідко бувають нейтральними. Це не означає, що цифра «4x» вигадана, але означає, що вона описує вузький сценарій, а не універсальну перевагу одного чипа над іншим. Варто пам'ятати, що й Groq, і Cerebras публікують власні бенчмарки, де перемагають за іншими метриками, — і жоден окремий слайд не дає повної картини для ухвалення рішення про закупівлю заліза.

Як AI-білднику обирати інференс-чип, а не вірити слайдам?

Практичний висновок для команд, що обирають інфраструктуру під продакшн-інференс, — ніколи не переносити маркетинговий бенчмарк напряму на власне навантаження. Перед вибором варто:

Висновок AiiN

Наша теза проста: у гонці інференс-чипів маркетинг випереджає стандартизацію вимірювань, і поки в індустрії немає незалежного протоколу на кшталт MLPerf, якому довіряють усі сторони, кожен вендорський слайд варто читати як рекламний, а не науковий документ. Те, що саме Nvidia — гравець із найбільшою вагою на ринку — вирішила погратися методикою конкурентів, лише підтверджує: бенчмарки інференсу стали інструментом конкурентної боротьби, а не об'єктивним джерелом істини для тих, хто ухвалює рішення про закупівлю заліза.

Що таке LPU і чим він відрізняється від GPU?

LPU (Language Processing Unit) — це спеціалізований чип Groq, спроєктований саме під інференс мовних моделей із детермінованою, передбачуваною затримкою, на відміну від GPU загального призначення, які Nvidia продає як для тренування, так і для інференсу.

Чи можна довіряти бенчмаркам, які публікують виробники чипів?

Довіряти варто з обережністю: вендорські бенчмарки зазвичай обирають умови тесту (батч, точність, модель), вигідні власному продукту, тому перед покупкою заліза варто перевіряти показники на власному навантаженні, а не лише на маркетингових слайдах.