Поки весь світ стежить за гонитвою за потужнішими GPU, справжнє вузьке місце сучасного AI тихо залишається в тіні — пам'ять. Не обчислювальна потужність, не архітектура трансформера: саме швидкість і структура доступу до пам'яті визначають, наскільки ефективно великий мовний модель працює в режимі inference. Anthropic, схоже, нарешті зробила крок, якого давно очікували інсайдери галузі.

За даними The Decoder, Anthropic і Micron Technology ведуть переговори про спільне проектування архітектури пам'яті, оптимізованої під AI-навантаження. Це не типова угода постачальника з клієнтом — мова йде про глибоку технічну співпрацю, де одна сторона розуміє навантаження на рівні моделей, а інша — на рівні кремнію.

Чому пам'ять важливіша за обчислення

У середовищі AI-інфраструктури існує поняття «memory wall» — ситуація, коли процесор чекає на дані з пам'яті довше, ніж витрачає на самі обчислення. Для LLM під час inference це критично: кожен токен генерується послідовно, і модель постійно звертається до KV-кешу, який зберігає контекст усього діалогу. При context window у 128K або 1M токенів цей кеш стає величезним і вимогливим до пропускної здатності.

Сучасні AI-акселератори — NVIDIA H100, GB200 — використовують HBM (High Bandwidth Memory), яку виробляють SK Hynix, Samsung і Micron. Але навіть HBM3e має фізичні обмеження. Будь-який, хто розгортав vLLM або TensorRT-LLM у production, знає: при великому batch size або довгому контексті throughput впирається не в TFLOPS, а в GB/s. Обчислень вистачає — пам'ять не встигає.

Що означає «co-design» на практиці

Коли компанії говорять про co-design апаратного та програмного забезпечення, це зазвичай означає одне з двох:

Партнерство Anthropic із Micron, схоже, претендує на другий, більш амбітний варіант. Якщо Anthropic надає Micron детальний профіль того, як Claude звертається до пам'яті — які патерни доступу, яка локальність даних, які операції найчастіші — Micron теоретично може адаптувати архітектуру HBM або розробити нові типи пам'яті з меншою latency для цих конкретних patterns. Це схоже на те, що Google зробила з TPU: замість адаптуватися під GPU, вони спроектували апаратне забезпечення під свої матричні операції. Anthropic застосовує ту саму логіку, але до рівня пам'яті.

Стратегічний контекст: AI-компанії будують власний стек

Партнерство з Micron — частина ширшої тенденції. Anthropic вже заявляла про плани інвестувати мільярди доларів у власну AI-інфраструктуру. Microsoft, Google, Meta — всі великі AI-гравці поступово рухаються до вертикальної інтеграції, прагнучи зменшити залежність від NVIDIA як єдиного постачальника AI-заліза.

Micron, зі свого боку, зацікавлена у довгострокових технічних специфікаціях від провідних AI-лабораторій. Поки SK Hynix домінує у постачанні HBM для NVIDIA, Micron шукає диференціацію — і доступ до реальних production AI-навантажень є саме тим, чого не має жоден інший виробник пам'яті. Для Anthropic це ще й питання economics: вартість inference є однією з головних операційних витрат. Краща архітектура пам'яті — більше запитів при тому самому залізі — прямий вплив на unit economics Claude API.

Висновок AiiN: що це означає для AI-білдерів

Якщо ця ініціатива матеріалізується у реальні продукти, наслідки для розробників будуть відчутними:

Реальні продукти можуть з'явитися не раніше ніж за кілька років. Але сам факт того, що провідна AI-лабораторія починає впливати на дизайн апаратного забезпечення нижче рівня GPU, є структурною зміною у тому, як будується AI-інфраструктура. Стек, на якому ви будуєте сьогодні, не є кінцевою точкою — і наступне покоління AI-заліза вже проектується під реальні inference patterns. Це буде помітно у throughput, latency та cost-per-token вже в найближчі роки.