# LeapQuant дає 8-бітний стан лінійної уваги з прискоренням до 3,7×

> LeapQuant квантує рекурентний стан лінійної уваги до 8 біт майже без втрати точності й прискорює наскрізний інференс у 1,47 раза на трьох GPU.

- Опубліковано: 30 вересня 2026 р. (2026-09-30T02:51:18.214771+00:00)
- Розділ: AI-дослідження
- На основі публікації: [arXiv](http://arxiv.org/abs/2609.38166v1)
- Видання: AiiN (https://aiin.news)
- URL: https://aiin.news/article?slug=leapquant-%D0%B4%D0%B0%D1%94-8-%D0%B1%D1%96%D1%82%D0%BD%D0%B8%D0%B9-%D1%81%D1%82%D0%B0%D0%BD-%D0%BB%D1%96%D0%BD%D1%96%D0%B9%D0%BD%D0%BE%D1%97-%D1%83%D0%B2%D0%B0%D0%B3%D0%B8-%D0%B7-%D0%BF%D1%80%D0%B8%D1%81%D0%BA%D0%BE%D1%80%D0%B5%D0%BD%D0%BD%D1%8F%D0%BC-%D0%B4%D0%BE-3-7

---

LeapQuant квантує рекурентний стан лінійної уваги до 8 біт майже без втрати точності. Препринт від 29 вересня 2026 року обіцяє прискорення наскрізного інференсу в 1,47 раза.

Гібридні LLM замінюють звичайну увагу на лінійну — зокрема Gated DeltaNet (GDN) і Kimi Delta Attention (KDA). Вони стискають контекст у фіксований рекурентний стан, тож обробка довгого контексту стає дешевшою. Постійне читання й оновлення цього стану лишається головним вузьким місцем інференсу. LeapQuant працює без донавчання, тож його можна перевірити на вже розгорнутих моделях. [За даними arXiv](http://arxiv.org/abs/2609.38166v1), автори отримали точність, порівнянну з базовим FP32.

## Як LeapQuant уникає накопичення помилок?

LeapQuant квантує рекурентний стан раз наприкінці вікна токенів, а не на кожному кроці. Усередині вікна виходи рахуються із зафіксованого 8-бітного стану плюс буферизовані оновлення у високій точності.

Звичайне квантування стану втрачає якість через суму дрібних округлень на довгій послідовності. LeapQuant перескакує через вікно токенів: кількість округлень падає, і помилка не встигає накопичитись.

## Що LeapQuant робить із викидами?

LeapQuant залишає найбільші викиди стану в кількох високоточних компенсаторних токенах (Compensator Tokens). Вони проходять той самий шлях оновлення, що й звичайні токени, і компенсують спотворення від округлення. Залишок перед квантуванням метод додатково згладжує.

Окремі рядки й стовпці стану з великими значеннями ламають наївне 8-бітне квантування. Кілька таких значень, винесених у високу точність, прибирають головне джерело втрати якості й коштують дешево.

## Що показали тести на Qwen, Kimi і GLM?

Експерименти охопили сімейства моделей Qwen, Kimi і GLM. Середнє прискорення на рівні CUDA-ядра — 2,05–3,70×, наскрізний інференс — **1,47×**. Вимірювання йшли на NVIDIA B200, RTX PRO 6000 і RTX 5090.

Для команд із власним залізом це орієнтир: скільки дає 8-бітний стан без заміни парку GPU. Історія викликів і документів, ймовірно, стане першим кандидатом на перехід у 8 біт, бо довгі сесії найсильніше залежать від вартості стану.

## З чого почати пілот?

LeapQuant не потребує донавчання, тому пілот можна запустити на тих самих моделях, які вже в роботі.

- Прогнати власні довгі траси на 8-бітному стані й порівняти відповіді з FP32 на тих самих промптах.
- Заміряти затримку ядра та пам'ять стану на цільових GPU до масштабування агентів.
- Окремо перевірити сценарії з довгими ланцюжками інструментальних викликів, де помилка округлення накопичується найшвидше.
- Зафіксувати метрики якості агентних ланцюжків до і після переходу на квантований стан.

Порівняйте затримку та якість на власних трасах і вирішуйте для кожного сценарію окремо, де залишити FP32.

---

Теги: ШІ, LLM, квантування, LinearAttention, AIагенти

Джерело: AiiN — https://aiin.news/article?slug=leapquant-%D0%B4%D0%B0%D1%94-8-%D0%B1%D1%96%D1%82%D0%BD%D0%B8%D0%B9-%D1%81%D1%82%D0%B0%D0%BD-%D0%BB%D1%96%D0%BD%D1%96%D0%B9%D0%BD%D0%BE%D1%97-%D1%83%D0%B2%D0%B0%D0%B3%D0%B8-%D0%B7-%D0%BF%D1%80%D0%B8%D1%81%D0%BA%D0%BE%D1%80%D0%B5%D0%BD%D0%BD%D1%8F%D0%BC-%D0%B4%D0%BE-3-7. Цитуючи, посилайтесь на канонічний URL.
