Більшість сучасних AI-систем стійкі лише «на вигляд». Вони добре тримаються проти відомих атак у тестовому середовищі, але щойно зловмисник підбирає нову стратегію — модель ламається. Certified robustness вирішує цю проблему радикально: замість «перевірити на мільярді атак», вона математично доводить, що жодна атака в межах заданого радіусу не змінить передбачення. Але ціна цих гарантій — значне падіння точності.
Нова робота, опублікована на arXiv, пропонує вихід: adversarial distillation як механізм підвищення certified robustness без критичного жертвування accuracy. Підхід поєднує логіку knowledge distillation із структурою adversarial training — і отримує краще від обох методів.
Certified robustness: гарантії замість евристик
Сертифікована стійкість — це формальні математичні гарантії того, що модель не змінить свою відповідь, якщо вхідні дані зазнають збурення в межах ℓp-норми радіусу ε. Методи на кшталт randomized smoothing, IBP чи CROWN-IBP дозволяють «сертифікувати» відсоток тестових прикладів, для яких гарантія виконується.
Проблема: certified accuracy — відсоток сертифікованих прикладів — зазвичай набагато нижча, ніж clean accuracy. Наприклад, на CIFAR-10 при ε=8/255 типова модель може мати clean accuracy близько 80%, а certified accuracy — лише 30–40%. Це різниця між «прийнятно для продакшну» і «академічна цікавинка без практичної цінності». Практики стикаються з жорстким вибором: або хочеш гарантій — жертвуй точністю, або хочеш точності — залишайся без гарантій. Adversarial distillation атакує саме цей компроміс.
Adversarial distillation: як це працює
Knowledge distillation — техніка, де student-модель навчається не лише на hard labels (правильний клас), а й на soft predictions вчителя (розподіл ймовірностей). Це дозволяє передати «темні знання» — що модель вважає схожим на що і з якою впевненістю.
За даними arXiv, автори роблять ключовий крок: teacher-модель теж є adversarially-trained, а дистиляція відбувається безпосередньо на adversarial прикладах. Це означає, що student бачить не просто «правильні» відповіді, а розподіл ймовірностей вчителя для adversarial inputs — набагато багатше та інформативніше навчальне середовище, ніж стандартне one-hot навчання.
Конкретний механізм включає кілька компонентів:
- Adversarial teacher soft labels — замість one-hot, student вчиться на probability distribution вчителя для adversarial прикладів, що дає значно більше сигналу про межові рішення класифікатора
- Certifiable loss functions — функції втрат, сумісні з certified training через IBP чи CROWN-IBP, адаптовані під дистиляційну схему навчання
- Dual supervision — student оптимізується одночасно на clean та adversarial прикладах із teacher guidance, зберігаючи баланс між точністю й стійкістю
Результат: student досягає вищої certified accuracy при тій самій або кращій clean accuracy порівняно з baseline adversarial training без дистиляції.
Що це означає для AI-білдерів
Certified robustness досі залишалась нішою академічних досліджень, бо практичний overhead виглядав надто великим. Adversarial distillation змінює цей розрахунок у кількох вимірах:
- Ефективність навчання — distillation прискорює тренування student-моделі. Adversarial distillation зберігає цю перевагу: не потрібно тренувати велику модель з нуля на дорогих adversarial прикладах
- Edge deployment — техніка відкриває шлях до сертифікованих моделей меншого розміру, що критично для мобільних пристроїв, IoT та embedded systems
- Regulated industries — у медицині, автономних системах і фінансах certified robustness — не nice-to-have, а вимога регуляторів. Інструменти, що роблять certified training практичнішим, напряму розширюють простір deployable моделей
- Composability — підхід сумісний із наявними certified training frameworks. Якщо вже використовуєте IBP або auto_LiRPA, adversarial distillation можна додати як компонент без переробки пайплайну
Важливо розуміти обмеження: certified robustness гарантує стійкість тільки в межах заданого ε. Якщо зловмисник може збурити вхід понад цю межу — гарантія не діє. Тому certified robustness — не «кінцевий захист», а доповнення до adversarial testing та red-teaming, а не їх заміна.
Висновок AiiN
Дослідження adversarial distillation для certified robustness — частина ширшого тренду: зробити формальні гарантії безпеки AI практично досяжними, а не тільки теоретично цікавими. Прогалина між академічними результатами й продакшн-реалізаціями поступово скорочується.
Для білдерів висновок практичний: якщо ваш продукт діє в середовищі з потенційними adversarial inputs і потребує гарантій — а не лише «гарних цифр на бенчмарках» — certified training із distillation-оптимізацією вже сьогодні дає робочі інструменти. Слідкуйте за реалізаціями в auto_LiRPA та аналогічних бібліотеках: академічні ідеї із arXiv знаходять місце в продакшн-стеку значно швидше, ніж здається.