Більшість сучасних AI-систем стійкі лише «на вигляд». Вони добре тримаються проти відомих атак у тестовому середовищі, але щойно зловмисник підбирає нову стратегію — модель ламається. Certified robustness вирішує цю проблему радикально: замість «перевірити на мільярді атак», вона математично доводить, що жодна атака в межах заданого радіусу не змінить передбачення. Але ціна цих гарантій — значне падіння точності.

Нова робота, опублікована на arXiv, пропонує вихід: adversarial distillation як механізм підвищення certified robustness без критичного жертвування accuracy. Підхід поєднує логіку knowledge distillation із структурою adversarial training — і отримує краще від обох методів.

Certified robustness: гарантії замість евристик

Сертифікована стійкість — це формальні математичні гарантії того, що модель не змінить свою відповідь, якщо вхідні дані зазнають збурення в межах ℓp-норми радіусу ε. Методи на кшталт randomized smoothing, IBP чи CROWN-IBP дозволяють «сертифікувати» відсоток тестових прикладів, для яких гарантія виконується.

Проблема: certified accuracy — відсоток сертифікованих прикладів — зазвичай набагато нижча, ніж clean accuracy. Наприклад, на CIFAR-10 при ε=8/255 типова модель може мати clean accuracy близько 80%, а certified accuracy — лише 30–40%. Це різниця між «прийнятно для продакшну» і «академічна цікавинка без практичної цінності». Практики стикаються з жорстким вибором: або хочеш гарантій — жертвуй точністю, або хочеш точності — залишайся без гарантій. Adversarial distillation атакує саме цей компроміс.

Adversarial distillation: як це працює

Knowledge distillation — техніка, де student-модель навчається не лише на hard labels (правильний клас), а й на soft predictions вчителя (розподіл ймовірностей). Це дозволяє передати «темні знання» — що модель вважає схожим на що і з якою впевненістю.

За даними arXiv, автори роблять ключовий крок: teacher-модель теж є adversarially-trained, а дистиляція відбувається безпосередньо на adversarial прикладах. Це означає, що student бачить не просто «правильні» відповіді, а розподіл ймовірностей вчителя для adversarial inputs — набагато багатше та інформативніше навчальне середовище, ніж стандартне one-hot навчання.

Конкретний механізм включає кілька компонентів:

Результат: student досягає вищої certified accuracy при тій самій або кращій clean accuracy порівняно з baseline adversarial training без дистиляції.

Що це означає для AI-білдерів

Certified robustness досі залишалась нішою академічних досліджень, бо практичний overhead виглядав надто великим. Adversarial distillation змінює цей розрахунок у кількох вимірах:

Важливо розуміти обмеження: certified robustness гарантує стійкість тільки в межах заданого ε. Якщо зловмисник може збурити вхід понад цю межу — гарантія не діє. Тому certified robustness — не «кінцевий захист», а доповнення до adversarial testing та red-teaming, а не їх заміна.

Висновок AiiN

Дослідження adversarial distillation для certified robustness — частина ширшого тренду: зробити формальні гарантії безпеки AI практично досяжними, а не тільки теоретично цікавими. Прогалина між академічними результатами й продакшн-реалізаціями поступово скорочується.

Для білдерів висновок практичний: якщо ваш продукт діє в середовищі з потенційними adversarial inputs і потребує гарантій — а не лише «гарних цифр на бенчмарках» — certified training із distillation-оптимізацією вже сьогодні дає робочі інструменти. Слідкуйте за реалізаціями в auto_LiRPA та аналогічних бібліотеках: академічні ідеї із arXiv знаходять місце в продакшн-стеку значно швидше, ніж здається.