Ви навчили модель, вона показує непогані метрики, і тепер хочете зрозуміти, що саме вона вивчила. Відкриваєте SHAP-графіки, дивитеся на attention weights, запускаєте LIME — і отримуєте красиві візуалізації, які виглядають переконливо. Але ось питання, яке ставлять дослідники: наскільки ці пояснення насправді відображають те, що відбувається всередині моделі?

За даними arXiv, нова робота аналізує саме цю прогалину — між тим, що post-hoc методи пояснення демонструють, і тим, що модель робить насправді. Результати мають пряме значення для всіх, хто будує продукти на ML: від кредитного скорингу до рекомендаційних систем і медичної діагностики.

Post-hoc пояснення: зручність, що може вводити в оману

Post-hoc методи — LIME, SHAP, Grad-CAM, attention maps — називаються так, тому що вони аналізують вже навчену «чорну скриньку» ззовні. Вони не змінюють архітектуру й не дивляться у ваги напряму. Натомість будують наближення: «якби ця ознака змінилася так, то прогноз би змінився отак».

Ця логіка має очевидну привабливість. Не потрібно переосмислювати архітектуру, не потрібно навчати interpretable surrogate-модель з нуля — просто запускаєш готову бібліотеку і отримуєш «пояснення». Це зручність, але вона ж і є джерелом ризику.

Вірність: чи пояснення справді пояснює?

Вірність (faithfulness) у контексті XAI означає: наскільки точно пояснення відображає реальну логіку обчислень усередині моделі? Відповідь дослідників часто невтішна. Ось де конкретно ламається вірність:

Важливо пам'ятати: «пояснення виглядає розумно» не дорівнює «пояснення відповідає логіці моделі».

Надійність: чи отримаємо те саме пояснення двічі?

Надійність (reliability) — інший вимір: чи дає метод стабільні результати при незначних змінах вхідних даних або параметрів самого алгоритму пояснення? Тут дослідники фіксують серйозні проблеми:

Останній пункт — найбільш критичний для продуктів із вимогами до регуляторного compliance. Якщо аудитор перевіряє систему прийняття рішень через SHAP-пояснення, і ці пояснення не відображають реальну логіку, — перевірка є марною.

Що це означає для AI-розробників

Висновок не в тому, що XAI-інструменти марні. Він у тому, що їх потрібно використовувати із розумінням обмежень:

Розвиток поля XAI іде в бік методів, що вбудовують інтерпретованість в архітектуру моделі, а не накладають її зовні. Це складніше інженерно, але надійніше по суті. Поки більшість практиків працює з post-hoc методами — і це нормально, якщо розуміти: ви отримуєте наближення, а не рентгенівський знімок моделі.