Hugging Face знову в центрі уваги: нове розслідування показало, що компрометація інфраструктури платформи торкнулася значно більшої кількості моделей і облікових записів розробників, ніж повідомлялося одразу після інциденту.

Спочатку йшлося про обмежений набір скомпрометованих токенів і кількох репозиторіїв. Тепер картина інша: за новими даними, зловмисники мали доступ до інфраструктури довше і ширше, ніж визнавали перші публічні заяви — а це означає, що частина моделей у продакшн-пайплайнах могла тягнути артефакти з джерел, чия цілісність вже під сумнівом.

За даними Platformer, розширений масштаб інциденту — це не просто уточнення цифр, а сигнал про системну прогалину в тому, як індустрія перевіряє походження моделей, які завантажує з публічних хабів.

Що саме показало нове розслідування?

Головний висновок — початкова оцінка масштабу атаки була заниженою: зачепленими виявилися більше моделей і акаунтів, ніж фіксували перші звіти про інцидент. Для платформи такого масштабу, як Hugging Face Hub, де щодня тисячі команд тягнуть ваги моделей автоматизованими пайплайнами, різниця між «кількома репозиторіями» і «значно ширшим колом» — це різниця між локальним інцидентом і питанням довіри до всієї екосистеми відкритих моделей. Для команд, що будують продакшн-сервіси на базі готових моделей, це означає одне: репутація джерела — кількість завантажень, зірок, верифікований бейдж автора — більше не гарантує, що артефакт не змінювався з моменту, коли ви востаннє його перевіряли.

Чому масштаб спершу недооцінили?

Типова причина — форензика компрометації хмарної інфраструктури рідко завершується за кілька днів: команди безпеки спочатку публікують те, що можуть підтвердити з високою впевненістю, а повну картину складають тижнями чи місяцями. Ймовірно, саме тому перша заява описувала вужче коло постраждалих, ніж виявилося насправді, — це поширений патерн для інцидентів такого типу, а не ознака замовчування.

Що робити командам, які тягнуть моделі з Hub у продакшн?

Якщо ваш пайплайн автоматично підтягує ваги моделей з Hugging Face Hub, розширений масштаб інциденту — привід перевірити ланцюжок постачання, а не просто прочитати новину. Конкретні кроки:

Висновок AiiN: що це означає для індустрії далі?

Наша теза проста: відкриті хаби моделей досі не мають зрілої культури підпису й верифікації артефактів, порівнянної з тим, що є в пакетних менеджерах на кшталт npm чи PyPI після років інцидентів там. Поки перевірка хешу залишається ручною дією, яку роблять лише обережні команди, а не дефолтом пайплайна, кожен такий інцидент буде «виявлятися серйознішим» при повторному розслідуванні. Це не привід відмовлятися від Hugging Face Hub — а привід ставитися до нього як до будь-якого зовнішнього постачальника коду: з перевіркою походження за замовчуванням. Показово, що не лише хаби моделей стикаються з такими ризиками: як ми писали, Anthropic зупиняла тренування Claude через кібер-ризики, і це той самий клас проблем — довіра до інфраструктури, а не лише до алгоритмів.

Чи означає це, що Hugging Face Hub небезпечний для продакшну?

Ні, але масштаб інциденту показує, що довіру до артефактів не можна вважати гарантованою за замовчуванням. Ризик знижується до прийнятного рівня, якщо команда перевіряє хеші, пінить ревізії та обмежує права токенів доступу — тобто застосовує ті самі практики, що й до будь-якої іншої зовнішньої залежності. Це стосується і приватних, і публічних репозиторіїв однаково.

Як дізнатися, чи зачепило саме мою модель або акаунт?

Перевірте офіційні security-повідомлення Hugging Face та дату останньої зміни у картках моделей, якими користуєтесь; якщо репозиторій оновлювався в період, коли тривала компрометація, а ви цього оновлення не ініціювали — це привід для негайної перевірки хешів і ротації токенів.