Генеральний прокурор Каліфорнії приєднався до багатоштатного розслідування діяльності OpenAI, яке стосується липневого зламу платформи Hugging Face та повʼязаного з ним витоку даних. За даними Techmeme, до перевірки вже долучилися прокурори понад десятка штатів США, а участь Каліфорнії — штату, де зареєстрована сама OpenAI, — суттєво підсилює тиск на компанію.
Показовим тут є не сам факт зламу — подібні інциденти трапляються в індустрії регулярно, — а швидкість і масштаб регуляторної реакції. Коли до розслідування одночасно долучаються прокурори більш ніж десяти штатів, це вже не рутинна перевірка окремої скарги, а сигнал, що витік даних, дотичний до OpenAI, розглядають як системну проблему галузі, а не поодинокий випадок.
Для команд, які будують продукти на базі великих мовних моделей, ця історія — привід звірити власну практику зберігання ваг моделей, датасетів і токенів доступу на сторонніх хабах на кшталт Hugging Face.
Що саме сталося з даними OpenAI на Hugging Face?
У липні стався злом, повʼязаний із даними, що стосуються OpenAI і зберігалися на платформі Hugging Face — популярному сховищі моделей, датасетів і демо-застосунків, яким користуються тисячі розробницьких команд. Публічно доступні деталі поки обмежені: Techmeme фіксує сам факт витоку та реакцію регуляторів, а не технічний розбір вразливості. Важливо, що йдеться саме про платформу третьої сторони, а не про внутрішню інфраструктуру OpenAI — і саме ця обставина визначає весь подальший регуляторний сюжет.
Чому до розслідування приєдналася саме Каліфорнія?
Каліфорнія приєдналася до вже наявного розслідування понад десятка штатів, а не ініціювала його самостійно. Це важливо: коли генеральні прокурори кількох штатів обʼєднують зусилля навколо одного інциденту, вони зазвичай прагнуть узгодженого підходу до вимог захисту даних, щоб компанія не могла закрити питання окремою угодою лише з одним штатом. Каліфорнія — домашній штат OpenAI, тому її участь означає, що розслідування зачіпає не лише користувачів по всій країні, а й юрисдикцію, де компанія фізично зареєстрована та веде основну діяльність.
Який ризик несе зберігання моделей і даних на сторонніх платформах?
Ризик тут не гіпотетичний, а вже матеріалізований у вигляді офіційного розслідування. Компанії, що передають ваги моделей, датасети для fine-tuning чи конфігурації агентів на зовнішні хаби, фактично розширюють периметр атаки за межі власної інфраструктури — залишаючись при цьому відповідальними перед регуляторами і користувачами за наслідки. Юридично не так важливо, хто саме зламав систему, як те, чиї дані витекли і хто ніс обовʼязок їх захищати.
Що з цього випливає практично для команд, які тримають щось на публічних ML-хабах:
- перевірити, які саме артефакти — ваги, API-токени, датасети — лежать на зовнішніх платформах;
- розділити production-секрети і публічні репозиторії моделей;
- мати план розкриття інциденту, узгоджений із вимогами кількох юрисдикцій одразу, а не лише однієї.
Що це означає для AI-білдерів вже зараз
Теза AiiN: зберігання даних чи моделей на популярному ML-хабі більше не суто технічне рішення — це рішення з юридичними наслідками, порівнянними з вибором хмарного провайдера для персональних даних клієнтів. Компаніям, що будують продукти поверх чужих моделей і датасетів, варто вже сьогодні документувати, де фізично лежать їхні артефакти й хто відповідає за їх захист: кейс OpenAI показує, що розслідування може прийти не через власний код, а через платформу, якою ви просто користувалися. Це продовжує тенденцію, яку ми вже розбирали в матеріалі про юридичний ризик AI-чатботів: юридична експозиція великих AI-компаній зростає швидше, ніж встигає масштабуватися їхня compliance-команда.
Чи означає розслідування, що OpenAI визнала провину?
Ні. Багатоштатне розслідування — це збір фактів і перевірка дотримання законів про захист даних, а не судове рішення. На момент публікації OpenAI офіційно не визнавала і не заперечувала конкретних звинувачень, повʼязаних із цим інцидентом.
Чи стосується це лише клієнтів OpenAI, чи й розробників на Hugging Face загалом?
Пряме розслідування стосується саме OpenAI, а не Hugging Face як платформи в цілому. Втім, будь-яка команда, що зберігає чутливі дані чи ваги моделей на подібних хабах, перебуває в зоні того самого ризику — просто поки без окремого розслідування проти неї.