xAI Ілона Маска зіткнулася з новим судовим позовом, який стверджує, що компанія тренувала моделі Grok на матеріалах із сексуальним насильством над дітьми (CSAM — Child Sexual Abuse Material). За даними Ars Technica AI, позов з'явився у серпні 2026 року і став одним із найгучніших звинувачень щодо якості тренувальних датасетів за останній рік.
Для індустрії, яка тренує моделі на мільярдах сторінок, зображень і відео, зібраних скрейпінгом інтернету, це не абстрактна репутаційна загроза, а конкретний юридичний прецедент. Якщо суд визнає звинувачення обґрунтованими, справа може стати орієнтиром для того, як регулятори й позивачі оцінюватимуть due diligence компаній, що будують foundation-моделі на відкритих веб-даних.
Наш погляд: питання якості й перевірки датасетів рано чи пізно торкнеться кожної компанії, яка тренує моделі на скрейпнутих даних, — а не лише xAI.
Що саме стверджує позов проти xAI?
Позов заявляє, що xAI використовувала матеріали з сексуальним насильством над дітьми в масиві даних, на яких навчалися моделі Grok. Публічний виклад справи станом на серпень 2026 року фокусується саме на факті потрапляння CSAM у тренувальний корпус, а не на тому, чи модель здатна генерувати такий контент після релізу, — тобто йдеться про провенанс даних, а не про поведінку готової системи.
xAI будує Grok на масштабних веб-скрейпах, включно з даними з платформи X, — модель тренування, яка типова для великих мовних моделей і саме тому вразлива до потрапляння забороненого контенту, якщо фільтрація на вході недостатня.
Чому проблема CSAM у навчальних даних не унікальна для xAI?
Це вже не перший задокументований випадок в індустрії. У грудні 2023 року дослідники Stanford Internet Observatory виявили тисячі підозрюваних CSAM-посилань у датасеті LAION-5B — одному з найбільших відкритих зібрань пар «зображення-текст», яке використовували для тренування низки популярних генеративних моделей. LAION тоді тимчасово зняла датасет з публічного доступу для чищення.
Спільна риса обох випадків — масштаб. Датасети для тренування сучасних LLM і мультимодальних моделей вимірюються мільярдами одиниць контенту, і жодна команда не може вручну переглянути кожен файл. Це створює структурний ризик: чим більший і «сиріший» датасет, тим вища ймовірність, що заборонений контент проскочить повз автоматичні фільтри.
Як індустрія зазвичай захищається від такого контенту?
Стандартний інструментарій — хеш-матчинг проти баз відомого CSAM-контенту, а не ручний перегляд. Найпоширеніші рішення:
- PhotoDNA від Microsoft — порівнює хеші зображень із базою вже ідентифікованого CSAM;
- списки хешів NCMEC (National Center for Missing & Exploited Children) — референсна база для індустрії;
- комерційні класифікатори на кшталт Thorn Safer чи Hive Moderation, які додатково намагаються ловити новий, ще не хешований контент.
Проблема в тому, що ці інструменти ловлять переважно вже відомий контент за хешем — новий чи модифікований матеріал вимагає класифікаторів, які значно дорожчі й повільніші при масштабуванні на мільярди файлів. Тому компанії часто покладаються на фільтрацію постачальника даних або на вибіркову перевірку, а не на повне сканування корпусу.
Що це означає для компаній, які тренують моделі на скрейпнутих даних?
За нашою оцінкою, цей позов, ймовірно, підштовхне індустрію до жорсткіших вимог щодо документування провенансу датасетів — подібно до того, як LAION-кейс 2023 року змусив частину індустрії впровадити обов'язковий хеш-скринінг перед публікацією великих відкритих корпусів.
Для AI-білдерів, які fine-tune-ять або дотренювують моделі на власних чи третіх сторонніх датасетах, практичний висновок такий: due diligence джерела даних — це вже не опційний крок з етики, а частина юридичного ризик-менеджменту. Перевірка через NCMEC hash-list чи аналогічний сервіс перед тренуванням коштує на порядки дешевше, ніж судовий позов і репутаційні наслідки після релізу моделі.
Висновок AiiN
Позов проти xAI — це не разовий інцидент однієї компанії, а симптом того, що індустрія масштабувала тренувальні датасети швидше, ніж інструменти для їхньої перевірки. Компанії, що досі покладаються на «чищення після факту» замість скринінгу на вході, ризикують стати наступним заголовком у подібному судовому позові.
FAQ: позов проти xAI щодо тренувальних даних Grok
Що таке CSAM і чому це стосується тренування AI-моделей?
CSAM (Child Sexual Abuse Material) — це матеріали із сексуальним насильством над дітьми, зберігання й поширення яких є кримінальним злочином у більшості юрисдикцій. Якщо такі матеріали потрапляють у тренувальний датасет моделі, компанія-розробник наражається на юридичну відповідальність незалежно від того, чи модель згодом здатна відтворювати подібний контент.
Чи це перший випадок виявлення CSAM у датасетах для AI в індустрії?
Ні. Найвідоміший попередній випадок — виявлення дослідниками Stanford Internet Observatory тисяч підозрюваних CSAM-посилань у датасеті LAION-5B у грудні 2023 року, після чого LAION тимчасово зняла датасет з публічного доступу.