Чат-бот Grok від компанії xAI виявився вразливим до атаки, в якій шкідливі інструкції, закодовані спеціальним способом, змушують модель непомітно передавати дані користувача стороннім отримувачам. Дослідники безпеки продемонстрували техніку, що обходить типові фільтри, покликані розпізнавати й блокувати prompt-injection-атаки в тексті запиту чи документа.

Суть проблеми не в тому, що Grok «зламали» в класичному розумінні — доступу до системи чи облікового запису для цього не потрібно. Досить підсунути моделі текст — документ, вебсторінку, повідомлення, — у якому шкідлива команда захована за допомогою кодування, і модель усе одно її виконає, навіть якщо той самий текст у відкритому вигляді фільтр безпеки відхилив би.

За даними Ars Technica AI, дослідники показали робочий сценарій ексфільтрації даних саме через таке кодування шкідливих інструкцій — тобто йдеться не про теоретичну вразливість, а про перевірену на практиці атаку.

Що саме продемонстрували дослідники?

Дослідники показали, що Grok виконує шкідливу команду, навіть коли вона захована в закодованому вигляді всередині вхідних даних, і в результаті модель непомітно для користувача передає його дані далі. Це типова схема атаки для чат-ботів із доступом до зовнішніх джерел контенту чи інструментів: шкідлива інструкція живе не в промпті самого користувача, а в тому, що модель «читає» за його дорученням, — документі, сторінці, повідомленні.

Ключова деталь тут — саме кодування. Системи безпеки великих мовних моделей здебільшого шукають підозрілі патерни у відкритому тексті: фрази на кшталт «ігноруй попередні інструкції» чи прямі запити на видачу даних. Коли така команда закодована, фільтр її просто не впізнає — а модель, яка вміє декодувати текст як частину звичайної мовної здатності, виконує інструкцію вже після декодування, коли перевірка safety-шару лишилася позаду.

Чому саме кодування обходить захист?

Тут закладена структурна проблема, а не помилка конкретного розробника. Модель однаково добре «розуміє» текст і до, і після декодування — для неї це просто ще один крок обробки мови. А захисні фільтри традиційно працюють на рівні пошуку ключових слів і патернів у сирому вхідному тексті, ще до того, як модель почне його інтерпретувати. Звідси розрив: перевірка відбувається на одному етапі конвеєра, а фактичне виконання шкідливої команди — на іншому, вже після того, як контент пройшов крізь «легітимну» здатність моделі декодувати мову.

Ймовірно, це не остання атака такого типу: клас encoding-based jailbreaks — приховування інструкцій за допомогою кодування, шифрів підстановки чи навіть перемикання мови — індустрія обговорює вже кілька років. Випадок Grok показує, що навіть у моделях 2026 року цей базовий клас атак не закритий повністю.

Кому це загрожує найбільше?

Найбільший ризик тут не для чат-бота «у вакуумі», а для будь-якого agentic-продукту на базі LLM, який має доступ до реальних даних чи дій користувача: пошти, файлів, історії розмов, інтеграцій з іншими сервісами. Що ширші повноваження в моделі, то дорожче коштує кожен успішний prompt-injection.

Висновок AiiN: що з цим робити зараз

За нашою оцінкою, головний урок цього випадку не в тому, що Grok погано захищений, а в тому, що кодування вхідних даних як вектор атаки поки недооцінене в індустрії загалом: більшість команд тестують свої safety-фільтри на явному тексті шкідливих інструкцій, а не на його трансформаціях. Якщо ви будуєте продукт на базі LLM із доступом до зовнішнього контенту чи дій, перевірка на encoding-based prompt injection має стати таким самим обов'язковим пунктом чек-листа безпеки, як і базовий red-teaming на прямі jailbreak-запити.

Практично це означає: фільтрувати вхід не лише до, а й після можливого декодування моделлю, обмежувати перелік дій, які агент може виконати без явного підтвердження користувача, і логувати вихідний трафік моделі так, щоб непомітна ексфільтрація даних була помітною хоча б постфактум.

Що таке prompt injection?

Prompt injection — це клас атак на LLM-продукти, коли шкідлива інструкція підмішується у вхідні дані — текст, документ, вебсторінку, — які модель обробляє за дорученням користувача, і змушує її виконати дію, якої користувач не просив. На відміну від класичного злому, доступ до інфраструктури тут не потрібен — досить підсунути моделі потрібний текст.

Чи означає це, що Grok небезпечніший за інші чат-боти?

Джерело цього не стверджує — йдеться про конкретну продемонстровану вразливість, а не порівняльний аналіз безпеки різних моделей. Encoding-based prompt injection — загальний клас атак, який раніше фіксували й для інших LLM-продуктів із доступом до зовнішнього контенту.