OpenAI зупинила кампанію з витягу прихованих міркувань моделей і до 28 липня заблокувала мережу з понад 15 000 акаунтів. Пік припав на 24–25 липня: 16 000 запитів від понад 4 000 користувачів за типовим патерном витягу.
Приховані кроки містять інформацію, яку модель свідомо не показує у відповіді, і можуть допомогти відтворити її можливості. Тому повні ланцюжки міркувань і стають ціллю зловмисників. За даними The Decoder OpenAI називає цю схему adversarial distillation і очікує, що спроби стануть складнішими в міру вдосконалення провідних моделей.
Як витягували приховані міркування?
За даними OpenAI, зловмисники копіювали зашифроване міркування з однієї розмови, а потім просили модель в іншій розмові розшифрувати його. Цю схему раніше описав у своїй статті дослідник Joachim Schaeffer разом із командою. Провайдери повертають клієнту міркування лише як зашифровані пакети, які клієнт передає разом із наступними запитами, а ключі шифрування виявилися спільними. Тому пакети можна переносити між сесіями, між користувачами і навіть між різними моделями одного провайдера.
Дешева модель тієї ж сім’ї в такій схемі працює як оракул розшифрування і друкує приховані думки сильнішої моделі дослівно. OpenAI підтвердила, що описані дослідниками шляхи атаки були реальними, і зазначила, що їхні дані допомогли швидше розгорнути контрзаходи.
Компанія заблокувала шахрайські акаунти, посилила процедуру реєстрації та закрила лазівку, яка дозволяла переносити й читати зашифровані міркування, що не належали користувачеві. Тепер OpenAI також перевіряє потоковий вивід і затримує його, якщо він може розкрити міркування.
Чому витяг пов’язують із Moonshot AI?
OpenAI пов’язує ядро активності з людьми, пов’язаними з Moonshot AI — компанією, яка розробляє мовну модель Kimi. Активність почалася 1 липня з малих обсягів і різко зросла наприкінці місяця. Компанія зауважує, що не всі спостеріжені учасники обов’язково ведуть до одного джерела. У примітці OpenAI уточнила, що йшлося про спроби витягу, а не про гарантовані успіхи.
Схожі спроби нещодавно повідомила й Anthropic — щодо китайських компаній.
Чому закритий API не спинив крадіжку?
Microsoft Azure зводить нанівець закриття власного API, бо продає доступ до тих самих моделей зі слабшим захистом. 13 вересня команда Schaeffer перевірила атаку повторно: власні API OpenAI і Anthropic її блокували, а на Microsoft Azure вона спрацювала з першої спроби й віддала міркування дослівно. На хмарі злам працював проти кожної протестованої моделі OpenAI, зокрема OpenAI GPT-6 Astra, і проти моделей Anthropic аж до Sonnet 5.
Розробник Can Bölük показав публічно ще простіший метод — без криптографії. Модель отримує віртуальний нотатник як інструмент і записує туди свої міркування, а користувач читає записане. Прийом спрацював на кожній моделі OpenAI, а також на Opus 4.8 і Sonnet 5. Не віддали міркування лише Opus 5, Fable 5 і Fable 5.1, а сам вивід був близьким до результату атаки розшифруванням.
Дослідники називають виправлення фрагментарними й поверхневими: багато з них тримаються на крихкому зіставленні конкретних шаблонів запитів, а частина дійшла до хмарних платформ лише через кілька днів. GPT-6 Astra вийшла на сторонніх платформах без жодного з цих захистів, а захист кінцевої точки Microsoft Azure з’явився лише 27 вересня. Для моделей Anthropic відтворення витягу на Microsoft Azure припинилося з 28 вересня. OpenAI визнає, що моделі в партнерів потребують такого ж захисту, як власний сервіс, і ділиться висновками через Frontier Model Forum та державні канали.
Schaeffer наголошує, що патчі мають покривати і всі типи атак, і всі хмари, де розміщені моделі: інакше зловмисники просто обиратимуть найслабший маршрут. У статті дослідники пропонують і жорсткіший захід — не допускати, щоб хмарні провайдери без рівнозначного захисту взагалі обслуговували моделі міркувань, бо відкриті лазівки дають змогу обходити експортний контроль на рівні API.
Що робити зараз
Лазівку закриває лише власник, у якого однаковий захист стоїть і на власному API, і в хмарі. Нижче — кроки, які OpenAI вже запровадив.
- Відстежуйте шаблон витягу: сплески запитів, у яких зашифровані пакети переносять між сесіями та користувачами, як у спостереженому сплеску 24–25 липня на 16 000 запитів.
- Заборіть читання чужих зашифрованих пакетів і фільтруйте потоковий вивід, здатний розкрити міркування.
- Перевіряйте рівень захисту перед релізом на Microsoft Azure чи іншій хмарі, зокрема обмежте інструменти-нотатники, у які модель записує свої міркування.
- Тримайте зв’язок із галузевими каналами на кшталт Frontier Model Forum і готуйтеся до складніших спроб дистиляції.








