OpenAI розформувала команду, яка з жовтня 2023 року відповідала за виявлення катастрофічних ризиків штучного інтелекту, а її обов'язки передала іншим підрозділам компанії. За даними The Decoder, йдеться про підрозділ, який компанія публічно позиціонувала як лінію оборони проти сценаріїв, коли AI-модель допомагає створити хімічну, біологічну чи кібернетичну зброю, або діє автономно всупереч намірам розробників.
Формально OpenAI не заявляє про повну відмову від оцінки катастрофічних ризиків — компанія подає це як реорганізацію, а не як згортання напряму роботи. Але для індустрії, яка й так уважно стежить за кожним кадровим рухом навколо безпеки в OpenAI, розформування профільного підрозділу — сигнал, який важко прочитати нейтрально.
Це вже другий випадок за два роки, коли команда всередині OpenAI, створена спеціально під довгострокові ризики штучного інтелекту, перестає існувати як окрема структура.
Що саме сталося, за даними The Decoder?
За даними The Decoder, OpenAI розпустила команду, чиєю прямою відповідальністю було відстежувати й прогнозувати катастрофічні ризики моделей компанії, а її функції розподілила між іншими групами всередині організації. Видання не наводить точної дати рішення чи імен людей, які втратили свої ролі, а сама OpenAI подає крок як реорганізацію, а не як згортання напряму роботи.
Яку команду розформували і чим вона займалась?
Ймовірно, йдеться про команду Preparedness — підрозділ, який OpenAI публічно представила у жовтні 2023 року саме як команду з готовності до катастрофічних ризиків. Preparedness Framework, який ця команда розробляла й застосовувала, оцінював кожну нову модель компанії за чотирма категоріями загроз:
- хімічна, біологічна, радіологічна та ядерна (CBRN) зброя
- кібербезпека й здатність моделі автоматизувати атаки
- переконання й маніпуляція людьми у великих масштабах
- автономна поведінка моделі поза контролем розробників
Для кожної категорії команда мала визначати поріг ризику, після якого випуск моделі мав призупинятися до впровадження додаткових запобіжників — так це правило формально закріплене у Preparedness Framework самої компанії.
Це вже траплялося в OpenAI раніше?
Так, і це головна причина, чому розформування команди Preparedness читається як частина довшої закономірності, а не поодинокий кадровий крок. У травні 2024 року OpenAI вже розпустила команду Superalignment, яку очолювали Ілля Суцкевер та Ян Лейке і яка мала готувати компанію до контролю над майбутніми надлюдськими AI-системами; обидва керівники залишили компанію, а Лейке публічно писав, що культура та процеси безпеки в компанії поступилися місцем блискучим продуктам. Тепер, за версією The Decoder, подібної долі зазнає команда, відповідальна вже не за гіпотетичний надінтелект, а за цілком практичні катастрофічні сценарії з поточними моделями компанії.
Що з цим робити AI-білдерам? Висновок AiiN
Наша теза: коли лабораторія переносить оцінку катастрофічних ризиків із виділеної незалежної команди в «інші групи», ризик-оцінка перестає бути контрольною функцією і стає частиною звичайного продуктового процесу — а це різні речі з різною ціною помилки. Незалежна команда безпеки має інституційний стимул сказати «ні» релізу; команда, вбудована в продуктовий підрозділ, підпорядкована дедлайнам того самого підрозділу.
AI-білдерам, які інтегрують моделі OpenAI у власні продукти, варто стежити не за самим фактом реорганізації, а за тим, чи компанія продовжить публікувати окремі оцінки катастрофічних ризиків для майбутніх релізів, як робила це раніше в system cards. Зникнення таких звітів стане набагато красномовнішим сигналом, ніж будь-яка кадрова заява.
Схожу проблему — коли контрольний механізм безпеки непомітно деградує — ми розбирали на прикладі Anthropic, яка рік не помічала збій фільтра біозброї в Claude. Там ішлося про технічний збій, а не про організаційну структуру, але висновок той самий: оцінка катастрофічних ризиків працює, лише поки хтось відповідає за неї персонально, а не «десь в іншій групі».
Що таке Preparedness Framework OpenAI?
Preparedness Framework — це документ і внутрішній процес, який OpenAI публічно представила в грудні 2023 року для оцінки та зниження катастрофічних ризиків власних моделей за чотирма категоріями: CBRN-зброя, кібербезпека, переконання та автономність моделі. Команда, яку тепер розформували, за задумом мала відповідати саме за застосування цього процесу перед випуском кожної нової моделі.
Чи означає це, що OpenAI відмовляється від оцінки катастрофічних ризиків?
Формально ні: компанія стверджує, що робота з катастрофічних ризиків триває, просто в межах інших команд, а не окремого підрозділу. Але, за нашою оцінкою, перенесення такої функції з незалежної структури у операційні групи послаблює саме той інституційний стимул, заради якого таку команду створювали ще в 2023 році.