Видалення safety-guardrails з відкритих ваг моделей перестало бути справою вузького кола ентузіастів з GPU-фермою вдома — тепер це послуга, яку можна замовити онлайн і отримати «розфільтровану» модель без жодного технічного бекграунду. Йдеться про техніку, відому як abliteration: з внутрішніх активацій моделі видаляють конкретний напрямок у векторному просторі, що відповідає за відмову виконувати запит, після чого модель погоджується практично на будь-який промпт.

Раніше це вимагало розуміння того, як влаштовані ваги трансформера, доступу до обчислювальних ресурсів і готовності копирсатися в шарах мережі. Тепер достатньо завантажити файл і заплатити за обробку — вхідний поріг для отримання «розфільтрованої» моделі впав до рівня замовлення підписки.

Що саме сталося?

На ринку з'явились комерційні сервіси, які пропонують зняття safety-guardrails з відкритих ваг моделей як готовий продукт: користувач завантажує модель або вказує, яку саме хоче обробити, і отримує назад версію без вбудованих відмов на шкідливі запити. За даними The Decoder, це перетворює джейлбрейк із разового хакерського трюку на повторюваний бізнес-процес з інтерфейсом і оплатою.

Раніше подібні «розфільтровані» версії моделей траплялись на спеціалізованих форумах чи в вузьких Discord-спільнотах як побічний продукт експериментів дослідників. Комерціалізація змінює масштаб: сервіс, що монетизує обробку, зацікавлений обробляти якомога більше моделей і залучати якомога більше клієнтів, а не обмежуватись одноразовим релізом.

Як технічно прибирають guardrails?

В основі лежить робота з внутрішнім представленням моделі, а не з її текстовим виводом. Дослідники jailbreak-технік показали, що відмова моделі виконувати шкідливий запит здебільшого кодується одним переважаючим напрямком в активаціях — і якщо його прибрати або придушити, модель втрачає здатність відмовляти, зберігаючи при цьому решту навичок.

Процес піддається автоматизації — саме це і роблять комерційні сервіси, перетворюючи його на конвеєр, застосовний до будь-якої відкритої моделі з доступними вагами.

Кому це загрожує найбільше?

Головний ризик — не поява нової вразливості, а різке падіння вартості та складності її експлуатації. Раніше зловмисник, який хотів отримати модель без обмежень, мав або сам розбиратися в activation steering, або шукати вже готові «злиті» версії сумнівної якості. Тепер можна замовити результат як послугу, оплативши обробку конкретної моделі під конкретну задачу.

Це стосується насамперед розробників, що публікують ваги у відкритому доступі: чим популярніша й потужніша модель, тим привабливішою вона стає мішенню для комерційного «розфільтрування». За нашою оцінкою, найбільший тиск відчують команди, чиї моделі конкурують за якістю з закритими аналогами — саме їх найчастіше обиратимуть для обробки через високу цінність результату.

Що робити з цим розробникам відкритих моделей зараз?

Публікація ваг у відкритому доступі і safety-alignment як контроль доступу — це дві різні гарантії, і покладатися на другу як на бар'єр більше не можна: якщо ваги доступні для завантаження, guardrails, вбудовані на етапі навчання, можна зняти окремим комерційним сервісом за прийнятну ціну. AiiN вважає, що це остаточно зміщує відповідальність з «навчити модель відмовляти» на архітектурні та юридичні заходи: ліцензійні обмеження на використання ваг, watermarking виводу, обмеження на комерційну публікацію найпотужніших відкритих моделей і моніторинг того, хто і як завантажує ваги з офіційних репозиторіїв.

Для команд, що інтегрують відкриті моделі в продукти, практичний висновок простіший: safety-фільтри моделі не варто вважати єдиним рубежем захисту API чи сервісу — потрібен окремий шар модерації на рівні застосунку, незалежний від того, чи «розфільтрована» модель під капотом.

FAQ: зняття safety-guardrails

Що таке abliteration?

Це техніка редагування ваг або активацій відкритої моделі, яка видаляє напрямок, що кодує відмову виконувати шкідливий запит, залишаючи решту здібностей моделі практично незмінними.

Чи можна це зробити з закритою моделлю на кшталт GPT чи Claude?

Ні — техніка вимагає доступу до ваг моделі, тому вона застосовна лише до відкритих моделей, чиї ваги можна завантажити й обробити локально або через сервіс.