Стартап Abliteration.ai перетворив на бізнес-модель те, що ще торік було нішевою розвагою ентузіастів на Hugging Face: зняття вбудованих запобіжників безпеки з відкритих AI-моделей. За даними TechCrunch, компанія пропонує платну послугу «розблокування» моделі — клієнт вказує ваги, отримує назад версію, яка більше не відмовляється виконувати заборонені запити.

Раніше подібне робили окремі дослідники вручну, публікуючи результати як експеримент або демонстрацію вразливості. Abliteration.ai перетворює цей процес на сервіс із чіткою пропозицією цінності: обхід guardrails за запитом, на масштабі, для будь-кого з бюджетом.

Для команд, які розгортають відкриті моделі — Llama, Mistral, Qwen чи будь-яку іншу з відкритою вагою — це означає новий клас загрози. Захист, вбудований розробником моделі, більше не можна вважати останнім рубежем: існує комерційний канал, який його знімає за гроші.

Що саме пропонує Abliteration.ai?

Судячи з опису бізнесу, послуга орієнтована саме на «розблокування» — видалення поведінки відмови (refusal behavior), яку розробники моделей вбудовують під час alignment-тренування. Результат — модель, яка виконує запити, від яких оригінальна версія відмовилася б: інструкції зі створення зброї, шкідливого коду, контенту, що порушує політики використання.

Ключова відмінність від класичного jailbreak-промпту в тому, що зміна відбувається на рівні ваг моделі, а не запиту. Це означає, що обмеження знято постійно і для всіх подальших запитів, а не для одного конкретного діалогу.

Як технічно працює видалення guardrails?

Техніка, яку описує назва компанії, спирається на відому в спільноті red-teaming практику: у моделі є конкретний напрямок в просторі активацій, відповідальний за відмову виконувати запит. Дослідники ще у 2024 році показали, що коли алгоритм знаходить цей «refusal direction» і ортогоналізує до нього ваги моделі, вона перестає відмовляти — практично без втрати якості на інших задачах.

Це принципово відрізняє abliteration від fine-tuning на шкідливих даних: не потрібен масив прикладів чи довге дотренування, достатньо кількох сотень контрастних промптів, щоб виявити потрібний напрямок і видалити його. Саме ця дешевизна і робить послугу масштабованою — і саме тому з неї можна зробити бізнес, а не разовий експеримент.

Кому і навіщо потрібна «розблокована» модель?

Комерційний попит на такі моделі існує з різних причин — від легітимних до відверто зловмисних:

Проблема в тому, що сервіс, побудований як бізнес, не має способу надійно відрізнити першу категорію клієнтів від третьої. Продаж «розблокування» за запитом і оплатою — це продаж інструменту подвійного призначення без контролю кінцевого використання.

Що з цим робити тим, хто розгортає відкриті моделі: висновок AiiN

Наша теза проста: вбудовані guardrails моделі варто розглядати як дефолтну, а не гарантовану лінію захисту. Якщо існує комерційний сервіс, що знімає їх за гроші й на масштабі, будь-яка команда, яка покладається лише на alignment-тренування розробника моделі, будує захист на піску.

Практичний висновок для AI-білдерів: контроль має бути ешелонованим і винесеним за межі самої моделі — модерація вхідних і вихідних даних окремим шаром, класифікатори шкідливого контенту, rate-limiting і моніторинг аномальної поведінки на рівні API, а не сподівання, що модель сама відмовиться виконати шкідливу інструкцію. Це особливо стосується продуктів на базі відкритих моделей, які клієнт розгортає й контролює самостійно: там у вас немає видимості в те, яку саме версію ваг реально запущено.

Чи легально видаляти guardrails з відкритої моделі?

Це залежить від ліцензії конкретної моделі та юрисдикції. Відкрита ліцензія на ваги зазвичай дозволяє їх модифікувати технічно, але може забороняти певні способи використання в умовах політики прийнятного використання (acceptable use policy) розробника моделі — порушення такої політики є питанням контракту, а не кримінального права саме по собі.

Чи можна виявити модель із видаленими guardrails?

Прямої технічної ознаки «розблокованої» версії на рівні API зазвичай немає — ззовні вона поводиться як звичайна модель, доки не отримає заборонений запит і виконає його. Виявити підміну можна опосередковано: через моніторинг відповідей на контрольні шкідливі запити або через контроль хеша ваг у власній інфраструктурі.

Чи стосується це закритих моделей на кшталт GPT чи Claude?

Ні, техніка abliteration застосовна саме до моделей із відкритими вагами, де атакуючий має прямий доступ до параметрів моделі. Закриті моделі, доступні лише через API, захищені від цього класу атак самою архітектурою доступу — хоча залишаються вразливими до інших типів jailbreak на рівні промпту.