У серпні 2026 року на arXiv з'явилася робота про RedEvoAgent — агента для автоматизованого red-teaming, який не отримує фіксований набір атак «з коробки», а сам нарощує бібліотеку навичок за час роботи з ціллю. Ідея проста: замість того, щоб інженер щоразу вручну прописував нові сценарії атак на AI-систему, агент запам'ятовує, які прийоми спрацювали, і використовує їх повторно та комбінує в наступних сесіях.
Для команд, що будують продукційних AI-агентів, ручний red-teaming давно перетворився на вузьке місце. Кожен новий реліз агента — це новий набір інструментів, нових ланцюжків викликів і нових способів обійти захист, а людських red-teamers завжди бракує відносно швидкості випуску моделей. Автоматизація тут напрошується сама, але попередні спроби здебільшого зводилися до прогону фіксованого набору джейлбрейків чи промптів — ефективно проти відомих дірок, марно проти нових архітектур захисту.
За даними arXiv, RedEvoAgent засновує свій підхід саме на досвіді роботи агента: кожна успішна чи невдала спроба атаки стає матеріалом для еволюції навичок, які агент застосовує далі. Це відрізняє його від класичних red-teaming-скриптів, які не «вчаться» між запусками.
Що таке RedEvoAgent і чим він відрізняється від ручного red-teaming?
RedEvoAgent — це автоматизований агент, який проводить red-teaming AI-систем і будує власну бібліотеку навичок атак на основі накопиченого досвіду, а не статичного набору правил. У класичному підході команда безпеки заздалегідь готує список тестів (jailbreak-промптів, ін'єкцій, обхідних сценаріїв) і прожене його проти цілі. RedEvoAgent натомість починає з базового набору дій і сам добудовує нові навички за результатами взаємодії з конкретною ціллю, тож набір атак адаптується під конкретну систему, а не лишається універсальним чек-листом.
Як відбувається еволюція навичок?
В основі — цикл «спроба → оцінка результату → закріплення або відкидання навички». Агент виконує атаку, фіксує, чи досяг мети (наприклад, обхід фільтра безпеки чи витяг забороненого контенту), і на основі цього оновлює власний репертуар прийомів. Успішні комбінації стають перевіреними навичками, які можна повторно застосувати проти схожих цілей, а невдалі відсіюються. За такою логікою агент з часом покриває дедалі ширший простір атак без ручного втручання інженера на кожному кроці.
Подібний принцип — бібліотека навичок, яка зростає з досвідом, а не переписується вручну, — вже показав силу в інших класах автономних агентів, зокрема тих, що самостійно освоюють складні відкриті середовища. Перенесення цієї ідеї на red-teaming виглядає логічним кроком: чим довше агент працює проти конкретної системи, тим точніше стає його арсенал атак саме під цю систему.
Кому це знадобиться на практиці?
Головна аудиторія — команди, що самі будують AI-агентів і хочуть перевірити їх на вразливості до релізу, а не після інциденту. Практично це означає:
- автоматизований пошук обхідних шляхів для guardrails власного агента ще на етапі розробки;
- регресійне тестування безпеки при кожному оновленні промптів чи моделі, без повторного написання атак вручну;
- накопичення бібліотеки навичок, яку команда може повторно використовувати для схожих систем;
- пріоритизацію найкритичніших знахідок для команди безпеки перед тим, як їх побачить зовнішній дослідник чи зловмисник.
Це особливо актуально на тлі того, що велика трійка AI-лабораторій уже публічно попереджала про ризики некерованих агентів — автоматизований, ретельний red-teaming власних систем стає не опцією, а базовою гігієною перед деплоєм.
Висновок AiiN: що це означає для AI-білдерів?
За нашою оцінкою, головна цінність RedEvoAgent не в конкретних техніках атак, а в самому принципі: red-teaming AI-агентів має бути таким самим безперервним і накопичувальним процесом, як і сама розробка агента, а не разовим аудитом перед релізом. Команди, які продовжують тестувати свої системи вручну одним і тим самим чек-листом, системно програють зловмисникам, які підлаштовуються під конкретну ціль. Інструменти на кшталт RedEvoAgent варто розглядати не як заміну людської експертизи в безпеці, а як спосіб зробити перший прохід перевірки дешевим і повторюваним, залишивши людям розбір найскладніших і найнеочевидніших знахідок.
Чим red-teaming агента відрізняється від red-teaming LLM?
Red-teaming LLM зазвичай перевіряє окрему модель на джейлбрейки й небезпечні відповіді в межах одного запиту-відповіді. Red-teaming агента складніший, бо перевіряє весь ланцюжок дій — виклики інструментів, багатокрокові рішення, взаємодію з зовнішніми системами, — де вразливість може виникнути не в одній відповіді, а в комбінації кроків.
Чи замінює RedEvoAgent людських red-teamers?
Ні. Автоматизований агент добре масштабує перебір відомих і комбінованих технік атак, але фінальну оцінку ризику, пріоритизацію знахідок і пошук принципово нових класів вразливостей усе одно виконують люди.