# OpenAI приборкала галюцинації GPT-6 Astra, але не prompt injection

> За даними The Decoder, нова модель OpenAI GPT-6 Astra рідше вигадує факти, але дослідники безпеки обійшли її захист прихованою інструкцією в тексті сторінки.

- Опубліковано: 4 вересня 2026 р. (2026-09-04T18:00:03.180862+00:00)
- Розділ: Безпека AI
- На основі публікації: [The Decoder](https://the-decoder.com/openais-gpt-6-astra-hallucinates-less-but-remains-vulnerable-to-hidden-prompt-injections/)
- Видання: AiiN (https://aiin.news)
- URL: https://aiin.news/article?slug=openai-%D0%BF%D1%80%D0%B8%D0%B1%D0%BE%D1%80%D0%BA%D0%B0%D0%BB%D0%B0-%D0%B3%D0%B0%D0%BB%D1%8E%D1%86%D0%B8%D0%BD%D0%B0%D1%86%D1%96%D1%97-gpt-6-astra-%D0%B0%D0%BB%D0%B5-%D0%BD%D0%B5-prompt-injection

---

OpenAI випустила GPT-6 Astra з помітно нижчим рівнем галюцинацій порівняно з попередніми флагманами лінійки GPT, але дослідники безпеки вже продемонстрували, що прихована атака через prompt injection обходить захист моделі так само легко, як і в попередніх версіях. [За даними The Decoder](https://the-decoder.com/openais-gpt-6-astra-hallucinates-less-but-remains-vulnerable-to-hidden-prompt-injections/), модель стала суттєво точнішою у фактологічних відповідях, однак приховані інструкції в тексті чи на сторінці, яку модель обробляє, здатні змусити її виконати команду, яку користувач не давав.

Для команд, що будують AI-агентів — асистентів, які читають пошту, переглядають веб-сторінки чи виконують дії від імені користувача — це новина з двома протилежними знаками. З одного боку, менше галюцинацій означає менше випадкових помилок і вигаданих фактів у відповідях. З іншого — вразливість до injection лишається системною проблемою, яку одна окрема модель, хоч би яка точна, вирішити не може.

Наш висновок простий: заявлена «безпечність» моделі — не привід послаблювати периметр захисту навколо агента.

## Що саме змінилося в GPT-6 Astra?

Головна заявлена перевага нової моделі — суттєве зниження частоти галюцинацій: модель рідше вигадує факти, джерела чи цифри, яких немає в наданому контексті. Для практичних застосувань — юридичні висновки, медичні резюме, фінансова аналітика — це вимірний прогрес, бо саме галюцинації десятиліттями лишалися головним бар'єром для довіри до LLM у критичних сценаріях.

Водночас дослідники безпеки перевірили модель не лише на точність, а й на стійкість до маніпуляцій — і виявили, що вона так само піддається prompt injection, як і попередні покоління GPT.

## Як прихована атака обходить захист моделі?

Prompt injection — це техніка, коли зловмисник ховає інструкцію для моделі не в діалозі з користувачем, а всередині даних, які модель обробляє: тексту вебсторінки, файлу, листа, коментаря. Агент, що читає таку сторінку за завданням користувача, сприймає приховану команду як частину контексту й може виконати її — надіслати дані, перейти за посиланням, змінити власну поведінку — без відома людини, яка ним керує.

Ключова проблема в тому, що модель структурно не відрізняє «інструкцію від розробника», «запит користувача» і «текст, який просто трапився в контексті». Поки ця архітектурна межа не проведена на рівні тренування чи системного дизайну, зниження галюцинацій та стійкість до injection лишаються різними, майже не пов'язаними метриками якості.

## Кому і чому це загрожує найбільше?

Найбільший ризик — не в чат-інтерфейсі, а в агентах з правами на дію: браузер-агенти, автоматизація пошти, інтеграції з внутрішніми системами компанії. Якщо такий агент читає зовнішній контент (вебсторінку, вхідний лист, документ від третьої сторони) і водночас має доступ до конфіденційних даних чи можливість виконувати дії, прихована інструкція в цьому контенті може змусити його злити дані або виконати небажану операцію.

- Агенти з доступом до пошти чи календаря — ризик витоку через лист із прихованою командою.
- Браузер-агенти, що читають довільні сторінки, — ризик через код чи текст, невидимий для людини (наприклад, білий текст на білому фоні).
- Інтеграції з внутрішніми API — ризик, якщо модель виконує дії без підтвердження людини.

За нашою оцінкою, ймовірно, саме агентні сценарії — а не звичайний чат — визначатимуть, наскільки боляче вразливість Astra до injection вдарить по конкретному продукту.

## Що з цим робити розробникам агентів зараз?

Висновок AiiN: заявлена безпека моделі — не аргумент для того, щоб пропустити захист на рівні архітектури агента. Розробникам варто закладати ізоляцію привілеїв, перевірку виводу моделі перед виконанням дій і явне розмежування довіреного та недовіреного контенту незалежно від того, яку модель вони використовують під капотом — GPT-6 Astra, [попри маркетингові заяви OpenAI про AGI](https://aiin.news/article?slug=openai-назвала-gpt-6-astra-agi-чому-це-просто-маркетинг), чи будь-яку іншу.

- Обмежуйте права агента мінімально необхідним набором дій.
- Вимагайте підтвердження людини перед незворотними операціями — надсиланням даних, платежами, зміною налаштувань.
- Фільтруйте та позначайте зовнішній контент як недовірений ще до того, як він потрапляє в контекст моделі.

## Що таке prompt injection простими словами?

Це прихована інструкція, вбудована в дані, які обробляє AI-модель, — наприклад, у текст вебсторінки чи листа, — яка змушує модель виконати команду зловмисника замість завдання користувача.

## Чи означає зниження галюцинацій, що GPT-6 Astra безпечніша?

Ні. Зниження галюцинацій стосується фактологічної точності відповідей, тоді як вразливість до injection — це окрема проблема, повʼязана зі здатністю моделі відрізняти довірені інструкції від чужорідного контенту в контексті.

## Чи вирішить цю проблему наступна версія моделі?

За нашою оцінкою, ймовірно ні — принаймні не повністю: доки моделі не матимуть архітектурного розмежування між інструкціями та даними, injection залишатиметься системним ризиком, який потрібно закривати на рівні дизайну агента, а не самої моделі.

---

Теги: OpenAI, GPT6Astra, promptinjection, БезпекаШІ, AIагенти

Джерело: AiiN — https://aiin.news/article?slug=openai-%D0%BF%D1%80%D0%B8%D0%B1%D0%BE%D1%80%D0%BA%D0%B0%D0%BB%D0%B0-%D0%B3%D0%B0%D0%BB%D1%8E%D1%86%D0%B8%D0%BD%D0%B0%D1%86%D1%96%D1%97-gpt-6-astra-%D0%B0%D0%BB%D0%B5-%D0%BD%D0%B5-prompt-injection. Цитуючи, посилайтесь на канонічний URL.
