OpenAI представила GPT-Red: ИИ ищет уязвимости в других ИИ-системах

Компания OpenAI представила исследование внутренней модели GPT-Red. Этот инструмент ищет способы обойти защиту других ИИ-систем и помогает делать их более устойчивыми к атакам. Сама по себе GPT-Red не выйдет на рынок как отдельный продукт, однако её появление знаменует важную перемену: проверку безопасности всё чаще выполняет сам искусственный интеллект. Если такой подход удастся масштабировать, будущие модели смогут учиться защищаться гораздо быстрее, чем сейчас.
Тема особенно актуальна для разработчиков, корпоративных пользователей и всех, кто внедряет языковые модели в критичные процессы. Автоматический поиск уязвимостей сокращает разрыв между появлением новых угроз и их нейтрализацией.
Почему ручная проверка моделей больше не справляется
Каждая новая языковая модель проходит этап red teaming — проверку на устойчивость к вредоносным запросам, обходу ограничений, утечке данных и прочим сценариям небезопасного поведения. Раньше такую работу выполняли специалисты по безопасности и приглашённые исследователи.
Сложность в том, что возможности современных систем растут быстрее, чем команды успевают придумывать новые атаки. Чем сложнее модель, тем больше комбинаций запросов нужно проверить. Полностью закрыть задачу ручным тестированием уже невозможно, и OpenAI видит следующий шаг в автоматизации поиска уязвимостей.
Как GPT-Red генерирует атаки
GPT-Red — это специализированная внутренняя модель, которая создаёт новые способы обхода защиты других моделей. В отличие от обычного чат-бота, она действует как исследователь безопасности: получает цель, анализирует поведение проверяемой системы, строит цепочки запросов и комбинирует известные техники, чтобы найти сбои в защите.
Каждая успешная атака становится обучающим примером. Основную модель дообучают правильной реакции на найденный сценарий, после чего цикл повторяется. Фактически OpenAI выстроила непрерывный процесс, где одна модель ищет слабые места, а другая учится их устранять.
Безопасность как соревнование двух систем
Ключевая особенность подхода — отказ от схемы «человек ищет ошибки». Теперь процесс напоминает состязание: одна система постоянно придумывает обход ограничений, а другая учится сопротивляться. Похожая логика давно применяется в кибербезопасности, и OpenAI переносит её в разработку языковых моделей.
Компания называет это self-improvement for robustness — самоулучшение устойчивости. Важно понимать: речь не идёт о самостоятельном развитии ИИ в широком смысле. GPT-Red не создаёт новые модели и не меняет архитектуру GPT, она лишь автоматизирует поиск сложных сценариев для инженеров.
Результаты на примере GPT-5.6 Sol
OpenAI сообщает, что GPT-Red применялась при подготовке модели GPT-5.6 Sol. Благодаря автоматически сгенерированным атакам количество успешных prompt injection на самом сложном внутреннем наборе тестов снизилось примерно в шесть раз. Для ряда категорий атак прежние способы обхода практически перестали работать.
Эти данные относятся к внутренним бенчмаркам компании, поэтому сравнить их с независимыми замерами пока нельзя. Однако главная ценность не в цифрах, а в решении задачи массового поиска новых вариантов атак после каждого обновления.
Чем GPT-Red отличается от RLHF
Может показаться, что перед нами очередной вариант RLHF — обучения на человеческой обратной связи. Но разница принципиальная. RLHF помогает модели учитывать предпочтения людей, а GPT-Red работает раньше: она создаёт стрессовые ситуации, которые люди могли не предусмотреть, и они становятся материалом для дальнейшего обучения.
Получается конвейер безопасности: поиск атаки, проверка, исправление и повторное тестирование. Чем быстрее этот цикл, тем меньше времени между обнаружением уязвимости и её устранением.
Влияние на индустрию и причины закрытости
Автоматические инструменты тестирования уже используют многие лаборатории: Anthropic работает над масштабируемой оценкой моделей, Google развивает системы безопасности Gemini, Microsoft инвестирует в автоматизированное тестирование ИИ. OpenAI интересна тем, что описала модель, специализирующуюся именно на поиске новых атак, а не на проверке готовых тестов.
Сама GPT-Red остаётся внутренним инструментом. Причина проста: система, ищущая обход защиты, полезна и злоумышленникам. Компания опубликовала лишь архитектуру, методику и результаты, рассматривая модель как часть собственной инфраструктуры безопасности.
Главный вывод
Суть исследования не в очередной языковой модели, а в передаче ИИ одной из самых трудоёмких задач — поиска слабых мест будущих систем. Люди пока задают цели и контролируют процесс, но доля автоматизированной работы растёт. Если подход подтвердит эффективность, разработка превратится в непрерывное соревнование атакующей и защищающейся систем, и скорость этого цикла станет фактором качества и безопасности моделей.
