
Модель GPT-5.6-Cyber от компании OpenAI продемонстрировала впечатляющие возможности в поиске программных ошибок, обнаружив две неизвестные ранее уязвимости в движке V8, который используется в браузере Google Chrome. Эти ошибки позволяют злоумышленникам выходить за пределы защищенной области памяти. Google уже приступил к устранению проблемы, которая получила идентификатор CVE-2026-15903 и была классифицирована как критическая.
Открытие критических уязвимостей в движке Chrome
В ходе тестирования специализированная модель была направлена на изучение движка JavaScript V8. Исследователи обнаружили цепочку из двух уязвимостей. Первая ошибка связана с некорректной работой компилятора при преобразовании значений в целые числа: из пустого значения получалось аномально большое число. При использовании этого значения в качестве индекса массива механизм проверки границ не срабатывал, что открывало возможность для чтения и записи в сторонних областях памяти.
Помимо Chrome, возможности ИИ были протестированы на других системах. В ходе работы были найдены следующие проблемы:
- не менее пяти уязвимостей в популярной мобильной ОС;
- три критические ошибки в распространенной базе данных;
- более четырехсот уязвимостей, позволяющих повысить привилегии в ядре одной из операционных систем.
Точные названия программных продуктов, в которых найдены ошибки, не разглашаются до завершения полной проверки экспертами.
Новая структура программы Daybreak: уровни Blue и Red
В рамках развития программы Daybreak, запущенной в мае для специалистов по кибербезопасности, OpenAI внедрила двухуровневую систему доступа. Это решение было вызвано жалобами исследователей на излишнюю «скромность» предыдущих моделей, которые часто отказывались выполнять запросы, связанные с анализом безопасности.
Уровень Blue: оборона и анализ
Уровень Blue предоставляет доступ к моделям общего назначения, включая GPT-5.6 Sol. Главная особенность — отсутствие системных фильтров, которые в обычном режиме блокируют запросы по соображениям безопасности. Этот уровень идеально подходит для:
- анализа инцидентов;
- аудита исходного кода;
- проверки патчей и ревизии кода на наличие угроз.
Уровень Red: наступательное тестирование
Уровень Red предназначен для глубоких исследований уязвимостей, разработки эксплойтов и авторизованного тестирования на проникновение. Специализированная модель GPT-5.6-Cyber показала феноменальные результаты: она успешно обрабатывает 95% сложных запросов, включая обход аутентификации и создание цепочек эксплойтов. Для сравнения, предыдущая версия справлялась лишь с 57,3% таких задач.
Эффективность и ограничения специализированной модели
Несмотря на высокую эффективность в поиске дыр в защите, GPT-5.6-Cyber не является универсально более мощной моделью. В некоторых задачах, таких как составление подробных отчетов по уязвимостям или оптимизация кода в тестах ExploitBench, обычная модель GPT-5.6 Sol показывает себя лучше, демонстрируя более детальное описание и более экономное использование вычислительных ресурсов (токенов).
Согласно внутренней шкале OpenAI, обе модели относятся к высокому уровню киберспособностей, но еще не достигли критического уровня.
Усиление мер безопасности и инструменты Codex
В связи с ростом рисков, OpenAI ужесточает правила работы с программой Daybreak. С 1 сентября доступ к личным аккаунтам будет возможен только с использованием аппаратных ключей безопасности. Также компания рекомендует переходить на режим автоматической проверки, где рискованные действия ИИ оцениваются до их фактического выполнения.
Параллельно с этим развивается инструмент Codex Security. Он доступен в трех форматах: плагин для ChatGPT, облачное сканирование репозиториев GitHub и консольная утилита. Статистика показывает масштаб использования инструмента: через сканер пройдено более 30 млн коммитов, что позволило исправить свыше 500 тысяч находок. Специалисты рекомендуют использовать ИИ-аудит зависимостей до обновления системы, чтобы минимизировать риски инцидентов.
Вывод: развитие специализированных ИИ-моделей для кибербезопасности значительно ускоряет процесс обнаружения уязвимостей, что требует от разработчиков и системных администраторов более оперативного реагирования и внедрения строгих протоколов проверки кода.
