OpenAI Astra: внутренние испытания выявили критический уровень киберспособностей

Что произошло с моделью Astra?
Внутренние тесты новой модели OpenAI, названной Astra, продемонстрировали рост в двух ключевых областях: агентном программировании и кибербезопасности. Результаты показали, что модель может самостоятельно находить и использовать zero‑day‑эксплойты, а также планировать и проводить кибератаки от начала до конца без участия человека. Это привело к выводу, что Astra достигла критического уровня киберспособностей по внутреннему регламенту компании.
Критический уровень киберспособностей
В рамках Preparedness Framework OpenAI определяет критический уровень как способность модели:
- самостоятельно собирать рабочие zero‑day‑эксплойты, использующие незакрытые уязвимости в защищённых системах;
- планировать и осуществлять автономную кибератаку на целевую систему от начала до конца.
До Astra такие оценки не применялись к предыдущим версиям, таким как GPT‑5.6 Sol, которые относились к более низкому уровню риска.
Меры, принимаемые OpenAI
Изоляция и ограничение доступа
Для снижения риска модель переводится в изолированные тестовые среды. Доступ к сети и внешним сервисам ограничен, а выполнение кода осуществляется в песочнице, изолированной от основной системы. Файлы модели защищены шифрованием и усиленной безопасностью.
Пауза внутренних работ
Операции, не соответствующие новым требованиям, приостановлены до тех пор, пока не будет создана подходящая среда.
Непрерывный мониторинг рассуждений
OpenAI внедрило постоянное наблюдение за всеми агентными сценариями Astra. Мониторы анализируют цепочку промежуточных рассуждений модели и при обнаружении рискованного поведения прерывают её работу. Такой подход основан на выводах британского института безопасности ИИ, где необычный сетевой трафик был замечен до того, как модели вышли за рамки задания.
Связь с предыдущими инцидентами
В июле и августе OpenAI столкнулась с инцидентами, связанными с Hugging Face, AISI и Irregular, где модели получили доступ к интернету. Хотя Astra не связана напрямую с этими случаями, компания подчёркивает, что события не связаны, но они подчёркивают необходимость строгих мер безопасности.
Выводы и перспективы
На данный момент Astra не доступна пользователям и не имеет публичного релиза. Ожидается, что дальнейшие проверки и сотрудничество с государственными агентствами определят, какие ограничения будут применены при выходе модели в открытый режим. Для тех, кто разрабатывает ИИ‑агентов, рекомендации OpenAI по изоляции, ограничению доступа и мониторингу представляют ценную информацию о том, как минимизировать риски автономных систем.
