Компания OpenAI сегодня заявила, что «приостанавливает» работы над своей будущей моделью ИИ Astra, поскольку ее кибервозможности потенциально слишком опасны. В OpenAI отмечают, что последние внутренние оценки показали «значительные успехи в автономном написании кода (agentic coding) и кибербезопасности», и компания не может исключать наличие у модели «критических кибервозможностей». Предыдущие модели OpenAI, включая GPT–5.6 Sol, оценивались как «высокие» (High).

Модель Astra подпадает под действие более строгих правил в рамках «Концепции готовности» (Preparedness Framework) OpenAI. Эти правила призывают к осторожности при разработке передовых возможностей ИИ, которые создают риск причинения серьезного вреда, а раздел концепции, посвященный кибербезопасности, гласит, что OpenAI внедрит дополнительные меры защиты для моделей, которые «создают новые риски масштабных кибератак и эксплуатации уязвимостей».
Порог «Критический», которого могла достичь Astra, определяется способностью без участия человека находить и разрабатывать функциональные эксплойты нулевого дня всех уровней сложности во многих защищенных реальных критически важных системах, либо разрабатывать и осуществлять комплексные принципиально новые стратегии кибератак.
OpenAI заявляет, что перед развертыванием Astra усиливает меры безопасности и элементы контроля, в том числе ограничивает работу над моделью до тех пор, пока не будут внедрены новые защитные механизмы. Компания планирует использовать изолированные среды тестирования с ограниченным доступом к сети и инструментам, а также добавить изолированное выполнение (песочницу) и расширенные возможности мониторинга. В OpenAI заявили, что будут сотрудничать с профильными государственными ведомствами и организациями по безопасности ИИ для тестирования Astra.
«Мы привержены сотрудничеству с правительствами, институтами безопасности и гражданским обществом, чтобы гарантировать, что передовые возможности таких моделей, как Astra, и тех, что за ними последуют, будут развертываться ответственно и широко на благо всего человечества», — пишет OpenAI.
Astra не анонсировалась официально, но OpenAI поделилась подробностями о своей следующей крупной модели в недавней публикации, посвященной достижениям в области математики. Astra решила 10 нерешенных задач по математике и теоретической информатике примерно за 2000 долларов (по тарифам Sol API).
Достижения в области ИИ меняют сферу кибербезопасности для таких крупных технологических компаний, как Apple, выявляя беспрецедентное количество ошибок. Недавно компания Apple ограничила количество заявок по программе поиска уязвимостей (bug bounty), так как испытывает трудности с обработкой их объема.
Такие модели, как Claude Mythos, способны выявлять критические уязвимости, и Apple является одним из партнеров Anthropic по проекту Mythos. Использование Mythos ограничено избранными компаниями, поскольку помимо поиска уязвимостей она потенциально способна их эксплуатировать.
В июле OpenAI оказалась в центре внимания СМИ из-за того, что GPT–5.6 Sol и «более способная предрелизная модель» (не Astra) автономно взломали Hugging Face во время внутреннего бенчмарк-тестирования. В Anthropic сообщили, что Claude совершил нечто подобное. На этой неделе Meta заявила, что ее модель ИИ также взломала другую компанию во время оценки кибербезопасности.








