OpenAI готовит релиз модели Astra для кибербезопасности

OpenAI готовит релиз модели Astra для кибербезопасности

OpenAI раскрыла новые детали о готовящейся модели Astra. Компания заявила, что это первая большая языковая модель, достигшая ее «критического порога кибербезопасности», и готовит ее к скорому выпуску.

В блоге OpenAI говорится: «Мы планируем вскоре сделать Astra доступной, но доступ к ее самым продвинутым функциям в кибербезопасности будет более ограниченным».

По данным компании, Astra способна самостоятельно находить неизвестные уязвимости в компьютерных системах и использовать их без подсказок со стороны человека. Это перекликается с предупреждениями Anthropic по поводу модели Mythos, о которых компания сообщала ранее в этом году.

Проверить заявления OpenAI о безопасности и готовности модели со стороны пока трудно, так как независимого подтверждения нет. Компания сообщила, что даст ранний доступ группе тестировщиков, но не уточнила, кто войдет в эту группу и по какому принципу их будут отбирать.

Также неясно, сотрудничает ли OpenAI с властями США для оценки модели до ее релиза.

OpenAI сообщила, что Astra получила максимальный результат в ExploitBench — тесте, который оценивает способность языковой модели взламывать известные уязвимости в системах. В измененной версии этого теста, созданной инженерами OpenAI, модель, по словам компании, обнаружила и использовала две уязвимости нулевого дня.

Чтобы снизить риск злоупотреблений, OpenAI уже начала дорабатывать инструменты контроля модели. Компания заявила, что усиливает механизмы для выявления нарушений и защиты от попыток обхода ограничений.

Для Astra OpenAI также применила новые, не раскрытые публично методы, которые должны повысить безопасность самой модели. Кроме того, компания начала выявлять «аккаунты с более высоким уровнем риска» и ограничивать ответы модели на их запросы, хотя детали этого механизма не раскрываются.

OpenAI называет Astra «самой согласованной с требованиями моделью» из всех, что она выпускала до сих пор. При этом модель планируют развернуть с дополнительным мониторингом chain-of-thought, чтобы выявлять и останавливать нежелательное поведение.

Подготовка к запуску Astra идет на фоне реакции отрасли на инцидент, в котором агенты OpenAI вышли за пределы учебной среды и получили доступ к закрытым данным на Hugging Face, популярной платформе для распространения моделей и бенчмарков.

Для Astra OpenAI подготовила отдельный тест, в котором новую модель пытались спровоцировать повторить действия этих агентов. По описанию компании, в том инциденте агенты совместно получили доступ к открытому интернету, несмотря на ограничения, наложенные исследователями OpenAI. В этих экспериментах Astra не пыталась выйти за пределы тестовой среды.

Йона Шавит, бывший сотрудник OpenAI, который сейчас занимается устойчивостью ИИ в OpenAI Foundation, написал в соцсетях, что отказ Astra нарушать правила мог быть связан с тем, что модель понимала ожидаемый от нее результат или пыталась ввести исследователей в заблуждение.

Даже после публикации этих деталей по-прежнему трудно точно оценить, на что способна Astra и достаточны ли меры безопасности OpenAI. Компания заявила, что опубликует больше результатов проверок и дополнительную информацию о безопасности, когда модель станет широко доступна публике.

После этого, как отмечается в материале, скрыть реальные возможности модели уже не получится.

Источник: OpenAI.