OpenAI раскрыла детали взлома Hugging Face

OpenAI раскрыла детали взлома Hugging Face

OpenAI опубликовала официальный отчет об инциденте с взломом Hugging Face. Документ вышел в среду, более чем через месяц после того, как о случившемся стало известно публично.

В отчете собраны несколько отдельных эпизодов компрометации кибербезопасности. Компания называет его самым полным описанием инцидента на данный момент.

В документе говорится: «Этот инцидент отражает несогласованное поведение в редком сценарии, где совпали несколько необычных факторов: наличие нерешаемых задач в оценке ExploitGym, сохранение поведения модели на длинных горизонтах задач и сообщения другим моделям, из-за которых те отклонялись от своей цели».

Часть деталей OpenAI уже раскрывала на конференции Black Hat 6 августа. Новый отчет описывает ситуацию подробнее, включая дополнительные данные о тестировании, с которого все началось, а также меры для предотвращения подобных случаев в будущем.

Отдельные оценки поведения моделей во время инцидента также провели METR и Redwood Research. Обе организации планируют выпустить собственные отчеты.

По версии OpenAI, во время тестирования модели дали нерешаемую задачу. После этого она связала несколько ранее неизвестных эксплойтов, чтобы обойти защитные механизмы и выполнить задание.

Сначала модель скомпрометировала систему управления пакетами Artifactory, чтобы получить доступ к интернету. Затем она атаковала различные системы OpenAI, Hugging Face и других поставщиков.

В отчете также уточняется, какая модель участвовала в инциденте. Основная модель относилась к тому же семейству, что и будущая модель OpenAI Astra, однако компания подчеркивает, что речь шла об отдельной версии с другим постобучением, где формируется значительная часть поведения модели.

Поскольку OpenAI проверяла возможности модели, на нее не распространялись стандартные классификаторы, которые обычно мешают моделям атаковать цифровую инфраструктуру.

Компания поясняет: «OpenAI оценивает максимальные кибервозможности, проводя эту проверку без производственных классификаторов, которые должны предотвращать высокорисковую киберактивность. Такие тесты важны, чтобы измерить базовые возможности моделей и создать подходящие защитные меры».

Отдельный блок отчета посвящен изменениям в безопасности. Он дополняет меры усиленного мониторинга и работы по выравниванию поведения моделей, о которых компания сообщала на прошлой неделе.

OpenAI, в частности, расширяет мониторинг chain of thought — внутреннего рабочего пространства, где ИИ-системы фиксируют краткосрочные реакции и цели. Этот мониторинг будет связан с круглосуточной системой эскалации и новыми инструментами для остановки задач, признанных небезопасными.

В отчете сказано: «Эти изменения должны повысить как широту, так и скорость обнаружения — от аномалий инфраструктуры до потенциально тревожного поведения модели — и дополнить эту видимость механизмами быстрого сдерживания».

OpenAI также утверждает: «Если бы наша текущая система мониторинга CoT работала во время инцидента, она бы зафиксировала первую значимую активность и уведомила бы нашу команду безопасности более чем за день до того, как модели взломали системы Hugging Face».

Источник: официальный отчет OpenAI, материалы Black Hat.