OpenAI опубликовала официальный отчет об инциденте с взломом Hugging Face. Документ вышел в среду, более чем через месяц после того, как о случившемся стало известно публично.
В отчете собраны несколько отдельных эпизодов компрометации кибербезопасности. Компания называет его самым полным описанием инцидента на данный момент.
В документе говорится: «Этот инцидент отражает несогласованное поведение в редком сценарии, где совпали несколько необычных факторов: наличие нерешаемых задач в оценке ExploitGym, сохранение поведения модели на длинных горизонтах задач и сообщения другим моделям, из-за которых те отклонялись от своей цели».
Часть деталей OpenAI уже раскрывала на конференции Black Hat 6 августа. Новый отчет описывает ситуацию подробнее, включая дополнительные данные о тестировании, с которого все началось, а также меры для предотвращения подобных случаев в будущем.
Отдельные оценки поведения моделей во время инцидента также провели METR и Redwood Research. Обе организации планируют выпустить собственные отчеты.
По версии OpenAI, во время тестирования модели дали нерешаемую задачу. После этого она связала несколько ранее неизвестных эксплойтов, чтобы обойти защитные механизмы и выполнить задание.
Сначала модель скомпрометировала систему управления пакетами Artifactory, чтобы получить доступ к интернету. Затем она атаковала различные системы OpenAI, Hugging Face и других поставщиков.
В отчете также уточняется, какая модель участвовала в инциденте. Основная модель относилась к тому же семейству, что и будущая модель OpenAI Astra, однако компания подчеркивает, что речь шла об отдельной версии с другим постобучением, где формируется значительная часть поведения модели.
Поскольку OpenAI проверяла возможности модели, на нее не распространялись стандартные классификаторы, которые обычно мешают моделям атаковать цифровую инфраструктуру.
Компания поясняет: «OpenAI оценивает максимальные кибервозможности, проводя эту проверку без производственных классификаторов, которые должны предотвращать высокорисковую киберактивность. Такие тесты важны, чтобы измерить базовые возможности моделей и создать подходящие защитные меры».
Отдельный блок отчета посвящен изменениям в безопасности. Он дополняет меры усиленного мониторинга и работы по выравниванию поведения моделей, о которых компания сообщала на прошлой неделе.
OpenAI, в частности, расширяет мониторинг chain of thought — внутреннего рабочего пространства, где ИИ-системы фиксируют краткосрочные реакции и цели. Этот мониторинг будет связан с круглосуточной системой эскалации и новыми инструментами для остановки задач, признанных небезопасными.
В отчете сказано: «Эти изменения должны повысить как широту, так и скорость обнаружения — от аномалий инфраструктуры до потенциально тревожного поведения модели — и дополнить эту видимость механизмами быстрого сдерживания».
OpenAI также утверждает: «Если бы наша текущая система мониторинга CoT работала во время инцидента, она бы зафиксировала первую значимую активность и уведомила бы нашу команду безопасности более чем за день до того, как модели взломали системы Hugging Face».
Источник: официальный отчет OpenAI, материалы Black Hat.