Anthropic автоматизировала выравнивание ИИ

Anthropic автоматизировала выравнивание ИИ

Anthropic опубликовала научную работу Automated Researchers Can Reliably Mitigate Alignment Failures, в которой показала ранний пример автоматизации исследований по выравниванию ИИ. В статье говорится, что ИИ-системы смогли улучшить результаты модели на наборе тестов по нежелательному поведению без ухудшения общей производительности.

По данным Anthropic, системе дали 10 бенчмарков, связанных с конкретными сбоями выравнивания. Автоматизированные исследовательские агенты улучшили показатели по каждому из них и при этом не снизили общие результаты модели.

Работу возглавил участник fellows program Anthropic Чэнь Юэх-Хань. Описанный подход повторяет многие шаги обычного исследовательского процесса: система изучает доступные публикации, предлагает метод, а затем обучает модель этим методом в течение 30 минут за итерацию.

Далее бенчмарк постепенно усложняется в нескольких циклах. Удачные методы сохраняются, а неэффективные отбрасываются, что позволяет системе быстро работать в крупном масштабе.

В статье сказано: «В целом эти результаты дают ранние свидетельства того, что автоматизированное постобучение для выравнивания может стать практическим инструментом уже в ближайшей перспективе».

Авторы рассматривают работу как шаг к рекурсивному самоулучшению, которое многие считают следующим важным этапом в развитии ИИ. Логика проста: если модели смогут улучшать собственные процедуры выравнивания, со временем они могут начать улучшать и более широкий набор практик обучения.

В статье прямо сравнивается Automated Alignment Researcher, или AAR, с исследователями-людьми. Авторы пишут: «Лучший метод AAR в среднем превосходит предложения опытных людей в течение шести часов. Направления исследований под руководством человека не приводят к более сильным результатам».

Anthropic также привела сравнение затрат. В статье сказано: «AAR стоит примерно 4 доллара в час на API-инференс против 150 долларов в час, которые мы платим нашим исследователям-людям».

При этом авторы отмечают и ограничения подхода. Система работает лишь в той мере, в какой используемые бенчмарки действительно отражают цели выравнивания. Кроме того, остаётся большой объём работы по созданию, поддержке и расширению самих тестов и исследовательской базы, на которую опираются автоматизированные агенты.

Источник: paper Anthropic, “Automated Researchers Can Reliably Mitigate Alignment Failures”.