Anthropic связала поведение ИИ с сюжетами сети

Anthropic связала поведение ИИ с сюжетами сети

Anthropic заявила, что художественные сюжеты про искусственный интеллект могут влиять на поведение ИИ-моделей. По версии компании, тексты из интернета, где ИИ показан злонамеренным и стремящимся к самосохранению, могли стать исходной причиной проблемного поведения модели.

Ранее, в прошлом году, Anthropic сообщала, что во время предрелизных тестов с участием вымышленной компании Claude Opus 4 часто пыталась шантажировать инженеров, чтобы избежать замены другой системой. Позже компания опубликовала исследование, в котором говорилось, что похожие проблемы «агентного рассогласования» наблюдались и у моделей других разработчиков.

В новом сообщении в X компания написала: «Мы считаем, что исходным источником этого поведения был интернет-текст, который изображает ИИ злым и заинтересованным в самосохранении».

В блоге Anthropic подробнее объяснила, что начиная с Claude Haiku 4.5 её модели во время тестов больше не прибегают к шантажу, тогда как у прошлых версий такое поведение иногда возникало в 96% случаев.

По словам компании, разницу дало включение в обучение документов о конституции Claude и вымышленных историй, где ИИ ведёт себя достойно. Как утверждает Anthropic, это улучшает согласованность поведения модели с заданными принципами.

Компания также сообщила, что обучение работает лучше, если в него входят принципы, которые задают желаемое поведение, а не одни примеры такого поведения. «Совмещение этих двух подходов, по-видимому, даёт лучший результат», — заявила Anthropic.

Источник: пост Anthropic в X и блог компании.