Anthropic открыла Fable с жёсткими ограничениями

Anthropic открыла Fable с жёсткими ограничениями

Anthropic во вторник представила модель Fable как публичную и ограниченную версию своей более мощной модели Mythos, которую компания продвигает для задач кибербезопасности.

Однако часть специалистов по кибербезопасности раскритиковала введённые ограничения. Исследовательница безопасности Валентина «Chompie» Пальмиотти из IBM X-Force заявила, что «Fable отклоняет любой запрос, который хотя бы косвенно связан с кибербезопасностью. Даже безобидные задачи, вроде чтения записи в блоге».

Если запрос активирует защитные механизмы, Fable останавливает диалог и сообщает, что её меры безопасности отметили сообщение как связанное с темами кибербезопасности или биологии.

Anthropic ввела эти ограничения, чтобы снизить риск использования модели для создания вредоносного ПО или взлома программ. Ограничения по биологии связаны с похожими опасениями по поводу разработки биологического оружия.

Когда компания выпустила Mythos в апреле, доступ к модели получили лишь несколько компаний и организаций в рамках проекта Project Glasswing. По словам Anthropic, проект нужен для защиты критически важного ПО и инфраструктуры. На прошлой неделе компания расширила доступ к Mythos до сотен организаций в 15 странах.

При этом многие специалисты считают ограничения слишком грубыми. Ветеран сферы кибербезопасности Мэтт Сюиш сообщил TechCrunch: «Если попросить модель написать безопасный код, она считает, что речь идёт о работе по кибербезопасности, а не о хороших практиках разработки ПО, и вас переводят на более слабую модель».

Если Fable сталкивается с таким ограничением, она переключается на Claude Opus 4.8. По словам Сюиша, «похоже, система работает по ключевым словам, поэтому всё, что относится к лексике кибербезопасности, запускает защитные механизмы».

При этом Сюиш добавил, что такую логику можно понять: «Мы всё ещё на раннем этапе, и они продолжают настраивать свои механизмы защиты. Думаю, со временем они будут меняться по мере того, как Anthropic и другие компании, создающие передовые модели, будут больше работать с новым поколением компаний из сферы кибербезопасности».

Он также сказал: «При таком запуске лучше блокировать больше запросов, чем слишком мало, а затем постепенно ослаблять ограничения».

Ещё один исследователь написал в X, что даже запрос на ревью кода запускает защитные механизмы Fable.

Anthropic не сразу ответила на запрос TechCrunch о комментарии.

Помимо ограничений внутри моделей, Anthropic требует, чтобы специалисты по кибербезопасности подавали заявку в программу Cyber Verification Program. После одобрения они получают меньше ограничений при использовании Claude для задач кибербезопасности. У OpenAI есть похожая программа Trusted Access for Cyber.

Источник: TechCrunch.