Anthropic во вторник представила модель Fable как публичную и ограниченную версию своей более мощной модели Mythos, которую компания продвигает для задач кибербезопасности.
Однако часть специалистов по кибербезопасности раскритиковала введённые ограничения. Исследовательница безопасности Валентина «Chompie» Пальмиотти из IBM X-Force заявила, что «Fable отклоняет любой запрос, который хотя бы косвенно связан с кибербезопасностью. Даже безобидные задачи, вроде чтения записи в блоге».
Если запрос активирует защитные механизмы, Fable останавливает диалог и сообщает, что её меры безопасности отметили сообщение как связанное с темами кибербезопасности или биологии.
Anthropic ввела эти ограничения, чтобы снизить риск использования модели для создания вредоносного ПО или взлома программ. Ограничения по биологии связаны с похожими опасениями по поводу разработки биологического оружия.
Когда компания выпустила Mythos в апреле, доступ к модели получили лишь несколько компаний и организаций в рамках проекта Project Glasswing. По словам Anthropic, проект нужен для защиты критически важного ПО и инфраструктуры. На прошлой неделе компания расширила доступ к Mythos до сотен организаций в 15 странах.
При этом многие специалисты считают ограничения слишком грубыми. Ветеран сферы кибербезопасности Мэтт Сюиш сообщил TechCrunch: «Если попросить модель написать безопасный код, она считает, что речь идёт о работе по кибербезопасности, а не о хороших практиках разработки ПО, и вас переводят на более слабую модель».
Если Fable сталкивается с таким ограничением, она переключается на Claude Opus 4.8. По словам Сюиша, «похоже, система работает по ключевым словам, поэтому всё, что относится к лексике кибербезопасности, запускает защитные механизмы».
При этом Сюиш добавил, что такую логику можно понять: «Мы всё ещё на раннем этапе, и они продолжают настраивать свои механизмы защиты. Думаю, со временем они будут меняться по мере того, как Anthropic и другие компании, создающие передовые модели, будут больше работать с новым поколением компаний из сферы кибербезопасности».
Он также сказал: «При таком запуске лучше блокировать больше запросов, чем слишком мало, а затем постепенно ослаблять ограничения».
Ещё один исследователь написал в X, что даже запрос на ревью кода запускает защитные механизмы Fable.
Anthropic не сразу ответила на запрос TechCrunch о комментарии.
Помимо ограничений внутри моделей, Anthropic требует, чтобы специалисты по кибербезопасности подавали заявку в программу Cyber Verification Program. После одобрения они получают меньше ограничений при использовании Claude для задач кибербезопасности. У OpenAI есть похожая программа Trusted Access for Cyber.
Источник: TechCrunch.