Microsoft представила ASSERT — открытый фреймворк для оценки поведения ИИ-систем с учётом правил и задач конкретного продукта или сервиса.
Компания сообщила, что инструмент под названием Adaptive Spec-driven Scoring for Evaluation and Regression Testing упрощает проверку прикладного поведения ИИ. Для этого он использует ИИ, чтобы превращать текстовые описания целей, политик и ожидаемого поведения в набор подробных тестов с оценкой результатов.
ASSERT принимает описание ожидаемого поведения модели на обычном языке, затем переводит его в структурированный список допустимых и недопустимых действий, создаёт сценарии и тест-кейсы, запускает их на целевой системе и выставляет итоговые оценки.
Фреймворк также может записывать шаги, по которым идёт ИИ-система, включая промежуточные действия и вызовы инструментов. Это помогает разработчикам понять, на каком этапе произошёл сбой.
Разработчики могут добавить контекст системы, список инструментов и ограничения, чтобы точнее задать, что именно должно проверяться в ходе оценки.
В качестве примера Microsoft приводит агент для работы с документами. Разработчик может указать, что такой ИИ не должен отправлять письма людям вне компании, обязан передавать конфиденциальные данные только руководителям уровня C-level и делать краткие сводки с учётом предыдущего контекста. В таком случае ASSERT создаст тесты, которые проверят соблюдение этих правил на постоянной основе.
По данным Microsoft, фреймворк закрывает пробел, который не покрывают более общие методы оценки, если поведение модели должно зависеть от контекста приложения, внутренних политик и доступных инструментов.
Директор по продукту Responsible AI в Microsoft Сара Бёрд заявила: «Один из выводов, к которому мы пришли, состоит в том, что оценки абсолютно критичны для принятия правильных решений. Если вы не понимаете поведение ИИ-системы, очень трудно определить, соответствует ли она требованиям вашей организации […] Мы увидели, что для системы, которой можно доверять, нужно проверять гораздо больше параметров, связанных с конкретным приложением».
По словам Бёрд, ASSERT можно использовать на этапе разработки, после запуска системы и для непрерывного мониторинга.
Выход инструмента совпал с более широким сдвигом в индустрии ИИ. По мере роста возможностей моделей исследователи всё активнее занимаются воспроизводимым тестированием и регрессионными проверками. В материале упоминаются Stanford HELM, MLCommons AILuminate и группы оценки вроде METR, которые выпускают бенчмарки для измерения поведения моделей в разных условиях.
Источник: Microsoft.