arXiv введет бан за непроверенные статьи ИИ

arXiv введет бан за непроверенные статьи ИИ

ArXiv, крупный открытый репозиторий научных препринтов, ужесточает правила против непроверенного использования больших языковых моделей в научных статьях.

Хотя материалы на платформе публикуются до рецензирования, arXiv стал одним из главных каналов распространения исследований в компьютерных науках и математике. Площадка также служит источником данных о трендах в научных публикациях.

Сервис уже предпринимал меры против роста числа слабых и сгенерированных ИИ работ. В частности, для новых авторов действует требование получить рекомендацию от признанного исследователя. После более чем 20 лет работы под управлением Cornell организация также переходит в формат независимой некоммерческой структуры, что должно помочь привлекать больше средств на решение таких проблем.

В новом сообщении председатель секции компьютерных наук arXiv Томас Диттерих написал, что «если заявка содержит неопровержимые доказательства того, что авторы не проверяли результаты генерации LLM, это означает, что доверять содержимому статьи нельзя».

По словам Диттериха, к таким доказательствам могут относиться «выдуманные ссылки» и комментарии, адресованные LLM или полученные от неё. В таких случаях авторам грозит запрет на публикацию в arXiv сроком на один год. После этого их следующие материалы для arXiv должны будут сначала получить одобрение в авторитетном рецензируемом издании.

При этом речь не идёт о полном запрете на использование LLM. Как отметил Диттерих, авторы должны нести «полную ответственность» за содержание статьи «вне зависимости от того, как именно был создан этот текст». Если исследователь напрямую вставляет из LLM «неуместные формулировки, плагиат, предвзятый контент, ошибки, неверные ссылки или вводящие в заблуждение фрагменты», ответственность всё равно остаётся на нём.

Диттерих сообщил изданию 404 Media, что правило будет применяться по принципу «одного нарушения». Однако сначала проблему должны отметить модераторы, а затем подтверждение должны дать руководители секций. У авторов также будет возможность обжаловать решение.

Недавние рецензируемые исследования показывают, что число вымышленных ссылок в биомедицинских публикациях растёт, и вероятной причиной называют LLM. При этом с подобной проблемой сталкиваются не только учёные.

Источник: 404 Media.