Новый ИИ-классификатор для определения текста, написанного искусственным интеллектом

New Ai Classifier For Indicating Ai Written Text

По состоянию на 20 июля 2023 года ИИ-классификатор больше не доступен из-за его низкой точности. Мы работаем над учетом отзывов и в настоящее время исследуем более эффективные методы установления происхождения текста, а также взяли на себя обязательство разрабатывать и внедрять механизмы, позволяющие пользователям понимать, созданы ли аудио- или визуальные материалы с помощью искусственного интеллекта.

Мы обучили классификатор различать текст, написанный человеком, и текст, созданный ИИ от различных провайдеров. Хотя невозможно надежно обнаружить абсолютно любой текст, сгенерированный ИИ, мы верим, что хорошие классификаторы могут помочь в борьбе с ложными утверждениями о том, что созданный ИИ текст был написан человеком: например, при проведении автоматизированных кампаний по дезинформации, использовании инструментов ИИ для академической нечестности и выдаче ИИ-чат-бота за человека.

Наш классификатор не является полностью надежным. В ходе оценок на «контрольном наборе» текстов на английском языке наш классификатор верно определяет 26% текста, написанного ИИ (истинно положительные результаты), как «вероятно написанный ИИ», при этом ошибочно классифицируя текст, написанный человеком, как созданный ИИ в 9% случаев (ложноположительные результаты). Надежность нашего классификатора обычно возрастает по мере увеличения длины входного текста. По сравнению с нашим ранее выпущенным классификатором, этот новый классификатор значительно надежнее при обработке текстов от более современных ИИ-систем.

Мы делаем этот классификатор общедоступным, чтобы получить отзывы о том, полезны ли такие несовершенные инструменты. Наша работа по обнаружению текстов, сгенерированных ИИ, будет продолжена, и мы надеемся поделиться усовершенствованными методами в будущем.

Попробуйте наш бесплатный экспериментальный классификатор самостоятельно:

  • Попробовать классификатор

Ограничения

Наш классификатор имеет ряд важных ограничений. Его не следует использовать в качестве основного инструмента для принятия решений, а применять лишь как дополнение к другим методам определения источника текста.

  1. Классификатор крайне ненадежен при работе с короткими текстами (менее 1000 символов). Даже более длинные тексты классификатор иногда размечает неправильно.
  2. Иногда текст, написанный человеком, ошибочно, но с высокой уверенностью определяется нашим классификатором как созданный ИИ.
  3. Мы рекомендуем использовать классификатор только для текстов на английском языке. Он работает значительно хуже с другими языками и ненадежен при анализе программного кода.
  4. Текст с высокой степенью предсказуемости невозможно надежно идентифицировать. Например, невозможно предсказать, был ли список первых 1000 простых чисел написан ИИ или человеком, поскольку правильный ответ всегда один и тот же.
  5. Текст, написанный ИИ, можно отредактировать так, чтобы обойти классификатор. Подобные нашему классификаторы можно обновлять и дообучать на основе успешных атак, однако пока неясно, имеет ли обнаружение преимуществ в долгосрочной перспективе.
  6. Классификаторы на основе нейронных сетей известны тем, что плохо откалиброваны за пределами своих обучающих данных. Для входных данных, которые сильно отличаются от текста в нашем тренировочном наборе, классификатор порой проявляет крайнюю уверенность в ошибочном прогнозе.

Обучение классификатора

Наш классификатор представляет собой языковую модель, дообученную на датасете из пар текстов, написанных человеком и созданных ИИ на одну и ту же тему. Мы собрали этот набор данных из различных источников, которые, как мы полагаем, написаны людьми (например, данные предварительного обучения и демонстрации людей для промптов, отправленных в InstructGPT). Мы разделили каждый текст на промпт и ответ. На основе этих промптов мы сгенерировали ответы с помощью различных языковых моделей, обученных нами и другими организациями. Для нашего веб-приложения мы корректируем порог уверенности, чтобы уровень ложноположительных результатов оставался низким; иными словами, мы помечаем текст как вероятно созданный ИИ только тогда, когда классификатор в этом очень уверен.

Влияние на преподавателей и призыв к обсуждению

Мы понимаем, что определение текстов, написанных ИИ, стало важной темой для обсуждения среди преподавателей, и не менее важно осознавать ограничения и последствия использования классификаторов контента ИИ в учебных аудиториях. Мы подготовили предварительный ресурс по использованию ChatGPT для преподавателей, в котором описаны некоторые варианты применения, а также связанные с ними ограничения и факторы. Хотя этот ресурс ориентирован на работников образования, мы ожидаем, что наш классификатор и сопутствующие инструменты окажут влияние на журналистов, исследователей дезинформации и другие группы.

Мы взаимодействуем с преподавателями в США, чтобы узнать, с чем они сталкиваются в классах, и обсудить возможности и ограничения ChatGPT. Мы будем расширять наше сотрудничество по мере получения новых знаний. Эти дискуссии крайне важны, поскольку наша миссия заключается в безопасном внедрении крупных языковых моделей в непосредственном контакте с пострадавшими сообществами.

Если вы непосредственно столкнулись с этими проблемами (включая, помимо прочего, учителей, администраторов, родителей, учащихся и поставщиков образовательных услуг), пожалуйста, поделитесь с нами отзывом с помощью этой формы. Нам полезны как прямые отзывы о предварительном ресурсе, так и любые материалы, которые преподаватели разрабатывают или считают полезными (например, руководства по курсам, кодексы чести и обновления политик, интерактивные инструменты, программы по повышению грамотности в сфере ИИ).

Авторы

Ян Хендрик Кирхнер, Лама Ахмад, Скотт Ааронсон, Ян Лейке

Участники разработки

Майкл Лампе, Джоанн Джанг, Памела Мишкин, Эндрю Мейн, Энрике Понде де Оливейра Пинто, Валери Балком, Мишель Покрасс, Джефф Белгум, Мадлен Бойд, Хизер Шмидт, Шервин Ву, Логан Килпатрик, Томас Дегри

Полный текст статьи читайте на OpenAI