Написанные ИИ рецензии помогают людям замечать ошибки

Читать статьюПосмотреть набор данных
Ai Written Critiques Help Humans Notice Flaws

Мы обучили модели «написанию рецензий» для описания недостатков в суммаризациях (кратких изложениях). Человеческие эксперты гораздо чаще находят ошибки в текстах, когда им показывают рецензии нашей модели. Более крупные модели лучше справляются с саморецензированием, причем масштабирование улучшает навыки создания рецензий сильнее, чем навыки суммаризации. Это демонстрирует перспективность использования систем ИИ для помощи людям в контроле за системами ИИ при выполнении сложных задач.

Мы хотим гарантировать, что будущие системы ИИ, выполняющие очень сложне задачи, останутся согласованными с намерениями человека. Многиепредыдущиеработы по согласованию языковых моделей опираются на оценки людей в качестве обучающего сигнала. Однако людям сложно оценивать очень сложные задачи — например, трудно обнаружить каждый баг в кодовой базе или каждую фактическую ошибку в длинном эссе. В результате модели могут научиться выдавать результаты, которые кажутся людям хорошими, но содержат ошибки, которые мы систематически не замечаем.

Чтобы смягчить эту проблему, мы хотим обучать помощников на базе ИИ, которые помогают людям предоставлять обратную связь по сложным задачам. Эти помощники должны указывать на недостатки, помогать людям понять суть происходящего и отвечать на их вопросы. Примером этого является наша прошлая работа по суммаризации книг: чтение всей книги требует огромных усилий, но людям, использующим краткие содержания глав, гораздо проще оценивать книжную суммаризацию.

В качестве концептуальной проверки мы использовали обучение с учителем для тренировки языковых моделей написанию рецензий на тематические суммаризации коротких рассказов, статей из Википедии и других текстов из интернета. Мы используем эти модели для помощи человеческим оценщикам и изучаем свойства масштабирования процесса написания рецензий.

Эксперименты с помощью ИИ

Чтобы проверить, насколько полезны наши модели для помощи в оценке, мы показываем разметчикам по 8 написанных моделью рецензий на каждую суммаризацию, а контрольная группа помощи не получает. Мы используем тематические суммаризации из трех источников: созданные нашими моделями, написанные людьми и написанные людьми намеренно с важными, но тонкими ошибками.

Хотя суммаризация на самом деле не является сложной задачей для людей, и наши модели не превосходят людей по возможностям, они уже оказывают существенную помощь: при оценке созданных моделью кратких содержаний группа с поддержкой находит на 50% больше ошибок, чем контрольная группа. Для намеренно вводящих в заблуждение суммаризаций помощь увеличивает частоту обнаружения запланированной ошибки людьми с 27% до 45%.

Свойства масштабирования рецензий

Помощь при работе с созданными моделью суммаризациями работает только в том случае, если модели способны критиковать сами себя. Мы попросили людей оценить полезность написанных самими моделями рецензий и обнаружили, что более крупные модели лучше справляются с самокритикой.

Мы также обнаружили, что крупные модели способны напрямую улучшать свои результаты, используя собственные рецензии, на что маленькие модели не способны. Использование более качественных рецензий помогает моделям совершенствоваться эффективнее, чем при использовании плохих рецензий или их полном отсутствии.

Рассказывают ли нам модели всё, что они знают?

Чтобы обеспечить наилучшую помощь в оценке сложных задач, мы хотели бы, чтобы модели сообщали о всех проблемах, о которых им «известно». Всегда ли модель, когда она правильно предсказывает наличие ошибки в ответе, способна также сформулировать конкретную рецензию, понятную людям?

Это особенно важно для контроля моделей, которые могут попытаться ввести в заблуждение человеческих операторов или скрыть информацию. Мы хотели бы обучить столь же умные вспомогательные модели указывать на то, чего не замечают люди.

К сожалению, мы обнаружили, что модели лучше справляются с различением, чем с критикой собственных ответов. Это указывает на то, что они знают о некоторых проблемах, которые не могут или не хотят четко сформулировать. Более того, разрыв между способностью к различению и критике не уменьшился у более крупных моделей. Сокращение этого разрыва является важнейшим приоритетом для наших исследований в области согласования.

Следующие шаги

Важным ограничением этой работы является то, что тематическая суммаризация на самом деле не является сложной задачей: люди понимают ее довольно хорошо, и на оценку краткого содержания у них уходит всего около 10 минут. Чтобы лучше понять пределы оценки с помощью ИИ, нам нужно работать с задачами, которые гораздо сложнее для оценки людьми.

Тем не менее, эти результаты вселяют оптимизм в то, что мы можем обучать модели оказывать людям осмысленную помощь в виде обратной связи. Это важный столп нашей стратегии согласования, начиная с работ по дебатам и рекурсивному моделированию вознаграждения. В долгосрочной перспективе мы хотим создать помощников, которым можно будет доверить всю когнитивную работу, необходимую для оценки, чтобы люди могли сосредоточиться на передаче своих предпочтений.

Авторы

Ян Лейке, Джеффри Ву, Кэтрин Йе, Уильям Сондерс

Полный текст статьи читайте на OpenAI