Обучение моделей выражению своей неуверенности словами

Читать научную работу
Teaching Models To Express Their Uncertainty In Words

Аннотация

Мы показываем, что модель GPT‑3 может научиться выражать неуверенность в собственных ответах на естественном языке — без использования логитов модели. При получении вопроса модель генерирует как сам ответ, так и уровень уверенности (например, «уверенность 90%» или «высокая уверенность»). Эти уровни соответствуют хорошо откалиброванным вероятностям. Модель также сохраняет умеренную калибровку при сдвиге распределения и чувствительна к неопределенности в собственных ответах, а не просто имитирует человеческие примеры. Насколько нам известно, это первый случай, когда модель продемонстрировала способность выражать откалиброванную неуверенность в своих ответах на естественном языке. Для тестирования калибровки мы представляем набор задач CalibratedMath. Мы сравниваем калибровку неопределенности, выраженной словами («вербализованная вероятность»), с неопределенностью, извлеченной из логитов модели. Оба типа неопределенности способны обобщать калибровку при сдвиге распределения. Мы также предоставляем доказательства того, что способность GPT‑3 обобщать калибровку зависит от предобученных скрытых представлений, которые коррелируют с эпистемической неопределенностью в отношении ее ответов.

Авторы

Стефани Лин (Stephanie Lin), Джейкоб Хилтон (Jacob Hilton), Овейн Эванс (Owain Evans)

Полный текст статьи читайте на OpenAI