Сбор отзывов людей

RL-Teacher — это проект с открытым исходным кодом, реализующий интерфейс для обучения ИИ на основе периодических отзывов людей, а не вручную созданных функций вознаграждения. Базовая методика была разработана как шаг к созданию безопасных систем искусственного интеллекта, но она также применима к задачам обучения с подкреплением, в которых функции вознаграждения трудно формализовать.
Релиз состоит из трех основных компонентов:
- Предиктор вознаграждения (reward predictor), который может быть интегрирован в любого агента и учится предсказывать действия агента, одобряемые человеком.
- Пример агента (example agent), обучающегося с помощью функции, заданной предиктором вознаграждения. RL-Teacher поставляется с тремя предварительно интегрированными алгоритмами, включая OpenAI Baselines PPO.
- Веб-приложение (web-app), которое люди могут использовать для отправки отзывов, предоставляя данные для обучения предиктора вознаграждения.
Вся система состоит менее чем из 1 000 строк кода на Python (не считая агентов). Настроив веб-сервер, вы можете запустить эксперимент командой:
Bash
1$ python rl_teacher/teach.py -p human --pretrain_labels 175 -e Reacher-v1 -n human-175Люди могут оставлять отзывы через простой веб-интерфейс (показан выше), который можно запускать локально (не рекомендуется) или на отдельной машине. Полная документация доступна в репозитории проекта на GitHub. Нам не терпится узнать, как исследователи и инженеры в области ИИ применят эту технологию — пожалуйста, свяжитесь с нами, поделившись результатами экспериментов!
Авторы
Полный текст статьи читайте на OpenAI
