ChatGPT теперь умеет видеть, слышать и говорить

Мы начинаем внедрение новых голосовых и визуальных функций в ChatGPT. Они предлагают новый, более интуитивный интерфейс, позволяя вам вести голосовые беседы или показывать ChatGPT то, о чем вы говорите.
Голос и изображения открывают больше возможностей для использования ChatGPT в повседневной жизни. Сделайте снимок достопримечательности во время путешествия и устройте живую беседу о том, чем она интересна. Дома сфотографируйте содержимое холодильника и кладовой, чтобы решить, что приготовить на ужин (и задайте уточняющие вопросы, чтобы получить пошаговый рецепт). После ужина помогите ребенку с задачей по математике: сфотографируйте ее, обведите условие кругом, и пусть ассистент поделится подсказками с вами обоими.
Мы внедряем голосовые функции и работу с изображениями в ChatGPT для пользователей Plus и Enterprise в течение следующих двух недель. Голосовое управление появится на iOS и Android (включить его можно в настройках), а работа с изображениями станет доступна на всех платформах.
Общайтесь с ChatGPT голосом, и он ответит вам тем же
Теперь вы можете использовать голос для полноценного диалога с вашим ассистентом. Общайтесь на ходу, попросите рассказать сказку на ночь для вашей семьи или разрешите спор за обеденным столом.
Используйте голос для диалога с вашим ассистентом в режиме реального времени.
Чтобы начать работу с голосом, перейдите в «Настройки» → «Новые функции» в мобильном приложении и активируйте голосовые беседы. Затем нажмите кнопку с изображением наушников в правом верхнем углу главного экрана и выберите предпочитаемый голос из пяти доступных вариантов.
Новая функция голосового общения работает на базе новой модели преобразования текста в речь, способной генерировать естественное аудио на основе текста и всего нескольких секунд образца речи. Мы сотрудничали с профессиональными актерами озвучивания при создании каждого из голосов. Мы также используем Whisper — нашу систему распознавания речи с открытым исходным кодом, — чтобы преобразовывать ваши произнесенные слова в текст.
Обсуждайте изображения
Теперь вы можете показать ChatGPT одно или несколько изображений. Выясните, почему не заводится ваш гриль, изучите содержимое холодильника для планирования меню или проанализируйте сложный график с рабочими данными. Чтобы сосредоточиться на определенной части изображения, вы можете использовать инструмент рисования в нашем мобильном приложении.
Показывайте ChatGPT одно или несколько изображений.
Чтобы начать, нажмите кнопку фото, чтобы сделать снимок или выбрать изображение. Если вы используете iOS или Android, сначала нажмите кнопку «плюс». Вы также можете обсуждать несколько изображений одновременно или использовать наш инструмент рисования, чтобы направить ассистента.
Понимание изображений обеспечивается мультимодальными моделями GPT‑3.5 и GPT‑4. Эти модели применяют свои навыки языкового анализа к самым разным изображениям, таким как фотографии, скриншоты и документы, содержащие как текст, так и графику.
Мы внедряем голосовые и визуальные функции постепенно
Цель OpenAI — создание безопасного и полезного общего искусственного интеллекта (AGI). Мы верим в постепенное предоставление доступа к нашим инструментам, что позволяет нам со временем вносить улучшения, совершенствовать средства снижения рисков и одновременно готовить всех к появлению более мощных систем в будущем. Эта стратегия становится еще более важной при работе с передовыми моделями, включающими голос и зрение.
Голос
Новая голосовая технология, способная создавать реалистичные синтетические голоса всего по нескольким секундам реальной речи, открывает двери для множества творческих приложений и решений в области доступности. Тем не менее, эти возможности несут в себе и новые риски, такие как потенциальная возможность злоумышленников выдавать себя за публичных лиц или совершать мошенничество.
Именно поэтому мы используем эту технологию для конкретного сценария использования — голосового чата. Голосовой чат был создан в сотрудничестве с актерами озвучивания, с которыми мы работали напрямую. Мы также сотрудничаем аналогичным образом с другими партнерами. Например, Spotify использует возможности этой технологии для пилотного запуска своей функции Voice Translation (голосового перевода), которая помогает подкастерам расширять аудиторию, переводя подкасты на другие языки с сохранением собственных голосов авторов.
Ввод изображений
Модели на основе компьютерного зрения также создают новые проблемы: от галлюцинаций в отношении людей до излишней надежности на интерпретацию изображений моделью в критически важных областях. Перед широким внедрением мы протестировали модель совместно со специалистами по тестированию на проникновение (red teamers) на предмет рисков в таких сферах, как экстремизм и научная грамотность, а также с разнообразной группой альфа-тестеров. Наше исследование позволило нам прийти к согласию по нескольким ключевым деталям для обеспечения безопасного использования.
Делаем компьютерное зрение полезным и безопасным
Как и другие функции ChatGPT, зрительное восприятие создано для того, чтобы помогать вам в повседневной жизни. Оно справляется с этим лучше всего, когда может видеть то, что видите вы.
Этот подход сформировался непосредственно благодаря нашей работе с Be My Eyes — бесплатным мобильным приложением для незрячих и слабовидящих людей, — которая помогла нам понять сценарии использования и ограничения. Пользователи рассказали нам, что им полезно вести общие беседы об изображениях, на которых случайно оказываются люди на заднем плане (например, если кто-то появляется по телевизору, пока вы пытаетесь разобраться с настройками пульта дистанционного управления).
Мы также приняли технические меры, чтобы существенно ограничить способность ChatGPT анализировать людей и делать прямые заявления о них, поскольку ChatGPT не всегда точен, а подобные системы должны уважать частную жизнь людей.
Использование в реальном мире и отзывы помогут нам сделать эти меры защиты еще более эффективными, сохранив при этом полезность инструмента.
Прозрачность в отношении ограничений модели
Пользователи могут полагаться на ChatGPT в специализированных областях, например в научных исследованиях. Мы открыто говорим об ограничениях модели и не рекомендуем сценарии использования с повышенным риском без надлежащей проверки. Кроме того, модель отлично справляется с распознаванием англоязычного текста, но показывает слабые результаты с некоторыми другими языками, особенно с теми, в которых не используется латиница. Мы не советуем нашим неанглоязычным пользователям использовать ChatGPT для этих целей.
Вы можете подробнее узнать о нашем подходе к безопасности и работе с проектом Be My Eyes в системной карте для ввода изображений.
Мы будем расширять доступ
Пользователи тарифных планов Plus и Enterprise смогут опробовать голос и изображения в течение ближайших двух недель. Мы рады вскоре предоставить эти возможности и другим группам пользователей, включая разработчиков.
Автор
Благодарности
Основные исследования голосового режима
Alec Radford, Tao Xu, Jong Wook Kim
Основные исследования внедрения зрительных функций
Raul Puri, Jamie Kiros, Hyeonwoo Noh, Long Ouyang, Sandhini Agarwal
Посмотреть техническую работу и авторов GPT-4V (ision)
Полный текст статьи читайте на OpenAI
