Be My Eyes

Приложение Be My Eyes использует GPT‑4 для преобразования визуальной доступности.

Посмотреть продукт
Be My Eyes
BeMyEyes

С 2012 года компания Be My Eyes создает технологии для сообщества из более чем 250 миллионов слепых и слабовидящих людей. Этот датский стартап объединяет незрячих и слабовидящих людей с волонтерами для помощи в сотнях повседневных задач, таких как определение продукта или ориентация в аэропорту.

Благодаря новой функции визуального ввода GPT‑4 (на этапе предварительного исследования), компания Be My Eyes начала разработку виртуального волонтера Virtual Volunteer™ на базе GPT‑4 в приложении Be My Eyes, который способен обеспечивать такой же уровень контекста и понимания, как и волонтер-человек.

«За то короткое время, что у нас был доступ, мы увидели непревзойденную производительность по сравнению с любыми существующими инструментами распознавания изображений в текст», — говорит Майкл Бакли (Michael Buckley), генеральный директор Be My Eyes. — «Последствия для глобальной доступности огромны. В не столь отдаленном будущем слепое и слабовидящее сообщество будет использовать эти инструменты не только для решения множества задач визуальной интерпретации, но и для достижения большей степени независимости в своей жизни».

Внезапно, если кто-то отправляет изображение, скажем, содержимого своего холодильника, технология GPT‑4 не только распознает и называет то, что там находится, но также экстраполирует и анализирует, что можно приготовить из этих ингредиентов. Затем вы можете попросить ее подсказать хороший рецепт. Сценарии использования практически безграничны.

«Это меняет правила игры», — говорит Бакли. — «В конечном счете, какими бы ни были желания или потребности пользователя, он может повторно отправить запрос инструменту, чтобы практически мгновенно получить больше полезной и применимой информации».

В начале февраля компания начала бета-тестирование ассистента на базе GPT с небольшой группой сотрудников; результаты оказались настолько положительными, что уже через несколько недель функция станет доступна пользователям.

«Открывается просто невероятный потенциал для нашего сообщества», — говорит Бакли. — «Нашим бета-тестерам, включая Люси Эдвардс (Lucy Edwards), уже очень нравится то, что делает эта функция».

Разница между GPT‑4 и другими языковыми моделями и моделями машинного обучения, как объясняет технический директор Be My Eyes Йеспер Хвирринг Хенриксен (Jesper Hvirring Henriksen), заключается как в возможности вести диалог, так и в более высоком уровне аналитических способностей, предлагаемых технологией. «Базовые приложения для распознавания изображений говорят вам только то, что находится перед вами», — отмечает он. — «Они не могут вести дискуссию, чтобы понять, содержат ли лапша правильные ингредиенты, или является ли предмет на земле не просто мячом, а опасностью споткнуться, и сообщить об этом».

«Разница между GPT-4 и другими языковыми моделями и моделями машинного обучения заключается как в возможности вести диалог, так и в более высоком уровне аналитических способностей, предлагаемых технологией».
Йеспер Хвирринг Хенриксен (Jesper Hvirring Henriksen), технический директор Be My Eyes

У компании уже был случай, когда пользователь смог сориентироваться в системе железнодорожного транспорта — что, возможно, является невыполнимой задачей и для зрячих, — получая не только подробную информацию о своем местоположении на карте, но и пошаговые инструкции о том, как безопасно добраться до нужного места.

Тем не менее, перемещение в сложном физическом мире — это лишь половина дела. Понимание того, что находится на экране, может быть вдвое более сложной задачей для незрячего человека. Программы чтения с экрана (скринридеры), встроенные в большинство современных операционных систем, читают элементы веб-страницы или настольного приложения строка за строкой, раздел за разделом, произнося каждое слово. Изображения, являющиеся основой общения в Интернете, могут создавать еще большие трудности.

Тем не менее, Хенриксен говорит, что теперь они могут показать GPT‑4 веб-страницу, и система знает — после бесчисленных часов обучения, в течение которых алгоритмы глубокого обучения выстраивают связи для понимания «важной» части веб-страницы, — какую часть прочитать или обобщить. Это может не только упростить такие задачи, как чтение новостей в интернете, но и предоставить людям, нуждающимся в визуальной помощи, доступ к некоторым из самых загроможденных страниц в сети: сайтам магазинов и электронной коммерции. GPT‑4 способна суммировать результаты поиска так, как зрячие люди просматривают их естественным образом — не читая каждую мелкую деталь, а перескакивая между важными точками данных — и помогать тем, кому нужна поддержка зрения, совершать правильные покупки в реальном времени.

«Это фантастическое достижение для человечества», — говорит Бакли, — «но оно также представляет собой огромную коммерческую возможность».

Хотите узнать больше о ChatGPT для бизнеса?

Свяжитесь с нашей командой

Полный текст статьи читайте на OpenAI