Представляем IndQA

Новый бенчмарк для оценки систем искусственного интеллекта на предмет знания индийской культуры и языков.

A 3x4 grid of rounded square buttons, each containing a character from a different Indian script or the Latin alphabet. The characters include Bengali (অ), English (En), Hindi (ह), Kannada (Hi), and others representing various Indian languages, set against a light grey background. The image suggests multilingual support or language selection.

Наша миссия — сделать так, чтобы искусственный интел общего назначения (AGI) приносил пользу всему человечеству. Чтобы ИИ был полезен для каждого, он должен эффективно работать на разных языках и в различных культурах. Около 80 процентов людей во всем мире не используют английский в качестве основного языка, однако большинство существующих бенчмарков, измеряющих владение неанглоязычными возможностями, оказываются несостоятельными.

Существующие многоязычные бенчмарки, такие как MMMLU, на данный момент уже исчерпали свой потенциал — передовые модели показывают результаты, кучно сгруппированные у верхних границ шкалы, что снижает их полезность для измерения реального прогресса. Кроме того, текущие бенчмарки в основном сфокусированы на задачах перевода или тестах с множественным выбором. Они не в полной мере отражают то, что действительно важно для оценки языковых возможностей системы ИИ, — понимание контекста, культуры, истории и того, что имеет значение для людей по месту их жительства.

Именно поэтому мы создали IndQA — новый бенчмарк, разработанный для оценки того, насколько хорошо модели ИИ понимают и рассуждают над вопросами, имеющими значение для индийских языков, в самых разных культурных доменах. Хотя наша цель заключается в создании аналогичных бенчмарков для других языков и регионов, Индия является очевидной отправной точкой. В Индии проживает около миллиарда человек, для которых английский не является основным языком, насчитывается 22 официальных языка (включая как минимум семь языков с числом носителей более 50 миллионов), и это второй по величине рынок для ChatGPT.

Эта работа является частью нашей неизменной приверженности делу улучшения наших продуктов и инструментов для индийских пользователей, а также повышения доступности наших технологий по всей стране.

Как это работает

IndQA оценивает знания и навыки рассуждения об индийской культуре и повседневной жизни на индийских языках. Он включает 2278 вопросов по 12 языкам и 10 культурным доменам, созданных в партнерстве с 261 экспертом в различных областях со всей Индии. В отличие от существующих бенчмарков, таких как MMMLU и MGSM, он разработан для проверки культурно нюансированных задач, требующих глубоких рассуждений, с которыми существующие системы оценки справляются с трудом.

IndQA охватывает широкий спектр культурно значимых тем, таких как архитектура и дизайн, искусство и культура, повседневная жизнь, еда и кулинария, история, право и этика, литература и лингвистика, медиа и развлечения, религия и духовность, , а также спорт и отдых — при этом материалы написаны нативных языках: бенгали, английском, хинди, хинглише, каннада, маратхи, одия, телугу, гуджарати, малаялам, панджаби и тамильском. Примечание: мы специально добавили хинглиш, учитывая широкое распространение переключения кодов в живом общении.

Каждая точка данных включает промпт с культурным контекстом на индийском языке, перевод на английский язык для возможности аудита, критерии оценивания в виде рубрик и идеальный ответ, отражающий ожидания экспертов.

Diagram illustrating the evaluation process: an example user-assistant conversation, a candidate response, and a rubric table used to score the response by criteria.

IndQA использует подход на основе рубрик. Каждый ответ оценивается по критериям, составленным профильными экспертами для этого конкретного вопроса. В критериях прописано, что именно должен содержать или чего избегать идеальный ответ, а каждому пункту присваивается взвешенное значение баллов в зависимости от его важности. Оценщик на базе ИИ проверяет, выполнен ли каждый критерий. Итоговая балл представляет собой сумму баллов за выполненные критерии по отношению к максимально возможному числу.

Как мы создавали IndQA

  • Вопросы, созданные экспертами. Мы работали с партнерами по поиску экспертов в Индии в 10 различных областях. Они разработали сложные промпты, ориентированные на навыки рассуждения и привязанные к их регионам и специализациям. Эти эксперты являются носителями соответствующих языков (и английского) на профессиональном уровне и обладают глубокой предметной экспертизой.
  • Состязательная фильтрация (adversarial filtering): Каждый вопрос тестировался на самых мощных моделях OpenAI на момент их создания: GPT‑4o, OpenAI o3, GPT‑4.5 и (частично, после публичного запуска) GPT‑5. Мы оставляли только те вопросы, на которые большинство этих моделей не смогли дать приемлемые ответы, сохраняя пространство для дальнейшего прогресса.
  • Подробные критерии. Наряду с каждым вопросом эксперты-предметники предоставляли критерии, используемые для оценки ответа модели, аналогично экзаменационной рубрике для вопросов с развернутым ответом. Эти критерии применяются для оценки ответов моделей-кандидатов.
  • Идеальные ответы и рецензирование. Эксперты добавляли идеальные ответы и переводы на английский язык, после чего проводилось экспертное рецензирование (peer review) и итеративные доработки до получения окончательного одобрения.

Примеры вопросов

Улучшения с течением времени

Мы используем IndQA для оценки производительности новейших передовых моделей и отслеживания прогресса за последние пару лет. С помощью IndQA мы видим, что модели OpenAI значительно улучшились с течением времени в работе с индийскими языками (с учетом определенных оговорок), однако у них все еще остается значительный потенциал для совершенствования. Мы с нетерпением ждем возможности улучшить производительность и поделиться результатами будущих моделей.

Ниже мы также представляем стратификацию результатов тестирования в IndQA по языкам и доменам, сравнивая модель GPT‑5 Thinking High с другими передовыми аналогами.

Оговорки

Поскольку вопросы не идентичны для разных языков, IndQA не является языковой таблицей лидеров (глобальным рейтингом языков); оценки между разными языками не следует интерпретировать как прямое сравнение языковых способностей. Вместо этого мы планируем использовать IndQA для измерения прогресса с течением времени внутри определенного семейства моделей или конфигурации.

Кроме того, поскольку вопросы отбирались по принципу невозможности корректного ответа на них со стороны GPT‑4o, OpenAI o3, GPT‑4.5 и (после публичного запуска) GPT‑5, выборка вопросов носит состязательный характер по отношению к этим моделям. Это может потенциально искажать относительную производительность GPT‑5 и ставить все модели OpenAI в невыгодное положение по сравнению с моделями сторонних разработчиков.

Эксперты, создававшие IndQA

Мы выражаем признательность 261 индийскому эксперту — журналистам, лингвистам, ученым, деятелям искусства и отраслевым практикам, — которые составляли и рецензировали вопросы для IndQA. Вот лишь несколько примеров экспертов, с которыми мы сотрудничали:

  • Актер и сценарист, удостоенный премии Nandi Award, снявшийся более чем в 750 фильмах на телугу
  • Журналист и редактор газеты Tarun Bharat на маратхи
  • Исследователь лингвистики каннада и составитель словарей
  • Международный гроссмейстер по шахматам, тренирующий шахматистов из топ-100 мирового рейтинга
  • Тамильский писатель, поэт и культурный деятель, выступающий за социальную справедливость, кастовое равенство и литературную свободу
  • Композитор панджабской музыки, обладатель престижных наград
  • Куратор гуджаратского культурного наследия и специалист по его сохранению
  • Поэт и перформанс-артист на малаялам, лауреат творческих премий
  • Профессор истории, специалист по богатому культурному наследию Бенгалии
  • Профессор архитектуры, специализирующийся на храмах Одиши

Дальнейшие шаги

Мы надеемся, что выпуск IndQA послужит ориентиром и вдохновит исследовательское сообщество на создание новых бенчмарков. Вопросы в стиле IndQA особенно ценны для языков и культурных доменов, которые слабо представлены в существующих бенчмарках ИИ. Создание аналогичных IndQA бенчмарков может помочь исследовательским лабораториям в области ИИ лучше понять языки и предметные области, с которыми модели сегодня испытывают трудности, а также послужить путеводной звездой для будущих улучшений.

Автор

OpenAI

Полный текст статьи читайте на OpenAI