Новые инструменты для понимания ИИ и результатов обучения

Совершенствование методов оценки влияния искусственного интеллекта на учебный процесс

Образование — одна из самых перспективных сфер применения искусственного интеллекта. С помощью таких инструментов, как ChatGPT, персонализированная поддержка в обучении может быть доступна любому студенту, в любом месте и в любое время. 

Однако сектора образования находится лишь на начальном этапе понимания того, как ИИ влияет на результаты обучения. В прошлом году наша команда задалась целью изучить использование таких инструментов, как режим обучения, и зафиксировала обнадеживающие успехи в успеваемости студентов. Но наше исследование также поставило важный вопрос: как мы можем оценить, каким образом ИИ влияет на прогресс учащегося с течением времени, а не только на финальном экзамене?

Это более широкая задача для всей экосистемы. На сегодняшний день большинство методов исследований сосредоточены на узких показателях эффективности (таких как результаты тестов) и не способны оценить, как студенты на самом деле учатся с помощью ИИ в реальных условиях и как это использование формирует результаты с течением времени. 

Чтобы восполнить этот пробел, мы разработали комплекс оценки результатов обучения (Learning Outcomes Measurement Suite) — методологию, созданную совместно с Тартуским университетом в Эстонии и инициативой SCALE при Стэнфордском акселераторе обучения для поддержки лонгитюдного измерения результатов обучения в различных образовательных контекстах. 

В настоящее время проводится масштабная валидация посредством рандомизированного контролируемого исследования, а также планируются дальнейшие изыскания с организациями-основателями в рамках Learning Lab — исследовательской экосистемы OpenAI в сфере обучения, включая исследователей из Университета штата Аризона, UCL Knowledge Lab и Медиалаборатории MIT (на основе предыдущих совместных исследований).

Сегодня мы делимся обзором того, как работает этот комплекс оценки и почему он важен. Со временем мы намерены публиковать новые исследования и выпустить этот комплекс в качестве общественного ресурса для школ, университетов и образовательных систем по всему миру.

«Это исследование позволяет нам быстро делать выводы и одновременно закладывает основу для более глубокого понимания того, как ИИ можно продуманно интегрировать в школы способами, которые действительно имеют значение. Мы хотим понять, как эти инструменты могут поддерживать строгий академический подход к учебе и одновременно развивать критическое мышление, креативность, любознательность и уверенность учащихся в себе как в тех, кто учится».
— Сюзанна Лёб (Susanna Loeb), профессор образования и директор факультета инициативы SCALE в Стэнфордском университете

Основные выводы

  • Существующие методы исследования влияния ИИ на обучение демонстрируют многообещающие показатели эффективности, однако не дают полной картины того, как ИИ влияет на результаты обучения с течением времени.
  • Комплекс оценки результатов обучения впервые предоставит стандартную структуру для лонгитюдных исследований, которые помогут преподавателям, исследователям и учебным заведениям понять, как ИИ формирует процесс и результаты обучения в различных контекстах.
  • Learning Lab от OpenAI — это новая исследовательская экосистема, направленная на развитие этой работы. OpenAI будет публиковать результаты совместно с рядом партнеров по мере развития этой области.

Предпосылки и первые исследования

Когда студенты используют инструменты ИИ для учебы и получения знаний, это может означать совершенно разные вещи: от обращения к ИИ за быстрыми ответами до пошагового разбора задач с помощью инструктажа, похожего на работу репетитора. Чтобы стимулировать пользователей взаимодействовать с ChatGPT способами, способствующими более глубокому пониманию и развитию навыков, компания OpenAI в прошлом году представила режим обучения. Под капотом этот режим работает на базе пользовательских системных инструкций, написанных нами в сотрудничестве с преподавателями, учеными и экспертами по педагогике. Они отражают набор ключевых моделей поведения, которые поддерживают реальное обучение, а не просто выдачу ответов — с использованием методических подсказок, проверок на понимание и управляемой практики.

Чтобы проверить, приводит ли такой педагогически ориентированный стиль взаимодействия с ИИ к лучшим результатам обучения, мы провели рандомизированное исследование с участием более 300 студентов колледжей, готовившихся к экзаменам по нейробиологии и микроэкономике. Хотя анализ еще продолжается, первые результаты дают нам уверенность в том, что педагогически выверенный стиль взаимодействия с ИИ, поощряемый с помощью таких функций, как режим обучения, способен улучшить результаты. Но это исследование также выявило важный факт: по-настоящему важно то, являются ли достигнутые успехи и сопутствующее продуктивное поведение устойчивыми с течением времени.

Дизайн исследования

Участники были распределены на три группы: контрольная группа занималась с использованием традиционных онлайн-ресурсов (таких как Google Поиск и YouTube), при этом функции генеративных обзоров на базе ИИ были отключены; двум другим группам был предоставлен доступ к одному из двух вариантов режима обучения, разработанных для того, чтобы направлять студентов в учебном процессе несколько различающимися способами. Перед началом исследования были проведены базовые тесты и вводные опросы, чтобы учесть различия в предыдущем прохождении учебных курсов, привычках учебы, академической уверенности и знакомстве с инструментами ИИ. Студенты проходили сессии в режиме обучения с ограничением по времени перед каждым экзаменом, причем оба варианта режима чередовались между дисциплинами.

Эта схема была разработана таким образом, чтобы отражать реальные условия учебы, а не строго контролируемую лабораторную среду. Участие не было привязано к результатам экзаменов, и не все студенты использовали режим обучения в одинаковой степени во время номинальных 40-минутных сессий. Это позволило нам измерить и оценить эффекты намерения лечить (ITT — intention-to-treat) — влияние предоставления доступа к инструменту в реалистичных условиях внедрения. Иными словами, причинно-следственный эффект от предложения режима обучения с учетом того, что на практике уровень вовлеченности может варьироваться.

Результаты

Мы измеряли успеваемость по каждому экзамену по отдельности. В нашем рандомизированном исследовании улучшения не были одинаковыми по всем предметам, а уровень вовлеченности в режим обучения различался среди участников. 

  • Нейробиология (первичный ITT-анализ): Мы наблюдали направленные в положительную сторону различия для режима обучения по сравнению с контрольной группой, однако результаты не имели статистически значимых отличий от показателей студентов, занимавшихся с использованием традиционных онлайн-ресурсов. Некоторые проблемы с вводным инструктажом и технические неполадки повлияли на время, потраченное на учебу учащимися, использовавшими режим обучения. 
  • Микроэкономика (первичный ITT-анализ): Мы зафиксировали значительный прирост экзаменационных баллов среди студентов, которым был предоставлен доступ к режиму обучения, по сравнению с контрольной группой без ИИ — показатель успеваемости оказался выше примерно на 15%.

Режим обучения (варианты А и Б) в сравнении с контрольной группой (без ИИ): скорректированные средние баллы за экзамены

Эффект остается неизменным при сравнении каждого отдельного варианта режима обучения с контрольной группой.

Хотя это отражает реальные вариации в условиях, данный результат выявил более глубокое ограничение в том, как обычно измеряются результаты обучения.

Большинство существующих подходов к оценке опираются на фиксированные интервенции, оцениваемые в короткие временные промежутки с использованием таких показателей, как результаты тестов или итоговые эссе в качестве основных сигналов. Эти методы не предназначены для того, чтобы фиксировать ключевой механизм, посредством которого ИИ влияет на обучение на практике: непрерывные, персонализированные взаимодействия, которые развиваются параллельно со стратегиями, предпочтениями и привычками самого учащегося. Они также не показывают, могут ли улучшения в одном аспекте (например, краткосрочном запоминании) сопровождаться ухудшением в других — таких как упорство, внутренняя мотивация или творческое решение проблем. В результате они упускают долгосрочные когнитивные эффекты, которые в конечном счете определяют, действительно ли ИИ улучшает обучение. 

Поскольку условия обучения сильно различаются в разных странах, учебных программах и институциональных целях, результаты разовых исследований редко применимы ко всем системам. Следовательно, подходы к оценке должны быть достаточно гибкими, чтобы различные образовательные системы могли определять, что означает успех в их контексте, оценивать ИИ по собственным стандартам и соответствующим образом корректировать процесс.

Создание лучшей системы оценки 

Основываясь на выводах из исследования режима обучения OpenAI, мы создали структурированную систему оценки для измерения влияния ИИ на учащихся в масштабе, а также механизм совершенствования моделей на основе этих результатов. Система опирается на три показателя: поведение модели, реакцию учащихся и измеримые когнитивные результаты, проявляющиеся с течением времени. Она включает в себя:  

  • Системные инструкции для уточнения поведения модели: использование естественного языка для изменения поведения модели по умолчанию с целью лучшего соответствия конкретным педагогическим подходам.
  • Классификаторы учебных взаимодействий: они автоматически обнаруживают «учебные моменты» во время реальных деперсонализированных взаимодействий между учащимся и моделью и размечают такие важные характеристики, как вовлеченность и исправление ошибок.
  • Инструменты оценки качества обучения (Learning quality graders): они оценивают и выставляют балл каждому такому учебному моменту в зависимости от того, достиг ли учащийся своей цели и в какой степени взаимодействие соответствовало строгим педагогическим принципам, включая выявление сбоев в работе.
  • Инструменты лонгитюдной оценки обучения: они отслеживают изменения во взаимодействии того же учащегося с моделью с течением времени (включая вовлеченность, упорство и метакогнитивные стратегии) как на индивидуальном уровне, так и на уровне когорт.
  • Стандартизированные когнитивные и метакогнитивные показатели: это прошедшие валидацию сторонние инструменты, предоставляемые через ChatGPT до, во время и после доступа, для установления базовых показателей и измерения изменений в фундаментальных способностях, таких как критическое мышление, креативность и память.

В совокупности эту систему оценки мы называем комплексом оценки результатов обучения (Learning Outcomes Measurement Suite). 

Она выдает важные сигналы, которые может использовать образовательная экосистема: структурированное представление учебных моментов, информационные панели, показывающие изменение результатов с течением времени по разным когортам, индикаторы производительности модели в сравнении с критериями преподавания и тьюторства, а также показатели результатов, соотнесенные со стандартизированными оценками и короткими анкетами для учащихся. Где это возможно, система может интегрировать предоставленные партнерами достоверные данные, такие как результаты экзаменов, наблюдения в классе или посещаемость.

Diagram illustrating a learning outcomes measurement workflow where AI processes data through analysis, evaluation, and verification steps before delivering insights to support a learner.

Все данные деперсонализированы

Это также позволяет нашим партнерам понимать более глубокие когнитивные эффекты от использования ИИ для обучения с течением времени, поскольку с помощью этой системы мы также можем отслеживать влияние на такие способности, как:

  • Автономная мотивация: степень, в которой учащиеся сами организуют свою учебу, а не следуют указаниям модели 
  • Продуктивная вовлеченность: частота, разнообразие и качество педагогических взаимодействий
  • Упорство при выполнении задач: степень, в которой учащийся сталкивается с когнитивными трудностями и преодолевает их
  • Метапознание: частота и качество усилий учащегося по планированию, осмыслению и мониторингу своих подходов к учебе
  • Запоминание (Recall): точность, с которой учащийся может вспомнить контент из предыдущих взаимодействий

Это отражает наши общие усилия, направленные не просто на узкие определения результатов обучения (рост тестовых баллов), а на целостные способности, лежащие в основе процесса познания. Это также отражает нашу уверенность в том, что универсального решения («серебряной пули») в вопросе того, что именно оптимизировать, не существует: системы и преподаватели должны иметь возможность находить баланс в соответствии с передовой педагогической практикой и подходами.

Наши дальнейшие шаги

Мы проводим валидацию набора инструментов для измерения результатов обучения (Learning Outcomes Measurement Suite) посредством масштабных исследований, прежде чем сделать его широко доступным. Эта работа ведется совместно с Тартуским университетом и инициативой SCALE Стэнфордского университета среди партнеров национального масштаба, таких как Эстония, где этот набор инструментов изучается с участием почти 20 000 студентов в возрасте 16–18 лет в течение нескольких месяцев. Использование инструментов студентами будет происходить в тесном сотрудничестве с местными руководителями, чтобы обеспечить безопасность и соответствие местным учебным программам.

«Эстония всегда рассматривала образование не как нечто статичное, а как систему, которую мы постоянно совершенствуем. Поскольку ИИ становится частью этой картины, главный вопрос заключается в том, как мы измеряем долгосрочное влияние ИИ на обучение. Именно это мы и выясняем в сотрудничестве с OpenAI. Студенты горят желанием участвовать в процессе разработки, и многие хотят научиться поддерживать обучение с помощью ИИ. Это кажется настоящим поворотным моментом, и мы рады внести свой вклад в создание методов, которые другие системы образования смогут использовать повторно и развивать дальше».
–Яан Ару, доцент Института компьютерных наук Тартуского университета

Эта работа опирается на более широкий комплекс совместных исследований. В дополнение к исследованиям результатов, проводимым через партнеров-основателей в Learning Lab, OpenAI поддерживает исследования на стыке обучения и рынка труда — изучая то, как ИИ формирует академические траектории студентов, их карьерные решения и то, как учебные заведения могут поддерживать ответственное внедрение технологий. Эти исследования проводятся в Университете Боккони, Innova Schools и школе бизнеса Tuck School of Business при Дартмутском университете, Государственном университете Сан-Диего, Университете Стоуни-Брук и других учреждениях.

По мере проведения долгосрочных исследований того, как учащиеся лучше всего осваивают материал с помощью ИИ, мы намерены делиться полученными результатами и работать с более широкой образовательной экосистемой, чтобы ИИ приносил пользу учащимся повсюду.

Те, ктоinterested в получении обновлений об этой работе, могут подписаться здесь.

Автор

OpenAI

Полный текст статьи читайте на OpenAI