Темы



Физики из США оценили опасность локальных моделей ИИ с помощью математической формулы

Коротко сгенерировано ИИ по тексту статьи
  • Физики Нил Джонсон и Фрэнк Инцзе Хо из Университета Джорджа Вашингтона представили в журнале Patterns формулу для оценки перехода модели к вредному ответу.
  • Модель может выдать длинную серию безобидных ответов, прежде чем незаметно перейти к нежелательному выводу.

Почему это важно: Это важно для пользователей офлайн-моделей в медицинской, юридической и военной сферах: у таких моделей нет внешних фильтров безопасности.

Использование языковых моделей непосредственно на конечных устройствах, таких как смартфоны или планшеты, растет во всех отраслях. Поскольку эти так называемые модели Edge-ИИ (ИИ на периферийных устройствах) работают локально и без подключения к облаку, в них отсутствуют традиционные внешние фильтры безопасности — так называемые «защитные барьеры» (guardrails).

755877_O.pngИзображение: нейросеть qwen

Это создает риски для пользователей, зависящих от офлайн-моделей, например, в медицинской, юридической или военной сферах. Два физика из Университета Джорджа Вашингтона (США) теперь намерены точнее оценивать подобные риски с помощью математической формулы.

В исследовании опубликованном в научном журнале Patterns, Нил Ф. Джонсон и Фрэнк Инцзе Хо (Frank Yingjie Huo) представили уравнение, позволяющее рассчитать, когда языковая модель может перейти от корректного ответа к потенциально вредному.

Для своего исследования ученые выбрали подход, позволяющий математически свести сложные нейронные сети к так называемому «эффективному механизму внимания» (effective attention head). Этот компонент современных языковых моделей вычисляет степень взаимосвязи между отдельными фрагментами текста в общем контексте. Он определяет, на какую информацию ИИ направляет свое «внимание» в процессе обработки. Затем исследователи применили свои методы анализа именно к тому, как этот компонент обрабатывает данные.

По мнению физиков, механизмы работы моделей ИИ схожи с поведением сложных твердых тел, свойства которых зачастую можно объяснить, наблюдая за отдельным атомом.

Внутри модели обрабатываемая информация проходит через так называемый «остаточный поток» (residual stream). Этот центральный канал передачи данных последовательно перенаправляет входную информацию от одного слоя нейронной сети к другому. В процессе этого движения при каждом запросе различные варианты ответа постоянно конкурируют друг с другом. Исследователи рассматривают лежащие в основе математические величины (векторы), соответствующие желательным и нежелательным вариантам вывода, как впадины на ландшафте.

Модель ИИ может переключиться на вредоносный ответ, если контекст диалога в большей степени способствует выбору из области нежелательных ответов, чем из области желательных. Формула, разработанная Джонсоном и Хо, описывает это соперничество и призвана определить момент, когда будет преодолен порог перехода к нежелательному выводу.

Исследование показывает, что проблемный переход в процессе генерации текста не обязательно происходит сразу же на этапе формирования первого токена. Модель может сначала выдать длинную серию ответов, не вызывающих нареканий по содержанию, прежде чем незаметно «соскользнуть» в проблемную область.

©  overclockers.ru