Темы



OpenAI назвала четыре вещи, которые должны протестировать специалисты по безопасности

Коротко сгенерировано ИИ по тексту статьи
  • OpenAI опубликовала документ Ламы Ахмад с четырьмя направлениями оценки и семью принципами для сторонних экспертов по безопасности.
  • Специалисты получат доступ в режиме «серого ящика» для анализа обоснований безопасности, защитных мер, критических рисков и инцидентов.
  • Проверки не будут привязаны к релизам продуктов, а их проведение займет от нескольких недель до нескольких месяцев.

Почему это важно: Независимый доступ позволит внешним экспертам выявлять неучтенные риски, подвергать сомнению допущения разработчиков и оценивать эффективность защиты OpenAI.

openai-logo-smartphone-laptop-zac-wolff-unsplash.jpg

Этот доступ должен позволить экспертам подвергать сомнению наши допущения, выявлять риски, которые мы могли упустить, и делать собственные выводы об эффективности наших средств защиты.

OpenAI опубликовала это во вторник в документе, определяющем требования компании к сторонним экспертам по безопасности. Автор документа — Лама Ахмад (Lama Ahmad), которая руководит работой компании с внешними экспертами по безопасности.

Компания сообщила во вторник, что откроет свои модели для независимой проверки на более ранних этапах разработки. Данный документ дополняет это заявление. В нем выделены четыре направления для оценки и семь принципов организации этой работы.

Два определения, от которых зависит все остальное

Заявление о безопасности (safety claim), согласно определению OpenAI, — это конкретное утверждение о модели, влияющее на ее безопасность. Его можно проверить с помощью фактических данных. В заявлении должны быть указаны риски и условия, которые оно охватывает, а также допущения и ограничения.

Обоснование безопасности (safety case) объединяет эти утверждения в единый структурированный аргумент. Оно объясняет, почему компания должным образом управляет рисками того или иного вида деятельности. В нем также должны быть указаны допущения, неопределенности и все оставшиеся риски.

Сэм Альтман использовал тот же термин на прошлой неделе. Он выступил за размеренный темп, а не за остановку разработок, в рамках федеральной структуры, построенной на обоснованиях безопасности.

Четыре направления

Первое — это независимая оценка самих обоснований безопасности. Она охватывает этапы обучения, оценки, внутреннего и внешнего развертывания. OpenAI рассчитывает, что несколько экспертных групп разделят обязанности в соответствии со своей специализацией. Оценивается обоснованность доказательств, проверяется, действительно ли команда соблюдала условия безопасности, а также выясняется, не поощряют ли методы обучения обман, хакерские атаки или обход ограничений.

Второе — это комплекс защитных мер (safeguard stack). OpenAI хочет, чтобы эксперты работали в режиме так называемого «серого ящика» (grey box access). Они будут проверять, выдерживают ли средства защиты попытки взлома (jailbreak) и предотвращают ли они наращивание возможностей в кибернетической и биологической сферах.

Компания также запрашивает проведение авторизованного тестирования в реалистичных условиях эксплуатации. Как ИИ-агенты взаимодействуют с контролем доступа, изолированной средой (sandbox), а также с системами обнаружения и реагирования? Какие средства защиты предотвращают, обнаруживают или сдерживают вредоносные действия, а какие дают сбой?

Три вопроса в этом разделе направлены непосредственно к самой компании. Имеются ли пробелы в мониторинге несоответствия целей (misalignment), которые могут привести к потере контроля? Осуществляется ли мониторинг на этапах обучения, оценки и развертывания таким образом, чтобы его никто не мог легко отключить? И насколько надежным остается мониторинг цепочки рассуждений (chain-of-thought) по мере роста возможностей моделей?

Третье направление охватывает оценку возможностей в рамках структуры готовности (Preparedness Framework), которая отслеживает химические и биологические риски, кибербезопасность и самосовершенствование ИИ. OpenAI задается вопросом, правильно ли она устанавливает свои пороговые значения. Она также спрашивает, обновляются ли оценки по мере того, как модели начинают их превосходить.

Четвертое направление — независимое расследование инцидентов, связанных с отклонением от заданного поведения (misalignment). В качестве примера OpenAI приводит собственный инцидент с Hugging Face. От исследователей потребуются навыки киберкриминалистики, экспертиза в области выравнивания (alignment), а также способность анализировать цепочки рассуждений в больших масштабах.

Чего принципы требуют от обеих сторон

Обе стороны должны сначала согласовать масштаб работ, а затем предварительно зарегистрировать утверждения до начала любой оценки. OpenAI требует открыто указывать, исходило ли конкретное утверждение от компании или от эксперта. В выводах должно быть четко сказано, что именно осталось за рамками оценки.

Эксперты должны получить доступ, соразмерный заявленным требованиям, с соблюдением требований законодательства, безопасности и интеллектуальной собственности. Если прямой доступ невыполним, в документе предлагается обратиться к назначенному представителю компании или использовать механизмы сохранения конфиденциальности.

Они также должны объяснить свои методы, критерии и неопределенности. В отчетах следует разграничивать прямые выводы и их интерпретацию. Если стандарты еще не существуют, эксперты обязаны обосновать выбранные ими критерии.

Что касается независимости, эксперты должны раскрывать информацию о конфликте интересов. Это касается финансовых стимулов, отношений с разработчиками и предварительного участия в проверяемой работе. OpenAI предлагает установить периоды самоотвода или исключения, а также заявляет, что схемы вознаграждения не должны влиять на результаты.

Сами выводы должны быть достаточно конкретными, чтобы по ним можно было принять меры. OpenAI просит экспертов выявлять конкретные пробелы с достаточной детализацией, чтобы лаборатория могла их устранить. Там, где это уместно, в отчетах также следует формулировать уроки для разработчиков, специалистов по внедрению и защите от агентов.

Пункты, выгодные для лаборатории

Три из семи принципов дают компании определенные прерогативы.

Если эксперты не могут обеспечить требования безопасности в собственных средах или если данные представляют особую чувствительность, OpenAI допускает проведение работ на управляемых компанией устройствах или в ее помещениях.

В соответствующих случаях лабораториям должен предоставляться разумный срок для устранения проблем до публикации. В документе не указана продолжительность этого периода.

Что касается публикации, лаборатории могут запросить редактирование конфиденциальной информации. За экспертами сохраняется редакционная независимость. Они могут отметить факты существенного редактирования и то, как именно эти правки повлияли на отчет.

Контекст, который остался за рамками документа

OpenAI заявляет, что уже предоставила экспертам видимый доступ к цепочкам рассуждений. Компания также заявляет о беспрецедентном уровне доступа к конфиденциальным данным и внутренним развертываниям.

Структура готовности (Preparedness Framework) лежит в основе третьего приоритетного направления. В августе OpenAI распустила команду, которая занималась этим вопросом, передав работу другим подразделениям.

Тема финансирования никак не затронута. В Калифорнии законопроект Сената 813 (Senate Bill 813) создал механизм для организаций по независимой верификации>, и вопрос о том, кто именно платит экспертам, остается открытым с момента появления моделей.

Документ также опирается на две публикации OpenAI за последнюю неделю. Первая — это ее призыв к стандартам, опубликованный в понедельник, в котором утверждается, что Соединенные Штаты должны возглавить международные усилия в области передового ИИ. Вторая — это структура отчетности по несоответствию целей, опубликованная 16 сентября.

Кто будет этим заниматься на практике

OpenAI заявляет, что ведет переговоры с несколькими третьими сторонами по поводу предложений, соответствующих этим направлениям. Ни одно из имен не называется.

Компания отмечает, что ни один отдельный эксперт не может и не должен решать насущные вопросы безопасности передовых технологий в одиночку. Она добавляет, что будет действовать взвешенно по мере развития экосистемы независимой оценки.

Описанные здесь оценки не привязаны к конкретным релизам или запускам. Некоторые из них займут несколько недель, другие — несколько месяцев.

Опубликовано 22 сентября 2026 — 12:20 Наверх

Это перевод статьи автора Ana Maria Constantin, опубликованной на The Next Web.

Читать оригинал на thenextweb.com →

©  The Next Web (перевод: TheNextWeb.ru)

Об этом также пишут