OpenAI назвала четыре вещи, которые должны протестировать специалисты по безопасности
- OpenAI опубликовала документ Ламы Ахмад с четырьмя направлениями оценки и семью принципами для сторонних экспертов по безопасности.
- Специалисты получат доступ в режиме «серого ящика» для анализа обоснований безопасности, защитных мер, критических рисков и инцидентов.
- Проверки не будут привязаны к релизам продуктов, а их проведение займет от нескольких недель до нескольких месяцев.
Почему это важно: Независимый доступ позволит внешним экспертам выявлять неучтенные риски, подвергать сомнению допущения разработчиков и оценивать эффективность защиты OpenAI.

Этот доступ должен позволить экспертам подвергать сомнению наши допущения, выявлять риски, которые мы могли упустить, и делать собственные выводы об эффективности наших средств защиты.
OpenAI опубликовала это во вторник в документе, определяющем требования компании к сторонним экспертам по безопасности. Автор документа — Лама Ахмад (Lama Ahmad), которая руководит работой компании с внешними экспертами по безопасности.
Компания сообщила во вторник, что откроет свои модели для независимой проверки на более ранних этапах разработки. Данный документ дополняет это заявление. В нем выделены четыре направления для оценки и семь принципов организации этой работы.
Два определения, от которых зависит все остальное
Заявление о безопасности (safety claim), согласно определению OpenAI, — это конкретное утверждение о модели, влияющее на ее безопасность. Его можно проверить с помощью фактических данных. В заявлении должны быть указаны риски и условия, которые оно охватывает, а также допущения и ограничения.
Обоснование безопасности (safety case) объединяет эти утверждения в единый структурированный аргумент. Оно объясняет, почему компания должным образом управляет рисками того или иного вида деятельности. В нем также должны быть указаны допущения, неопределенности и все оставшиеся риски.
Сэм Альтман использовал тот же термин на прошлой неделе. Он выступил за размеренный темп, а не за остановку разработок, в рамках федеральной структуры, построенной на обоснованиях безопасности.
Четыре направления
Первое — это независимая оценка самих обоснований безопасности. Она охватывает этапы обучения, оценки, внутреннего и внешнего развертывания. OpenAI рассчитывает, что несколько экспертных групп разделят обязанности в соответствии со своей специализацией. Оценивается обоснованность доказательств, проверяется, действительно ли команда соблюдала условия безопасности, а также выясняется, не поощряют ли методы обучения обман, хакерские атаки или обход ограничений.
Второе — это комплекс защитных мер (safeguard stack). OpenAI хочет, чтобы эксперты работали в режиме так называемого «серого ящика» (grey box access). Они будут проверять, выдерживают ли средства защиты попытки взлома (jailbreak) и предотвращают ли они наращивание возможностей в кибернетической и биологической сферах.
Компания также запрашивает проведение авторизованного тестирования в реалистичных условиях эксплуатации. Как ИИ-агенты взаимодействуют с контролем доступа, изолированной средой (sandbox), а также с системами обнаружения и реагирования? Какие средства защиты предотвращают, обнаруживают или сдерживают вредоносные действия, а какие дают сбой?
Три вопроса в этом разделе направлены непосредственно к самой компании. Имеются ли пробелы в мониторинге несоответствия целей (misalignment), которые могут привести к потере контроля? Осуществляется ли мониторинг на этапах обучения, оценки и развертывания таким образом, чтобы его никто не мог легко отключить? И насколько надежным остается мониторинг цепочки рассуждений (chain-of-thought) по мере роста возможностей моделей?
Третье направление охватывает оценку возможностей в рамках структуры готовности (Preparedness Framework), которая отслеживает химические и биологические риски, кибербезопасность и самосовершенствование ИИ. OpenAI задается вопросом, правильно ли она устанавливает свои пороговые значения. Она также спрашивает, обновляются ли оценки по мере того, как модели начинают их превосходить.
Четвертое направление — независимое расследование инцидентов, связанных с отклонением от заданного поведения (misalignment). В качестве примера OpenAI приводит собственный инцидент с Hugging Face. От исследователей потребуются навыки киберкриминалистики, экспертиза в области выравнивания (alignment), а также способность анализировать цепочки рассуждений в больших масштабах.
Чего принципы требуют от обеих сторон
Обе стороны должны сначала согласовать масштаб работ, а затем предварительно зарегистрировать утверждения до начала любой оценки. OpenAI требует открыто указывать, исходило ли конкретное утверждение от компании или от эксперта. В выводах должно быть четко сказано, что именно осталось за рамками оценки.
Эксперты должны получить доступ, соразмерный заявленным требованиям, с соблюдением требований законодательства, безопасности и интеллектуальной собственности. Если прямой доступ невыполним, в документе предлагается обратиться к назначенному представителю компании или использовать механизмы сохранения конфиденциальности.
Они также должны объяснить свои методы, критерии и неопределенности. В отчетах следует разграничивать прямые выводы и их интерпретацию. Если стандарты еще не существуют, эксперты обязаны обосновать выбранные ими критерии.
Что касается независимости, эксперты должны раскрывать информацию о конфликте интересов. Это касается финансовых стимулов, отношений с разработчиками и предварительного участия в проверяемой работе. OpenAI предлагает установить периоды самоотвода или исключения, а также заявляет, что схемы вознаграждения не должны влиять на результаты.
Сами выводы должны быть достаточно конкретными, чтобы по ним можно было принять меры. OpenAI просит экспертов выявлять конкретные пробелы с достаточной детализацией, чтобы лаборатория могла их устранить. Там, где это уместно, в отчетах также следует формулировать уроки для разработчиков, специалистов по внедрению и защите от агентов.
Пункты, выгодные для лаборатории
Три из семи принципов дают компании определенные прерогативы.
Если эксперты не могут обеспечить требования безопасности в собственных средах или если данные представляют особую чувствительность, OpenAI допускает проведение работ на управляемых компанией устройствах или в ее помещениях.
В соответствующих случаях лабораториям должен предоставляться разумный срок для устранения проблем до публикации. В документе не указана продолжительность этого периода.
Что касается публикации, лаборатории могут запросить редактирование конфиденциальной информации. За экспертами сохраняется редакционная независимость. Они могут отметить факты существенного редактирования и то, как именно эти правки повлияли на отчет.
Контекст, который остался за рамками документа
OpenAI заявляет, что уже предоставила экспертам видимый доступ к цепочкам рассуждений. Компания также заявляет о беспрецедентном уровне доступа к конфиденциальным данным и внутренним развертываниям.
Структура готовности (Preparedness Framework) лежит в основе третьего приоритетного направления. В августе OpenAI распустила команду, которая занималась этим вопросом, передав работу другим подразделениям.
Тема финансирования никак не затронута. В Калифорнии законопроект Сената 813 (Senate Bill 813) создал механизм для организаций по независимой верификации>, и вопрос о том, кто именно платит экспертам, остается открытым с момента появления моделей.
Документ также опирается на две публикации OpenAI за последнюю неделю. Первая — это ее призыв к стандартам, опубликованный в понедельник, в котором утверждается, что Соединенные Штаты должны возглавить международные усилия в области передового ИИ. Вторая — это структура отчетности по несоответствию целей, опубликованная 16 сентября.
Кто будет этим заниматься на практике
OpenAI заявляет, что ведет переговоры с несколькими третьими сторонами по поводу предложений, соответствующих этим направлениям. Ни одно из имен не называется.
Компания отмечает, что ни один отдельный эксперт не может и не должен решать насущные вопросы безопасности передовых технологий в одиночку. Она добавляет, что будет действовать взвешенно по мере развития экосистемы независимой оценки.
Описанные здесь оценки не привязаны к конкретным релизам или запускам. Некоторые из них займут несколько недель, другие — несколько месяцев.
Опубликовано 22 сентября 2026 — 12:20 Наверх
Это перевод статьи автора Ana Maria Constantin, опубликованной на The Next Web.
Читать оригинал на thenextweb.com →
© The Next Web (перевод: TheNextWeb.ru)
Об этом также пишут
- OpenAI Наша обновленная концепция готовности (Preparedness Framework) 15.04.2025 00:00
