Темы



Бывший менеджер по безопасности покинул OpenAI и обвинил компанию в разрушении культуры безопасности

Безопасность в сфере искусственного интеллекта обсуждают все чаще. Компании соревнуются в скорости выпуска новых моделей. Недавний уход сотрудника OpenAI показал, что внутри самой компании есть серьезные разногласия по этому поводу.

755253_O.jpg

Изображение — ChatGPT

Дэвид Робинсон пришел в OpenAI три с половиной года назад. За это время он подготовил отчёты о безопасности для двенадцати крупных запусков. Он же стоял у истоков системы, которая оценивает готовность моделей к выходу. В начале октября он уволился. Свои причины он изложил в статье для The Atlantic.

Робинсону не нравится подход, который в компании называют итеративным развертыванием. Логика проста: сначала выпустить продукт, потом найти слабые места и укрепить защиту. По его мнению, такой путь обязательно приведет к сбоям. И чем мощнее становятся модели, тем серьезнее будут последствия.

Он вспоминает случай с Hugging Face минувшим летом. Тогда OpenAI случайно выпустила группу агентов. Позже одна из обучающихся моделей нашла способ обойти ограничения на доступ в интернет. Система слежения подала сигнал сотрудникам, но модель не отключили. Робинсон упоминает и Anthropic, которая сама признала: ее защитные механизмы отключились из-за ошибки в настройках. По его словам, такие истории — норма для отрасли.

Робинсон убежден, что одних законов мало. Нужно менять культуру. Лаборатории, работающие над передовыми моделями, должны быть устроены как атомные электростанции или крупные аэропорты. Там несколько уровней страховки, чтобы человеческая ошибка не привела к катастрофе. Он признается, что не встречал коллег с опытом работы на АЭС или в авиации. Еще один его тезис: прежде чем создавать более совершенные модели, нужно провести новые исследования. Сегодняшние тесты не дают надежного ответа на вопрос, разделяет ли модель человеческие ценности. Модель может понять, что ее проверяют, и после выпуска вести себя иначе.

При этом Робинсон не ругает все подряд. Коллег он называет умными и старательными. Саму технологию — полезной. Его беспокоит темп: OpenAI перескакивает с одного запуска на другой слишком быстро. После увольнения он обратился в PR-агентство Spitfire Strategies. Представитель OpenAI Дрю Пусатери в разговоре с TechCrunch сказал, что компания следит за безопасностью и при необходимости приостанавливает обучение или сдерживает выпуск моделей.

Для обычных пользователей ChatGPT пока ничего не изменилось. Отчеты, которые готовил Робинсон, известны как системные карточки. В них описано, какие риски проверили и какие меры защиты применили. Это самый подробный публичный документ о тестировании каждой модели. Уход Робинсона совпал с запуском Dots — агентов, работающих на облачных компьютерах от имени пользователя. В тот же день OpenAI сообщила более чем ста организациям о своих тестовых агентах. Робинсон предупреждает: сбои будут учащаться и становиться серьезнее по мере роста возможностей систем.

©  overclockers.ru

Об этом также пишут