Представляем OpenAI Privacy Filter

SEO-Introducing-OpenAi-Filter.png?w=1600

Наша передовая модель для маскировки персональных данных (PII) в тексте

Сегодня мы выпускаем OpenAI Privacy Filter — модель с открытыми весами для обнаружения и редактирования персональных данных (PII) в тексте. Этот релиз является частью нашей более широкой стратегии по поддержке более устойчивой экосистемы программного обеспечения путем предоставления разработчикам практической инфраструктуры для безопасной работы с ИИ, включая инструменты и модели, которые упрощают внедрение надежных средств защиты конфиденциальности и безопасности с самого начала.

Privacy Filter — это небольшая модель с передовыми возможностями обнаружения личных данных. Она создана для рабочих процессов с высокой пропускной способностью и способна осуществлять контекстно-зависимое обнаружение PII в неструктурированном тексте. Модель может работать локально, что означает маскировку или удаление персональных данных прямо на вашем устройстве. Она эффективно обрабатывает длинные тексты, принимая решения о цензурировании быстро и за один проход.

В OpenAI мы используем дообученную версию Privacy Filter в наших собственных рабочих процессах, сохраняющих конфиденциальность. Мы разработали эту модель, потому что верим: современные возможности ИИ позволяют поднять стандарты конфиденциальности на уровень выше того, что было представлено на рынке ранее. Выпускаемая нами сегодня версия Privacy Filter демонстрирует передовую производительность на бенчмарке PII-Masking-300k с учетом поправок на ошибки разметки, выявленные нами в ходе оценки.

С этим релизом разработчики смогут запускать Privacy Filter в собственных средах, дообучать модель под свои задачи и внедрять более надежные средства защиты конфиденциальности в процессы обучения, индексации, логирования и проверки.

Небольшая модель с передовыми возможностями обнаружения персональных данных

Защита конфиденциальности в современных системах ИИ требует большего, чем просто сопоставление по шаблонам. Традиционные инструменты обнаружения PII часто полагаются на детерминированные правила для форматов вроде телефонных номеров и адресов электронной почты. Они хорошо справляются в узких сценариях, но часто упускают более тонкую личную информацию и испытывают трудности с контекстом.

Privacy Filter создана с учетом глубокого понимания языка и контекста для более точной работы. Сочетая сильное языковое понимание со специализированной системой разметки конфиденциальности, она способна обнаруживать более широкий спектр PII в неструктурированном тексте, включая случаи, когда правильное решение зависит от контекста. Модель лучше различает информацию, которую следует сохранить, поскольку она является публичной, и информацию, которую нужно замаскировать или отредактировать, поскольку она относится к частному лицу.

В результате получается модель, достаточно мощная для обеспечения фильтрации конфиденциальности на передовом уровне. При этом она достаточно компактна для локального запуска: это означает, что данные, подлежащие фильтрации, могут оставаться на устройстве с меньшим риском утечки, и их не нужно отправлять на сервер для обезличивания.

Обзор модели

Privacy Filter — это двунаправленная модель токенной классификации с декодированием диапазонов (span decoding). Она берет начало из авторегрессионной предобученной контрольной точки, а затем адаптируется в классификатор токенов на основе фиксированной таксономии меток конфиденциальности. Вместо генерации текста токен за токеном модель размечает входную последовательность за один проход, а затем декодирует когерентные фрагменты с помощью ограниченной процедуры Витерби.

Такая архитектура наделяет Privacy Filter несколькими полезными свойствами для практического использования:

  • Быстрота и эффективность: все токены размечаются за один прямой проход.
  • Контекстная осведомленность: языковой предприор позволяет обнаруживать фрагменты PII на основе окружающего контекста.
  • Работа с длинным контекстом: выпущенная модель поддерживает контекст до 128 000 токенов.
  • Настраиваемость: разработчики могут регулировать рабочие точки для балансировки полноты и точности в зависимости от своего рабочего процесса.

Выпущенная модель имеет 1,5 млрд параметров в общей сложности и 50 млн активных параметров.

Privacy Filter прогнозирует фрагменты по восьми категориям:

  • private_person
  • private_address
  • private_email
  • private_phone
  • private_url
  • private_date
  • account_number
  • secret

Категория account_number помогает маскировать самые разные номера счетов, включая банковские данные (номера кредитных карт и банковских счетов), в то время как secret помогает скрывать такие данные, как пароли и ключи API.

Эти метки декодируются с помощью тегов диапазонов BIOES, что позволяет получать более чистые и когерентные границы маскировки.

Пример исходного текста

Subject: Q2 Planning Follow-Up

Hi Jordan,

Thanks again for meeting earlier today. I wanted to follow up with the revised timeline for the Q2 rollout and confirm that the product launch is scheduled for September 18, 2026. For reference, the project file is listed under 4829–1037–5581. If anything changes on your side, feel free to reply here at maya.chen@example.com or call me at +1 (415) 555–0124.

Best,

Maya Chen

Текст после маскировки персональных идентификаторов

Subject: Q2 Planning Follow-Up

Hi [PRIVATE_PERSON],

Thanks again for meeting earlier today. I wanted to follow up with the revised timeline for the Q2 rollout and confirm that the product launch is scheduled for [PRIVATE_DATE]. For reference, the project file is listed under [ACCOUNT_NUMBER]. If anything changes on your side, feel free to reply here at [PRIVATE_EMAIL] or call me at [PRIVATE_PHONE].

Best,

[PRIVATE_PERSON]

Как мы создавали модель

Мы разрабатывали Privacy Filter в несколько этапов.

Во-первых, мы создали таксономию конфиденциальности, которая определяет типы диапазонов, обнаруживаемых моделью. Сюда входят персональные идентификаторы, контактные данные, адреса, конфиденциальные даты, различные виды номеров счетов (например, данные кредитных карт и банковских счетов), а также секретные данные вроде ключей API и паролей.

Во-вторых, мы преобразовали предобученную языковую модель в двунаправленный токенный классификатор, заменив голову языкового моделирования на голову классификации токенов и дообучив ее с использованием целевой функции контролируемой классификации.

В-третьих, мы провели обучение на смеси общедоступных и синтетических данных, призванных отразить как реалистичный текст, так и сложные шаблоны конфиденциальности. На тех участках публичных данных, где разметка была неполной, мы использовали аннотирование и проверку с помощью моделей для улучшения покрытия. Мы также сгенерировали синтетические примеры, чтобы повысить разнообразие форматов, контекстов и подтипов конфиденциальности.

На этапе вывода предсказания модели на уровне токенов декодируются в когерентные диапазоны с помощью декодирования с ограничениями последовательности. Такой подход сохраняет широкое понимание языка, присущее предобученной модели, адаптируя ее при этом под задачи обнаружения конфиденциальных данных.

Производительность Privacy Filter

Мы оценили работу Privacy Filter на стандартных бенчмарках, а также на дополнительных синтетических и чат-тестах, предназначенных для проверки более сложных и чувствительных к контексту сценариев.

На бенчмарке PII-Masking-300k модель Privacy Filter достигает F1-оценки в 96% (точность 94,04% и полнота 98,04%). На скорректированной версии бенчмарка, учитывающей проблемы разметки датасета, выявленные при проверке, F1-оценка составляет 97,43% (точность 96,79% и полнота 98,08%).

Мы также выяснили, что модель поддается эффективной адаптации. Дообучение даже на небольшом объеме данных быстро повышает точность в специализированных задачах, увеличивая F1-оценку с 54% до 96% и приближаясь к насыщению на оцениваемом бенчмарке адаптации к предметной области.

Помимо результатов на бенчмарках, Privacy Filter создана для практической фильтрации конфиденциальных данных в зашумленных текстах реального мира. Это включает длинные документы, неоднозначные ссылки, строки смешанного формата и секреты, связанные с программным обеспечением. В карточке модели также приведены данные целевой оценки обнаружения секретов в кодовых базах и стресс-тестов на мультиязычных, состязательных и контекстно-зависимых примерах.

Ограничения

Privacy Filter не является инструментом полной анонимизации, сертификатом соответствия требованиям или заменой проверки политик безопасности в условиях высоких ставок. Это лишь один из компонентов комплексной системы обеспечения конфиденциальности на этапе проектирования (privacy-by-design).

Ее поведение отражает таксономию меток и границы принятия решений, на которых она обучалась. Различным организациям могут требоваться свои политики обнаружения или маскировки, и эти политики могут потребовать оценки в рамках предметной области или дополнительного дообучения. Производительность также может варьироваться в зависимости от языков, систем письменности, соглашений об именовании и доменов, отличающихся от обучающего распределения.

Как и любые модели, Privacy Filter может ошибаться. Она может пропустить необычные идентификаторы или двусмысленные личные ссылки, а также избыточно или недостаточно отредактировать сущности при ограниченном контексте, особенно в коротких последовательностях. В особо чувствительных областях (таких как юридические, медицинские и финансовые рабочие процессы) по-прежнему важны проверка человеком, а также оценка и дообучение под конкретную предметную область.

Доступность

Мы выпускаем OpenAI Privacy Filter, чтобы способствовать усилению защиты конфиденциальности по всей экосистеме.

Модель доступна сегодня по лицензии Apache 2.0 на платформах Hugging Face и GitHub. Она предназначена для экспериментов, кастомизации и коммерческого развертывания, и ее можно дообучать под различные распределения данных и политики конфиденциальности.

Вместе с моделью мы публикуем документацию, описывающую архитектуру модели, таксономию меток, элементы управления декодированием, целевые сценарии использования, настройки оценки и известные ограничения, чтобы команды могли четко понимать как сильные стороны модели, так и области, где ее следует использовать с осторожностью.

Взгляд в будущее

Защита конфиденциальности для систем ИИ — это непрерывный процесс, охватывающий исследования, дизайн продуктов, оценку и развертывание.

Privacy Filter отражает одно из направлений, которое мы считаем важным: небольшие, эффективные модели с передовыми возможностями в узкоспециализированных задачах, имеющих значение для реальных систем ИИ. Мы выпускаем ее, потому что считаем: инфраструктура защиты конфиденциальности должна быть проще для проверки, запуска, адаптации и улучшения.

Наша цель — сделать так, чтобы модели изучали мир, а не частных лиц. Privacy Filter помогает воплотить это в жизнь.

Мы выпускаем эту предварительную версию Privacy Filter, чтобы получить отзывы от исследовательского сообщества и экспертов по конфиденциальности и продолжить совершенствовать производительность модели.

Автор

OpenAI

Полный текст статьи читайте на OpenAI