Полуконтролируемый перенос знаний для глубокого обучения на основе конфиденциальных обучающих данных

Аннотация
Некоторые приложения машинного обучения используют конфиденциальные обучающие данные, такие как медицинские истории пациентов в ходе клинических испытаний. Модель может непреднамеренно и неявно сохранять часть своих обучающих данных; следовательно, тщательный анализ модели может раскрыть конфиденциальную информацию.
Для решения этой проблемы мы демонстрируем общеприменимый подход к обеспечению строгих гарантий конфиденциальности обучающих данных: частную агрегацию ансамблей учителей (Private Aggregation of Teacher Ensembles, PATE). Этот подход объединяет «чёрным ящиком» несколько моделей, обученных на непересекающихся наборах данных, таких как записи из различных подмножеств пользователей. Поскольку они напрямую используют конфиденциальные данные, эти модели не публикуются, а вместо этого используются в качестве «учителей» для модели «ученика». Ученик учится прогнозировать результат, выбранный посредством зашумленного голосования среди всех учителей, и не имеет прямого доступа к какому-либо отдельному учителю, исходным данным или параметрам. Свойства конфиденциальности ученика понятны как интуитивно (поскольку ни один отдельный учитель и, следовательно, ни один отдельный набор данных не диктует обучение ученика), так и формально — с точки зрения дифференциальной конфиденциальности. Эти свойства сохраняются даже в том случае, если злоумышленник может не только делать запросы к ученику, но и изучать его внутреннее устройство.
По сравнению с предыдущими работами, данный подход накладывает лишь слабые предположения на то, как обучаются учителя: он применим к любой модели, включая невыпуклые модели, такие как глубокие нейронные сети (DNN). Мы достигаем передовых (state-of-the-art) компромиссов между конфиденциальностью и полезностью на наборах данных MNIST и SVHN благодаря улучшенному анализу конфиденциальности и полуконтролируемому обучению.
Авторы
Полный текст статьи читайте на OpenAI
