Маскирование данных

Маскирование данных — это когда личные данные заменяют меткой перед отправкой в модель, а после ответа возвращают на место.

Что это

Телефон, почту, номер карты и прочие личные данные заменяют условной меткой до того, как текст уйдёт в языковую модель. Модель работает с меткой вроде {ТЕЛЕФОН} и настоящих цифр не видит вообще. Когда ответ возвращается, метки разворачиваются обратно в реальные значения.

Зачем это нужно: языковые модели чаще всего крутятся на серверах за границей, и отправка туда реальных персональных данных — лишний риск плюс отдельный юридический сюжет, который называют трансграничной передачей. Метка снимает часть риска на уровне техники, а не строчкой в политике конфиденциальности: если на стороне модели что-то пойдёт не так, утекать оттуда будет нечему.

Пример

>

Отдельная ловушка

Даже с маскированием остаётся риск, о котором редко думают, — кэш ответов. Сервисы кэшируют одинаковые вопросы, чтобы не платить за них дважды. Если в кэш случайно попадёт ответ с чьими-то данными, следующий посетитель с похожим вопросом теоретически может его увидеть. Правильное поведение — не переиспользовать между разными людьми ответы, где данные уже вернулись на место. Спросить об этом стоит любой сервис, которым вы пользуетесь, даже если вопрос выглядит въедливым.

Маскирование — только часть того, что нужно знать про личные данные в чате. Согласие, политика на сайте, уведомление в Роскомнадзор и трансграничная передача разобраны в статье чат на сайте и 152-ФЗ.

Читайте дальше