End-to-end анонимизация текстов: найти, сгенерировать замену, сохранить целостность
Тезисы
End-to-end анонимизация: от поиска сущности до согласованной подстановки — практический разбор системы, которую мы используем для превращения персональных (sensitive) данных в обезличенные (insensitive) и подготовки датасетов для обучения. Покажу реальные архитектурные решения: как мы находим ПД в тексте, какие модели и данные применяем, и как работает генерация подстановок с морфосинтаксической адаптацией, сохраняющая целостность документа. Расскажу о встраивании инструмента в процессы компании через ClearML-пайплайн и о боевом опыте применения анонимизатора. В конце обсудим технические ограничения, подходы к валидации замен и опции кастомизации под разные сценарии.
End-to-end анонимизация: от поиска сущности до согласованной подстановки — практический разбор системы, которую мы используем для превращения персональных (sensitive) данных в обезличенные (insensitive) и подготовки датасетов для обучения. Покажу реальные архитектурные решения: как мы находим ПД в тексте, какие модели и данные применяем, и как работает генерация подстановок с морфосинтаксической адаптацией, сохраняющая целостность документа. Расскажу о встраивании инструмента в процессы компании через ClearML-пайплайн и о боевом опыте применения анонимизатора. В конце обсудим технические ограничения, подходы к валидации замен и опции кастомизации под разные сценарии.
Информация о спикере
Михаил Садов
Старший разработчик, MWS AI
https://ru.linkedin.com/in/mikhail-sadov-861956114 - LinkedIn
  • Михаил Садов
    Старший разработчик, MWS AI
    https://ru.linkedin.com/in/mikhail-sadov-861956114 - LinkedIn
Все доклады трека