Настроить Cookies
Мы используем Cookies для улучшения работы сайта
Настроить Cookies
Настройки Cookies
Файлы cookie, необходимые для корректной работы сайта, всегда включены. Другие файлы cookie можно настроить.
Основные файлы cookie
Всегда включены. Эти файлы cookie необходимы для работы веб-сайта и его функций. Их нельзя отключить. Они устанавливаются в ответ на ваши запросы, например, при настройке параметров конфиденциальности, входе в систему или заполнении форм.
Аналитические файлы cookie
Disabled
Эти файлы cookie собирают информацию, которая помогает нам понять, как используются наши веб-сайты, насколько эффективны наши маркетинговые кампании, а также помогает нам персонализировать наши веб-сайты для вас.
Рекламные файлы cookie
Disabled
Эти файлы cookie предоставляют рекламным компаниям информацию о вашей активности в интернете, чтобы помочь им показывать вам более релевантную рекламу или ограничивать количество показов рекламы. Эта информация может быть передана другим рекламным компаниям.
End-to-end анонимизация текстов: найти, сгенерировать замену, сохранить целостность
Тезисы
End-to-end анонимизация: от поиска сущности до согласованной подстановки — практический разбор системы, которую мы используем для превращения персональных (sensitive) данных в обезличенные (insensitive) и подготовки датасетов для обучения. Покажу реальные архитектурные решения: как мы находим ПД в тексте, какие модели и данные применяем, и как работает генерация подстановок с морфосинтаксической адаптацией, сохраняющая целостность документа. Расскажу о встраивании инструмента в процессы компании через ClearML-пайплайн и о боевом опыте применения анонимизатора. В конце обсудим технические ограничения, подходы к валидации замен и опции кастомизации под разные сценарии.
End-to-end анонимизация: от поиска сущности до согласованной подстановки — практический разбор системы, которую мы используем для превращения персональных (sensitive) данных в обезличенные (insensitive) и подготовки датасетов для обучения. Покажу реальные архитектурные решения: как мы находим ПД в тексте, какие модели и данные применяем, и как работает генерация подстановок с морфосинтаксической адаптацией, сохраняющая целостность документа. Расскажу о встраивании инструмента в процессы компании через ClearML-пайплайн и о боевом опыте применения анонимизатора. В конце обсудим технические ограничения, подходы к валидации замен и опции кастомизации под разные сценарии.
Информация о спикере
Михаил Садов
Старший разработчик, MWS AI
https://ru.linkedin.com/in/mikhail-sadov-861956114 - LinkedIn
  • Михаил Садов
    Старший разработчик, MWS AI
    https://ru.linkedin.com/in/mikhail-sadov-861956114 - LinkedIn
Все доклады трека