Построение защиты LLM и агентов: контроль, guardrail-подходы и их валидация
Тезисы
При автоматизации бизнес-процессов с помощью LLM и мультиагентных систем ошибка модели может быстро стать инцидентом: утечкой персональных данных, обходом внутренних политик, выполнением опасных действий через tools или потерей контроля над частью инфраструктуры. В докладе разберём, какие риски возникают в LLM-приложениях, почему их нельзя закрыть только промптами или дообучением модели и где за безопасность приходится платить качеством. Поговорим о guardrail-подходах на уровне архитектуры: контроле входов и выходов, работе с контекстом, black-box и white-box методах, фильтрах, классификаторах и защите агентных сценариев. Отдельно обсудим валидацию защитных слоёв: открытые бенчмарки, ASR/FPR-метрики и сборку собственного тестового набора под конкретный домен. В конце разберём, как собрать базовый guardrail-контур из open-source решений и понять, насколько ему можно доверять в реальном продукте.
При автоматизации бизнес-процессов с помощью LLM и мультиагентных систем ошибка модели может быстро стать инцидентом: утечкой персональных данных, обходом внутренних политик, выполнением опасных действий через tools или потерей контроля над частью инфраструктуры. В докладе разберём, какие риски возникают в LLM-приложениях, почему их нельзя закрыть только промптами или дообучением модели и где за безопасность приходится платить качеством. Поговорим о guardrail-подходах на уровне архитектуры: контроле входов и выходов, работе с контекстом, black-box и white-box методах, фильтрах, классификаторах и защите агентных сценариев. Отдельно обсудим валидацию защитных слоёв: открытые бенчмарки, ASR/FPR-метрики и сборку собственного тестового набора под конкретный домен. В конце разберём, как собрать базовый guardrail-контур из open-source решений и понять, насколько ему можно доверять в реальном продукте.
Информация о спикере
Никита Облаков
HiveTrace
  • Никита Облаков
    HiveTrace
Все доклады трека