Вам нужен LLM-as-a-Judge! Как перестать оценивать на глаз и настроить валидацию
Тезисы
Многие решения на базе LLM выглядят отлично, пока не приходит время их объективно оценить. В докладе расскажем о нашем подходе к методологии LLM-as-a-Judge и как он ускоряет тестирование гипотез. Вы узнаете: 
— Зачем дообучать модель специально для оценки, а не полагаться на промптинг огромных языковых моделей. 
— Как с помощью такого подхода воспроизводить качество человеческих разметчиков — даже на субъективных задачах. 
— Что именно способна оценивать такая модель: от фактологической точности и отсутствия галлюцинаций до стилистики и следования инструкциям. 
В докладе мы разберем реальные сценарии, которые вы сможете внедрить в свои проекты и получить метрику качества:
— Автоматизация SBS-оценки и проверки LLM на безопасность
— Оценка RAG-систем: как автоматически проверять релевантность retrieved-данных и качество сгенерированных ответов без ручной разметки тысяч примеров. 
— Валидация мультиагентных систем: как отслеживать качество взаимодействия агентов и диагностировать, где именно происходит сбой. 
— LLM-as-a-Judge как reward-функция: как использовать модель-судью при дообучении (RLHF, GRPO) для более точной настройки ваших LLM под бизнес-задачи. 
— Адаптация под новую модальность — оценку сгенерированных видео.
Многие решения на базе LLM выглядят отлично, пока не приходит время их объективно оценить. В докладе расскажем о нашем подходе к методологии LLM-as-a-Judge и как он ускоряет тестирование гипотез. Вы узнаете:
— Зачем дообучать модель специально для оценки, а не полагаться на промптинг огромных языковых моделей.
— Как с помощью такого подхода воспроизводить качество человеческих разметчиков — даже на субъективных задачах.
— Что именно способна оценивать такая модель: от фактологической точности и отсутствия галлюцинаций до стилистики и следования инструкциям.
В докладе мы разберем реальные сценарии, которые вы сможете внедрить в свои проекты и получить метрику качества:
— Автоматизация SBS-оценки и проверки LLM на безопасность
— Оценка RAG-систем: как автоматически проверять релевантность retrieved-данных и качество сгенерированных ответов без ручной разметки тысяч примеров.
— Валидация мультиагентных систем: как отслеживать качество взаимодействия агентов и диагностировать, где именно происходит сбой.
— LLM-as-a-Judge как reward-функция: как использовать модель-судью при дообучении (RLHF, GRPO) для более точной настройки ваших LLM под бизнес-задачи.
— Адаптация под новую модальность — оценку сгенерированных видео.
Информация о спикере
Алиса Глушко
AI Researcher Sber AI
  • Алиса Глушко
    AI Researcher Sber AI
Все доклады трека