Настроить Cookies
Мы используем Cookies для улучшения работы сайта
Настроить Cookies
Настройки Cookies
Файлы cookie, необходимые для корректной работы сайта, всегда включены. Другие файлы cookie можно настроить.
Основные файлы cookie
Всегда включены. Эти файлы cookie необходимы для работы веб-сайта и его функций. Их нельзя отключить. Они устанавливаются в ответ на ваши запросы, например, при настройке параметров конфиденциальности, входе в систему или заполнении форм.
Аналитические файлы cookie
Disabled
Эти файлы cookie собирают информацию, которая помогает нам понять, как используются наши веб-сайты, насколько эффективны наши маркетинговые кампании, а также помогает нам персонализировать наши веб-сайты для вас.
Рекламные файлы cookie
Disabled
Эти файлы cookie предоставляют рекламным компаниям информацию о вашей активности в интернете, чтобы помочь им показывать вам более релевантную рекламу или ограничивать количество показов рекламы. Эта информация может быть передана другим рекламным компаниям.
Вам нужен LLM-as-a-Judge! Как перестать оценивать на глаз и настроить валидацию
Тезисы
Многие решения на базе LLM выглядят отлично, пока не приходит время их объективно оценить. В докладе расскажем о нашем подходе к методологии LLM-as-a-Judge и как он ускоряет тестирование гипотез. Вы узнаете: 
— Зачем дообучать модель специально для оценки, а не полагаться на промптинг огромных языковых моделей. 
— Как с помощью такого подхода воспроизводить качество человеческих разметчиков — даже на субъективных задачах. 
— Что именно способна оценивать такая модель: от фактологической точности и отсутствия галлюцинаций до стилистики и следования инструкциям. 
В докладе мы разберем реальные сценарии, которые вы сможете внедрить в свои проекты и получить метрику качества:
— Автоматизация SBS-оценки и проверки LLM на безопасность
— Оценка RAG-систем: как автоматически проверять релевантность retrieved-данных и качество сгенерированных ответов без ручной разметки тысяч примеров. 
— Валидация мультиагентных систем: как отслеживать качество взаимодействия агентов и диагностировать, где именно происходит сбой. 
— LLM-as-a-Judge как reward-функция: как использовать модель-судью при дообучении (RLHF, GRPO) для более точной настройки ваших LLM под бизнес-задачи. 
— Адаптация под новую модальность — оценку сгенерированных видео.
Многие решения на базе LLM выглядят отлично, пока не приходит время их объективно оценить. В докладе расскажем о нашем подходе к методологии LLM-as-a-Judge и как он ускоряет тестирование гипотез. Вы узнаете:
— Зачем дообучать модель специально для оценки, а не полагаться на промптинг огромных языковых моделей.
— Как с помощью такого подхода воспроизводить качество человеческих разметчиков — даже на субъективных задачах.
— Что именно способна оценивать такая модель: от фактологической точности и отсутствия галлюцинаций до стилистики и следования инструкциям.
В докладе мы разберем реальные сценарии, которые вы сможете внедрить в свои проекты и получить метрику качества:
— Автоматизация SBS-оценки и проверки LLM на безопасность
— Оценка RAG-систем: как автоматически проверять релевантность retrieved-данных и качество сгенерированных ответов без ручной разметки тысяч примеров.
— Валидация мультиагентных систем: как отслеживать качество взаимодействия агентов и диагностировать, где именно происходит сбой.
— LLM-as-a-Judge как reward-функция: как использовать модель-судью при дообучении (RLHF, GRPO) для более точной настройки ваших LLM под бизнес-задачи.
— Адаптация под новую модальность — оценку сгенерированных видео.
Информация о спикере
Алиса Глушко
AI Researcher Sber AI
  • Алиса Глушко
    AI Researcher Sber AI
Все доклады трека