"Я их слепила из того, что было”, или как генерировать данные для вашей модели?
Тезисы
Многим компаниям сегодня нужна большая языковая модель в собственном контуре: проверять гипотезы на расшифровках телефонных разговоров, гонять эксперименты на чувствительных данных, которые нельзя отдавать наружу, но качество исходных моделей устраивает не всех. В поисках того самого golden dataset, который разом починит все проблемы, приходят к тому, что такого датасета не существует, а то, что лежит в открытом доступе, не устраивает по качеству. В этом докладе я расскажу, как мы пришли к разработке собственных данных, зачем это нужно и на какие грабли успели наступить по пути.
Многим компаниям сегодня нужна большая языковая модель в собственном контуре: проверять гипотезы на расшифровках телефонных разговоров, гонять эксперименты на чувствительных данных, которые нельзя отдавать наружу, но качество исходных моделей устраивает не всех. В поисках того самого golden dataset, который разом починит все проблемы, приходят к тому, что такого датасета не существует, а то, что лежит в открытом доступе, не устраивает по качеству. В этом докладе я расскажу, как мы пришли к разработке собственных данных, зачем это нужно и на какие грабли успели наступить по пути.
Информация о спикере
Владислав Попов
Data Scientist, Точка Банк
Крутой бобер
  • Владислав Попов
    Data Scientist, Точка Банк
    Крутой бобер
Все доклады трека