Многим компаниям сегодня нужна большая языковая модель в собственном контуре: проверять гипотезы на расшифровках телефонных разговоров, гонять эксперименты на чувствительных данных, которые нельзя отдавать наружу, но качество исходных моделей устраивает не всех. В поисках того самого golden dataset, который разом починит все проблемы, приходят к тому, что такого датасета не существует, а то, что лежит в открытом доступе, не устраивает по качеству. В этом докладе я расскажу, как мы пришли к разработке собственных данных, зачем это нужно и на какие грабли успели наступить по пути.