Дистилляция — маленькая модель из большой
Обучение компактной модели на ответах крупной, чтобы получить близкое качество на узкой задаче за меньшие деньги и с меньшей задержкой.
Также встречается как: distillation, дистилляция знаний
Коротко. Дистилляция — перенос поведения большой модели в маленькую. Крупная модель («учитель») генерирует ответы, на них обучается компактная («ученик»), которая потом работает в продакшене.
Зачем это делают
Стоимость. Маленькая модель дешевле в инференсе в разы, а на узкой задаче даёт сопоставимое качество.
Скорость. Меньше параметров — быстрее ответ, что важно там, где пользователь ждёт.
Контроль. Компактную модель можно развернуть у себя — актуально для данных, которые нельзя отправлять наружу.
Когда это оправдано
Когда задача узкая, объём запросов большой и качество уже подтверждено на большой модели. То есть это оптимизация зрелого сценария, а не способ начать.
Порядок разумных шагов: сначала промпт на готовой модели, потом маршрутизация запросов между моделями разного размера, и только затем дистилляция, если объём оправдывает работу.
Где ошибаются
Дистиллируют то, что не измерено. Без набора тестов невозможно понять, сколько качества потеряно.
Ожидают универсальности. Ученик хорош ровно на той задаче, на которой обучался. Шаг в сторону — и качество падает резко.
Не проверяют условия использования. Обучение своей модели на ответах чужой может быть ограничено лицензией поставщика — это стоит прочитать до начала работы.
Разобрать это на своём проекте
Мы доводим идеи фаундеров до работающего MVP за долю в компании. Расскажите про свою — посмотрим на цифры вместе.