RLHF — обучение на человеческих оценках
Дообучение модели на предпочтениях людей: из двух ответов человек выбирает лучший, и модель подстраивается. Так модели учат быть полезными.
Также встречается как: reinforcement learning from human feedback, обучение с подкреплением на отзывах
Коротко. RLHF — этап обучения, на котором модель настраивают по человеческим предпочтениям. Люди сравнивают варианты ответов, на этих сравнениях обучается модель вознаграждения, а она уже направляет дообучение основной модели.
Зачем это понадобилось
Модель, обученная только предсказывать текст, хорошо продолжает предложения, но плохо выполняет инструкции: она не отличает полезный ответ от бесполезного, потому что в исходной задаче такого критерия не было.
RLHF добавляет этот критерий. Именно после него языковые модели превратились из генераторов текста в собеседников, которые следуют указаниям и отказываются от вредных запросов.
Зачем фаундеру
Два практических следствия.
«Хорошесть» ответа — настроенное свойство, а не объективное. Поведение модели отражает предпочтения тех, кто её настраивал, и может не совпадать с тем, что считается хорошим ответом в вашей отрасли.
Стиль общения модели можно менять только сверху. Через промпт, дообучение или выбор другой модели — но не отменой её базовых настроек.
Где ошибаются
Считают RLHF гарантией безопасности. Он снижает вероятность плохих ответов, но не устраняет её. Для продукта нужны собственные ограничители.
Путают с обучением на своих данных. RLHF — этап подготовки базовой модели, а не то, что делают в прикладном проекте.
Разобрать это на своём проекте
Мы доводим идеи фаундеров до работающего MVP за долю в компании. Расскажите про свою — посмотрим на цифры вместе.