К содержимому
AI и данные

RLHF — обучение на человеческих оценках

Дообучение модели на предпочтениях людей: из двух ответов человек выбирает лучший, и модель подстраивается. Так модели учат быть полезными.

Также встречается как: reinforcement learning from human feedback, обучение с подкреплением на отзывах

Коротко. RLHF — этап обучения, на котором модель настраивают по человеческим предпочтениям. Люди сравнивают варианты ответов, на этих сравнениях обучается модель вознаграждения, а она уже направляет дообучение основной модели.

Зачем это понадобилось

Модель, обученная только предсказывать текст, хорошо продолжает предложения, но плохо выполняет инструкции: она не отличает полезный ответ от бесполезного, потому что в исходной задаче такого критерия не было.

RLHF добавляет этот критерий. Именно после него языковые модели превратились из генераторов текста в собеседников, которые следуют указаниям и отказываются от вредных запросов.

Зачем фаундеру

Два практических следствия.

«Хорошесть» ответа — настроенное свойство, а не объективное. Поведение модели отражает предпочтения тех, кто её настраивал, и может не совпадать с тем, что считается хорошим ответом в вашей отрасли.

Стиль общения модели можно менять только сверху. Через промпт, дообучение или выбор другой модели — но не отменой её базовых настроек.

Где ошибаются

Считают RLHF гарантией безопасности. Он снижает вероятность плохих ответов, но не устраняет её. Для продукта нужны собственные ограничители.

Путают с обучением на своих данных. RLHF — этап подготовки базовой модели, а не то, что делают в прикладном проекте.

Разобрать это на своём проекте

Мы доводим идеи фаундеров до работающего MVP за долю в компании. Расскажите про свою — посмотрим на цифры вместе.

Оставить заявку

Рядом в словаре

Файнтюнинг

Дообучение существующей модели на своих примерах, чтобы закрепить стиль, формат или узкую задачу. Нужен реже, чем кажется, и требует данных.

Guardrails

Правила и проверки вокруг модели, не дающие ей выйти за допустимые рамки: что можно отвечать, какие данные раскрывать и какие действия совершать.

LLM

Модель, обученная предсказывать следующий фрагмент текста и научившаяся на этом отвечать, писать код и рассуждать. Основа современных AI-продуктов.

Векторная база

База данных, которая хранит векторы и быстро находит ближайшие к запросу. Инфраструктурный слой поиска по смыслу и RAG-систем.

Галлюцинация

Правдоподобный, но неверный ответ модели: несуществующие факты, ссылки и цитаты. Свойство технологии, а не поломка, — с ним работают, а не чинят.

Дистилляция

Обучение компактной модели на ответах крупной, чтобы получить близкое качество на узкой задаче за меньшие деньги и с меньшей задержкой.