RAG — ответы модели по вашим документам
Схема, при которой перед ответом система находит нужные фрагменты в вашей базе и передаёт их модели. Способ отвечать по своим данным без дообучения.
Также встречается как: retrieval augmented generation, поиск с генерацией
Коротко. RAG (retrieval augmented generation) — подход, при котором на каждый вопрос система сначала ищет релевантные фрагменты в вашей базе знаний, а затем передаёт их модели вместе с вопросом.
Как это устроено
- Документы режутся на фрагменты и превращаются в эмбеддинги.
- Эмбеддинги складываются в векторную базу.
- При запросе вопрос тоже превращается в вектор, и по нему находятся ближайшие фрагменты.
- Найденное вместе с вопросом отправляется в модель.
- Модель отвечает, опираясь на переданный контекст, и указывает источники.
На практике поиск обычно делают гибридным: векторный плюс обычный полнотекстовый — так лучше находятся точные термины, артикулы и названия.
Зачем фаундеру
RAG решает две главные проблемы применения LLM в бизнесе: модель не знает ваших данных и склонна выдумывать. Ответ по найденным фрагментам со ссылкой на источник проверяем — а значит, применим там, где цена ошибки не нулевая.
Это же самый дешёвый путь: не требует дообучения и обновляется простым добавлением документов.
Где ошибаются
Считают RAG «загрузить документы в чат». Качество определяется в первую очередь тем, как нарезаны фрагменты и насколько хорошо работает поиск, а не моделью.
Не показывают источники. Без ссылки на исходный документ пользователь не может проверить ответ, и вся конструкция теряет смысл.
Не следят за актуальностью. Устаревший документ в базе выглядит для модели так же авторитетно, как свежий.
Разобрать это на своём проекте
Мы доводим идеи фаундеров до работающего MVP за долю в компании. Расскажите про свою — посмотрим на цифры вместе.