К содержимому
AI и данные

RAG — ответы модели по вашим документам

Схема, при которой перед ответом система находит нужные фрагменты в вашей базе и передаёт их модели. Способ отвечать по своим данным без дообучения.

Также встречается как: retrieval augmented generation, поиск с генерацией

Коротко. RAG (retrieval augmented generation) — подход, при котором на каждый вопрос система сначала ищет релевантные фрагменты в вашей базе знаний, а затем передаёт их модели вместе с вопросом.

Как это устроено

  1. Документы режутся на фрагменты и превращаются в эмбеддинги.
  2. Эмбеддинги складываются в векторную базу.
  3. При запросе вопрос тоже превращается в вектор, и по нему находятся ближайшие фрагменты.
  4. Найденное вместе с вопросом отправляется в модель.
  5. Модель отвечает, опираясь на переданный контекст, и указывает источники.

На практике поиск обычно делают гибридным: векторный плюс обычный полнотекстовый — так лучше находятся точные термины, артикулы и названия.

Зачем фаундеру

RAG решает две главные проблемы применения LLM в бизнесе: модель не знает ваших данных и склонна выдумывать. Ответ по найденным фрагментам со ссылкой на источник проверяем — а значит, применим там, где цена ошибки не нулевая.

Это же самый дешёвый путь: не требует дообучения и обновляется простым добавлением документов.

Где ошибаются

Считают RAG «загрузить документы в чат». Качество определяется в первую очередь тем, как нарезаны фрагменты и насколько хорошо работает поиск, а не моделью.

Не показывают источники. Без ссылки на исходный документ пользователь не может проверить ответ, и вся конструкция теряет смысл.

Не следят за актуальностью. Устаревший документ в базе выглядит для модели так же авторитетно, как свежий.

Разобрать это на своём проекте

Мы доводим идеи фаундеров до работающего MVP за долю в компании. Расскажите про свою — посмотрим на цифры вместе.

Оставить заявку

Рядом в словаре

Эмбеддинг

Представление текста, картинки или товара набором чисел, где близкие по смыслу объекты оказываются рядом. Основа поиска по смыслу и рекомендаций.

Векторная база

База данных, которая хранит векторы и быстро находит ближайшие к запросу. Инфраструктурный слой поиска по смыслу и RAG-систем.

Контекстное окно

Максимальный объём текста, который модель обрабатывает за раз, включая инструкции, историю и ответ. Всё, что не поместилось, для неё не существует.

Галлюцинация

Правдоподобный, но неверный ответ модели: несуществующие факты, ссылки и цитаты. Свойство технологии, а не поломка, — с ним работают, а не чинят.

Дистилляция

Обучение компактной модели на ответах крупной, чтобы получить близкое качество на узкой задаче за меньшие деньги и с меньшей задержкой.

Диффузионная модель

Модель, которая создаёт изображение, постепенно убирая шум по текстовому описанию. Технология за большинством генераторов картинок и видео.