Векторная база — хранилище эмбеддингов
База данных, которая хранит векторы и быстро находит ближайшие к запросу. Инфраструктурный слой поиска по смыслу и RAG-систем.
Также встречается как: vector database, векторное хранилище
Коротко. Векторная база — хранилище эмбеддингов с быстрым поиском ближайших соседей: по вектору запроса она возвращает наиболее близкие по смыслу записи.
Отдельная база или расширение обычной
Два подхода. Первый — специализированные векторные базы. Второй — векторное расширение к обычной СУБД, например pgvector для PostgreSQL.
Для раннего проекта второй вариант почти всегда лучше: у вас уже есть база, вы не добавляете новый сервис в инфраструктуру, а данные и векторы лежат рядом и не расходятся. Отдельное хранилище оправдано на десятках миллионов векторов.
Что в ней хранят
Кроме самого вектора — исходный текст фрагмента и метаданные: документ-источник, дату, права доступа, версию. Метаданные критичны: без фильтрации по ним поиск легко выдаст пользователю фрагмент чужого документа.
Зачем фаундеру
Это самая переоценённая часть AI-стека. Выбор конкретного хранилища почти не влияет на качество продукта — влияют нарезка документов, качество эмбеддингов и логика поиска.
Поэтому разумный порядок: начать с расширения к существующей базе и менять только тогда, когда упрётесь в объём.
Где ошибаются
Начинают проект с выбора векторной базы. Это последний по важности вопрос из всех.
Забывают про права доступа. Поиск обязан фильтровать по тому, что пользователю разрешено видеть, — иначе утечка данных встроена в продукт.
Не хранят версию модели эмбеддингов. При обновлении модели без этого невозможно понять, что пересчитывать.
Разобрать это на своём проекте
Мы доводим идеи фаундеров до работающего MVP за долю в компании. Расскажите про свою — посмотрим на цифры вместе.