К содержимому
AI и данные

Контекстное окно — память одного запроса

Максимальный объём текста, который модель обрабатывает за раз, включая инструкции, историю и ответ. Всё, что не поместилось, для неё не существует.

Также встречается как: context window, контекст модели

Коротко. Контекстное окно — лимит на количество токенов в одном обращении к модели. В него входит всё: системная инструкция, переданные документы, история диалога и генерируемый ответ.

Что это значит на практике

У модели нет памяти между запросами. То, что выглядит как «она помнит наш разговор», — это история, которую приложение каждый раз отправляет заново. Когда история перестаёт помещаться, её приходится обрезать или сжимать — и модель действительно «забывает» начало.

Большое окно не отменяет двух вещей: во-первых, каждый токен стоит денег, во-вторых, качество работы с очень длинным контекстом заметно падает — важные детали в середине большого текста теряются.

Зачем фаундеру

Отсюда следует архитектура почти любого AI-продукта: не «загрузим в модель всю базу знаний», а «найдём нужные фрагменты и передадим только их». Именно этим занимается RAG.

Второй практический вывод — управление историей диалога: старые сообщения сжимают в краткое резюме, а не тащат целиком.

Где ошибаются

Меряют окно в страницах. Считать нужно в токенах, и для русского текста их уходит больше.

Забывают, что ответ тоже занимает место. Если окно почти заполнено запросом, на ответ его не останется.

Считают, что больше контекста — всегда лучше. Лишние документы не только дорожают запрос, но и отвлекают модель.

Разобрать это на своём проекте

Мы доводим идеи фаундеров до работающего MVP за долю в компании. Расскажите про свою — посмотрим на цифры вместе.

Оставить заявку

Рядом в словаре

Токен

Кусочек текста, которым оперирует языковая модель: часть слова, слово или знак. В токенах измеряют и лимиты контекста, и стоимость запросов.

LLM

Модель, обученная предсказывать следующий фрагмент текста и научившаяся на этом отвечать, писать код и рассуждать. Основа современных AI-продуктов.

RAG

Схема, при которой перед ответом система находит нужные фрагменты в вашей базе и передаёт их модели. Способ отвечать по своим данным без дообучения.

Векторная база

База данных, которая хранит векторы и быстро находит ближайшие к запросу. Инфраструктурный слой поиска по смыслу и RAG-систем.

Галлюцинация

Правдоподобный, но неверный ответ модели: несуществующие факты, ссылки и цитаты. Свойство технологии, а не поломка, — с ним работают, а не чинят.

Дистилляция

Обучение компактной модели на ответах крупной, чтобы получить близкое качество на узкой задаче за меньшие деньги и с меньшей задержкой.