Контекстное окно — память одного запроса
Максимальный объём текста, который модель обрабатывает за раз, включая инструкции, историю и ответ. Всё, что не поместилось, для неё не существует.
Также встречается как: context window, контекст модели
Коротко. Контекстное окно — лимит на количество токенов в одном обращении к модели. В него входит всё: системная инструкция, переданные документы, история диалога и генерируемый ответ.
Что это значит на практике
У модели нет памяти между запросами. То, что выглядит как «она помнит наш разговор», — это история, которую приложение каждый раз отправляет заново. Когда история перестаёт помещаться, её приходится обрезать или сжимать — и модель действительно «забывает» начало.
Большое окно не отменяет двух вещей: во-первых, каждый токен стоит денег, во-вторых, качество работы с очень длинным контекстом заметно падает — важные детали в середине большого текста теряются.
Зачем фаундеру
Отсюда следует архитектура почти любого AI-продукта: не «загрузим в модель всю базу знаний», а «найдём нужные фрагменты и передадим только их». Именно этим занимается RAG.
Второй практический вывод — управление историей диалога: старые сообщения сжимают в краткое резюме, а не тащат целиком.
Где ошибаются
Меряют окно в страницах. Считать нужно в токенах, и для русского текста их уходит больше.
Забывают, что ответ тоже занимает место. Если окно почти заполнено запросом, на ответ его не останется.
Считают, что больше контекста — всегда лучше. Лишние документы не только дорожают запрос, но и отвлекают модель.
Разобрать это на своём проекте
Мы доводим идеи фаундеров до работающего MVP за долю в компании. Расскажите про свою — посмотрим на цифры вместе.