К содержимому
AI и данные

Токен — единица текста для модели

Кусочек текста, которым оперирует языковая модель: часть слова, слово или знак. В токенах измеряют и лимиты контекста, и стоимость запросов.

Также встречается как: token, токены

Коротко. Токен — минимальная единица, на которые модель разбивает текст. Это не буква и не слово, а фрагмент: часто корень, окончание или знак препинания.

Практические ориентиры

Для английского один токен — примерно 4 символа, около 0,75 слова. Для русского текста токенов на тот же смысл уходит заметно больше — кириллица дробится мельче. Это напрямую влияет на стоимость: один и тот же документ на русском обходится дороже, чем на английском.

Считаются и вход, и выход: и то, что вы отправили, и то, что модель сгенерировала.

Зачем фаундеру

Токены — это и деньги, и ограничения. Из них складываются:

  • стоимость запроса — тарифы моделей указываются за миллион токенов, отдельно за вход и выход;
  • лимит контекстного окна — сколько текста помещается в один запрос;
  • скорость ответа — генерация идёт токен за токеном.

Отсюда практические рычаги экономии: не отправлять в модель лишнее, сокращать системные инструкции, кэшировать повторяющиеся части запроса, отдавать простые задачи моделям поменьше.

Где ошибаются

Считают стоимость по символам. Ошибка получается в разы, особенно на русском.

Отправляют весь документ целиком. Обычно достаточно нужного фрагмента — этим и занимается RAG.

Забывают про выход. Длинные ответы стоят дороже входа: цена за выходной токен, как правило, выше.

Разобрать это на своём проекте

Мы доводим идеи фаундеров до работающего MVP за долю в компании. Расскажите про свою — посмотрим на цифры вместе.

Оставить заявку

Рядом в словаре

Контекстное окно

Максимальный объём текста, который модель обрабатывает за раз, включая инструкции, историю и ответ. Всё, что не поместилось, для неё не существует.

LLM

Модель, обученная предсказывать следующий фрагмент текста и научившаяся на этом отвечать, писать код и рассуждать. Основа современных AI-продуктов.

Инференс

Применение уже обученной модели к новым данным: то, за что вы платите в продакшене каждый день, в отличие от разового обучения.

Векторная база

База данных, которая хранит векторы и быстро находит ближайшие к запросу. Инфраструктурный слой поиска по смыслу и RAG-систем.

Галлюцинация

Правдоподобный, но неверный ответ модели: несуществующие факты, ссылки и цитаты. Свойство технологии, а не поломка, — с ним работают, а не чинят.

Дистилляция

Обучение компактной модели на ответах крупной, чтобы получить близкое качество на узкой задаче за меньшие деньги и с меньшей задержкой.