К содержимому
AI и данные

Инференс — работа обученной модели

Применение уже обученной модели к новым данным: то, за что вы платите в продакшене каждый день, в отличие от разового обучения.

Также встречается как: inference, вывод модели

Коротко. Инференс — этап, на котором обученная модель отвечает на запросы. Обучение происходит один раз, инференс — при каждом обращении пользователя.

Почему это главная статья расходов

Стоимость обучения велика, но разовая. Инференс работает постоянно и растёт вместе с числом пользователей — именно он определяет себестоимость AI-продукта и напрямую влияет на unit-экономику.

Основные рычаги:

  • выбор модели — для простых задач модель поменьше дешевле в разы при сопоставимом качестве;
  • длина запроса и ответа — считается в токенах;
  • кэширование — повторяющиеся части промпта не нужно обрабатывать заново;
  • фильтрация до модели — часть запросов решается обычным кодом или поиском.

Зачем фаундеру

Стоимость инференса нужно закладывать в цену продукта с самого начала. Типичная ошибка — тариф, рассчитанный без учёта того, что активный пользователь может обращаться к модели сотни раз в месяц. При таком раскладе рост числа пользователей увеличивает убыток.

Считать это удобно как прямые расходы на клиента в unit-экономике.

Где ошибаются

Проверяют экономику на самой большой модели. Прототип на топовой модели, переведённый в продакшен без пересмотра, часто оказывается убыточным.

Не ограничивают пользователей. Без лимитов один активный клиент способен съесть маржу десяти.

Игнорируют задержку. Скорость ответа — часть продукта: медленная генерация ощущается как поломка.

Разобрать это на своём проекте

Мы доводим идеи фаундеров до работающего MVP за долю в компании. Расскажите про свою — посмотрим на цифры вместе.

Оставить заявку

Рядом в словаре

Токен

Кусочек текста, которым оперирует языковая модель: часть слова, слово или знак. В токенах измеряют и лимиты контекста, и стоимость запросов.

LLM

Модель, обученная предсказывать следующий фрагмент текста и научившаяся на этом отвечать, писать код и рассуждать. Основа современных AI-продуктов.

Дистилляция

Обучение компактной модели на ответах крупной, чтобы получить близкое качество на узкой задаче за меньшие деньги и с меньшей задержкой.

Векторная база

База данных, которая хранит векторы и быстро находит ближайшие к запросу. Инфраструктурный слой поиска по смыслу и RAG-систем.

Галлюцинация

Правдоподобный, но неверный ответ модели: несуществующие факты, ссылки и цитаты. Свойство технологии, а не поломка, — с ним работают, а не чинят.

Диффузионная модель

Модель, которая создаёт изображение, постепенно убирая шум по текстовому описанию. Технология за большинством генераторов картинок и видео.