Инференс — работа обученной модели
Применение уже обученной модели к новым данным: то, за что вы платите в продакшене каждый день, в отличие от разового обучения.
Также встречается как: inference, вывод модели
Коротко. Инференс — этап, на котором обученная модель отвечает на запросы. Обучение происходит один раз, инференс — при каждом обращении пользователя.
Почему это главная статья расходов
Стоимость обучения велика, но разовая. Инференс работает постоянно и растёт вместе с числом пользователей — именно он определяет себестоимость AI-продукта и напрямую влияет на unit-экономику.
Основные рычаги:
- выбор модели — для простых задач модель поменьше дешевле в разы при сопоставимом качестве;
- длина запроса и ответа — считается в токенах;
- кэширование — повторяющиеся части промпта не нужно обрабатывать заново;
- фильтрация до модели — часть запросов решается обычным кодом или поиском.
Зачем фаундеру
Стоимость инференса нужно закладывать в цену продукта с самого начала. Типичная ошибка — тариф, рассчитанный без учёта того, что активный пользователь может обращаться к модели сотни раз в месяц. При таком раскладе рост числа пользователей увеличивает убыток.
Считать это удобно как прямые расходы на клиента в unit-экономике.
Где ошибаются
Проверяют экономику на самой большой модели. Прототип на топовой модели, переведённый в продакшен без пересмотра, часто оказывается убыточным.
Не ограничивают пользователей. Без лимитов один активный клиент способен съесть маржу десяти.
Игнорируют задержку. Скорость ответа — часть продукта: медленная генерация ощущается как поломка.
Разобрать это на своём проекте
Мы доводим идеи фаундеров до работающего MVP за долю в компании. Расскажите про свою — посмотрим на цифры вместе.