К содержимому
AI и данные

Evals — тесты качества для AI-функций

Набор примеров с ожидаемым результатом, на котором проверяют модель после каждого изменения. Замена «на глаз вроде стало лучше» на измерение.

Также встречается как: оценка качества модели, AI-тесты

Коротко. Evals — тесты для AI-части продукта: фиксированный набор входных данных с ожидаемыми результатами, на котором прогоняют каждое изменение промпта, модели или настроек.

Как это устроено

  1. Собрать 30–100 реальных примеров — обязательно включая те, на которых модель ошибалась.
  2. Для каждого записать, что считается хорошим ответом: точное значение, обязательные элементы или критерий.
  3. Прогонять набор после каждого изменения и сравнивать долю успешных.

Проверять можно по-разному: точным совпадением (для извлечения данных), программной проверкой формата, или другой моделью в роли судьи (для свободного текста).

Зачем фаундеру

Без evals работа над AI-функцией превращается в блуждание: правка промпта чинит один случай и ломает три, но замечают это через неделю по жалобам.

С evals появляется то же, что даёт обычное тестирование в разработке, — возможность менять систему, не боясь.

Это же единственный способ обоснованно выбрать модель: не «эта кажется умнее», а «на нашем наборе 94% против 88% при вдвое меньшей цене».

Где ошибаются

Тестируют на удобных примерах. Набор без сложных и пограничных случаев показывает завышенное качество.

Не обновляют набор. Каждый разбор жалобы должен превращаться в новый пример.

Меряют только точность. Стоимость, задержка и доля отказов — такие же характеристики качества.

Разобрать это на своём проекте

Мы доводим идеи фаундеров до работающего MVP за долю в компании. Расскажите про свою — посмотрим на цифры вместе.

Оставить заявку

Рядом в словаре

Промпт-инжиниринг

Систематическая доводка запросов к модели: структура, примеры, формат вывода и проверка на наборе случаев. Самый дешёвый способ поднять качество.

Галлюцинация

Правдоподобный, но неверный ответ модели: несуществующие факты, ссылки и цитаты. Свойство технологии, а не поломка, — с ним работают, а не чинят.

Температура

Параметр генерации, задающий, насколько модель склонна выбирать менее вероятные продолжения. Ниже — предсказуемее, выше — разнообразнее.

Векторная база

База данных, которая хранит векторы и быстро находит ближайшие к запросу. Инфраструктурный слой поиска по смыслу и RAG-систем.

Дистилляция

Обучение компактной модели на ответах крупной, чтобы получить близкое качество на узкой задаче за меньшие деньги и с меньшей задержкой.

Диффузионная модель

Модель, которая создаёт изображение, постепенно убирая шум по текстовому описанию. Технология за большинством генераторов картинок и видео.