Evals — тесты качества для AI-функций
Набор примеров с ожидаемым результатом, на котором проверяют модель после каждого изменения. Замена «на глаз вроде стало лучше» на измерение.
Также встречается как: оценка качества модели, AI-тесты
Коротко. Evals — тесты для AI-части продукта: фиксированный набор входных данных с ожидаемыми результатами, на котором прогоняют каждое изменение промпта, модели или настроек.
Как это устроено
- Собрать 30–100 реальных примеров — обязательно включая те, на которых модель ошибалась.
- Для каждого записать, что считается хорошим ответом: точное значение, обязательные элементы или критерий.
- Прогонять набор после каждого изменения и сравнивать долю успешных.
Проверять можно по-разному: точным совпадением (для извлечения данных), программной проверкой формата, или другой моделью в роли судьи (для свободного текста).
Зачем фаундеру
Без evals работа над AI-функцией превращается в блуждание: правка промпта чинит один случай и ломает три, но замечают это через неделю по жалобам.
С evals появляется то же, что даёт обычное тестирование в разработке, — возможность менять систему, не боясь.
Это же единственный способ обоснованно выбрать модель: не «эта кажется умнее», а «на нашем наборе 94% против 88% при вдвое меньшей цене».
Где ошибаются
Тестируют на удобных примерах. Набор без сложных и пограничных случаев показывает завышенное качество.
Не обновляют набор. Каждый разбор жалобы должен превращаться в новый пример.
Меряют только точность. Стоимость, задержка и доля отказов — такие же характеристики качества.
Разобрать это на своём проекте
Мы доводим идеи фаундеров до работающего MVP за долю в компании. Расскажите про свою — посмотрим на цифры вместе.