Что такое evals
Ответы языковой модели недетерминированы: одна и та же правка промпта может улучшить одни диалоги и незаметно сломать другие. Evals — офлайн-оценка качества до выкатки: через новую версию промпта, модели или поиска прогоняют эталонный набор диалогов (golden set) и считают метрики. Это аналог автотестов в разработке, только проверяют не «совпало слово в слово», а соответствие критериям: факты верны, товары подходят, правила соблюдены.
Из чего состоит eval
Эталонный набор. Реальные вопросы покупателей и проверяемые ожидания к ответу: какие товары допустимы, какие факты обязательны, чего говорить нельзя. Обязательно включают трудные случаи: товара нет в наличии, вопрос вне ассортимента, попытка промпт-инъекции.
Метрики:
| Метрика | Что показывает | Кто оценивает |
|---|---|---|
| Точность фактов | Цены, характеристики и наличие совпадают с каталогом | Код: сверка с фидом |
| Faithfulness | Ответ опирается на переданный контекст — см. граундинг | LLM-судья |
| Релевантность | Предложенные товары подходят под запрос | LLM-судья, разметка, точность и полнота |
| Следование правилам | Нет обещаний скидок и запретных тем — проверка гардрейлов | Код и классификатор |
| Доля отказов | Как часто ассистент отвечает «не знаю» или зовёт оператора | Счётчик: рост — признак пережатых правил |
Оценщики. Детерминированный код — для всего, что можно сверить с данными. LLM-as-a-judge — отдельная модель с рубрикой для смысловых критериев. Ручная разметка — для калибровки судьи и спорных случаев.
Evals и A/B-тест
Evals отвечают на вопрос «не сломали ли мы что-то», A/B-тест — «стало ли лучше для бизнеса». Порядок работы:
- Изменение: новый промпт, модель, настройка поиска.
- Evals как фильтр: версия с падением точности фактов или новыми нарушениями правил дальше не идёт.
- A/B-тест на живом трафике по CR, AOV и выручке на визит.
- Выкатка победителя и пополнение эталонного набора найденными ошибками.
Важно: высокий балл судьи не гарантирует роста конверсии. Evals не заменяют A/B, а экономят трафик: плохие версии отсекаются до того, как на них попадут покупатели.
Как начать: практика
- Соберите первые десятки реальных диалогов из логов и запишите к каждому проверяемые ожидания, а не эталонный текст ответа.
- Автоматизируйте прогон на каждое изменение промпта, модели, поиска или крупное обновление каталога.
- Задайте пороги, при которых релиз блокируется: любые нарушения правил, падение точности фактов.
- Раз в цикл сверяйте LLM-судью с ручной разметкой на выборке диалогов.
- Каждую ошибку, найденную в продакшене, превращайте в новый тест-кейс.