Что такое evals

Ответы языковой модели недетерминированы: одна и та же правка промпта может улучшить одни диалоги и незаметно сломать другие. Evals — офлайн-оценка качества до выкатки: через новую версию промпта, модели или поиска прогоняют эталонный набор диалогов (golden set) и считают метрики. Это аналог автотестов в разработке, только проверяют не «совпало слово в слово», а соответствие критериям: факты верны, товары подходят, правила соблюдены.

Из чего состоит eval

Эталонный набор. Реальные вопросы покупателей и проверяемые ожидания к ответу: какие товары допустимы, какие факты обязательны, чего говорить нельзя. Обязательно включают трудные случаи: товара нет в наличии, вопрос вне ассортимента, попытка промпт-инъекции.

Метрики:

Метрика Что показывает Кто оценивает
Точность фактов Цены, характеристики и наличие совпадают с каталогом Код: сверка с фидом
Faithfulness Ответ опирается на переданный контекст — см. граундинг LLM-судья
Релевантность Предложенные товары подходят под запрос LLM-судья, разметка, точность и полнота
Следование правилам Нет обещаний скидок и запретных тем — проверка гардрейлов Код и классификатор
Доля отказов Как часто ассистент отвечает «не знаю» или зовёт оператора Счётчик: рост — признак пережатых правил

Оценщики. Детерминированный код — для всего, что можно сверить с данными. LLM-as-a-judge — отдельная модель с рубрикой для смысловых критериев. Ручная разметка — для калибровки судьи и спорных случаев.

Evals и A/B-тест

Evals отвечают на вопрос «не сломали ли мы что-то», A/B-тест — «стало ли лучше для бизнеса». Порядок работы:

  1. Изменение: новый промпт, модель, настройка поиска.
  2. Evals как фильтр: версия с падением точности фактов или новыми нарушениями правил дальше не идёт.
  3. A/B-тест на живом трафике по CR, AOV и выручке на визит.
  4. Выкатка победителя и пополнение эталонного набора найденными ошибками.

Важно: высокий балл судьи не гарантирует роста конверсии. Evals не заменяют A/B, а экономят трафик: плохие версии отсекаются до того, как на них попадут покупатели.

Как начать: практика

  • Соберите первые десятки реальных диалогов из логов и запишите к каждому проверяемые ожидания, а не эталонный текст ответа.
  • Автоматизируйте прогон на каждое изменение промпта, модели, поиска или крупное обновление каталога.
  • Задайте пороги, при которых релиз блокируется: любые нарушения правил, падение точности фактов.
  • Раз в цикл сверяйте LLM-судью с ручной разметкой на выборке диалогов.
  • Каждую ошибку, найденную в продакшене, превращайте в новый тест-кейс.