Перейти к основному содержимому

Критерии и стоп-факторы

Оценка уровня 1 складывает ответы LLM по критериям одного промпта в балл шага. Настраивается на вкладке Оценка в редакторе промпта.

Форма критерия в схеме данных​

Чтобы критерий можно было оценить, он должен быть описан на вкладке Схема данных как отдельное поле-массив с одним элементом. Это обязательное требование, а не рекомендация: система адресует критерий по имени этого поля.

У самого поля задаётся короткое название критерия, а внутри элемента — пять обязательных составляющих:

СоставляющаяНазначение
НазваниеКороткое название критерия. Должно быть одинаковым во всех разговорах
Балл1 — выполнено, 0 — не выполнено, -1 — неприменимо
МаксимумМаксимум по критерию
ЦитатаФрагмент разговора, подтверждающий оценку
ОбоснованиеПочему поставлена такая оценка — свободный текст, свой для каждого разговора

Такую форму нужно повторить для каждого оцениваемого критерия: один критерий — одно поле.

Чего делать нельзя
  • Не складывайте все критерии в одно общее поле. Названия, которые возвращает LLM, «плывут» от разговора к разговору, и система не сможет надёжно отличить один критерий от другого.
  • Не разносите критерий по отдельным полям — балл в одно поле, цитата в другое, комментарий в третье. Движок оценки такую форму не читает вообще.
  • Название поля — это название критерия, а не инструкция для модели. Инструкции пишутся в системном промпте. Если положить сюда инструкцию, оператор увидит её как заголовок задачи в коучинге.

Настройка агрегации​

На вкладке Оценка каждому критерию задаётся:

ПараметрОписание
ВесВклад критерия в балл шага. По умолчанию 1
Значение «неприменимо»Какой ответ считать «критерий не применим к этому разговору». По умолчанию -1
Стоп-факторЧто произойдёт, если критерий провален (см. ниже)

Дополнительно каждому критерию нужен свой виджет в UI-конфиге. Заголовок этого виджета — то название, которое увидит человек: и в карточке разговора, и в задаче коучинга.

Правила оценки сохраняются отдельным действием и версионируются — по истории правил видно, какая правка и когда могла повлиять на баллы. Там же правила можно проверить на уже разобранном разговоре. Подробнее — Вкладки редактора промпта.

Имя поля — это личность критерия​

Идентичность критерия определяется именем поля в схеме. Переименование поля отвязывает оценку и начинает историю коучинга с нуля — накопленная статистика по критерию теряется.

Порядок действий при правке
  • Добавляете критерий — сначала схема данных, потом вкладка «Оценка».
  • Удаляете или переименовываете — сначала вкладка «Оценка», потом схема данных.

Система не даст сохранить правку схемы, которая оставит работающий сегодня критерий без поля.

Неприменимо — это не ноль​

Если критерий по условиям разговора не мог быть выполнен, он не должен стоить оператору ничего.

  • Неприменимый критерий не считается за ноль — он выпадает из расчёта, как пустая строка при вычислении среднего.
  • Балл шага пропорционально пересчитывается к объявленному максимуму, чтобы неприменимые критерии не съедали баллы.
  • Если все критерии шага оказались неприменимы, шаг получает полный балл, а не ноль: отказывать в баллах было не за что.
осторожно

Обратная сторона этого правила: критерий, который система не смогла прочитать, считается неприменимым, а значит — полным баллом. Ошибка в конфигурации не занижает оценки, а завышает их. Именно поэтому требования к форме критерия выше — жёсткие: сохранить заведомо нечитаемую конфигурацию система не даст.

Стоп-факторы​

Стоп-фактор — критерий, провал которого не просто вычитает вес, а обнуляет результат. У каждого критерия он настраивается отдельно.

РежимНазвание в интерфейсеЧто происходит при провале
none—Обычный критерий, просто не засчитывается его вес
short_circuitБлокерБалл этого шага обнуляется целиком
pipeline_short_circuitБлокер конвейераОбнуляется балл этого шага и итоговая оценка всего пайплайна
penaltyШтрафИз балла шага вычитается заданное число баллов

Для режима Штраф обязательно указывается размер штрафа.

Блокер конвейера — самый сильный режим: он перебивает даже незавершённые соседние шаги, и разговор получает 0 с пометкой «не пройден». Используйте его для нарушений, после которых разговор не может считаться качественным ни при каких обстоятельствах — например, грубость или разглашение персональных данных.

Что дальше​

Кросс-шаговая оценка — как баллы шагов складываются в оценку разговора.

Вкладки редактора промпта — история правил и проверка правил на реальном анализе.

Настройка коучинга — как включить отслеживание критерия в планах развития операторов.