Критерии и стоп-факторы
Оценка уровня 1 складывает ответы LLM по критериям одного промпта в балл шага. Настраивается на вкладке Оценка в редакторе промпта.
Форма критерия в схеме данных
Чтобы критерий можно было оценить, он должен быть описан на вкладке Схема данных как отдельное поле-массив с одним элементом. Это обязательное требование, а не рекомендация: система адресует критерий по имени этого поля.
У самого поля задаётся короткое название критерия, а внутри элемента — пять обязательных составляющих:
| Составляющая | Назначение |
|---|---|
| Название | Короткое название критерия. Должно быть одинаковым во всех разговорах |
| Балл | 1 — выполнено, 0 — не выполнено, -1 — неприменимо |
| Максимум | Максимум по критерию |
| Цитата | Фрагмент разговора, подтверждающий оценку |
| Обоснование | Почему поставлена такая оценка — свободный текст, свой для каждого разговора |
Такую форму нужно повторить для каждого оцениваемого критерия: один критерий — одно поле.
- Не складывайте все критерии в одно общее поле. Названия, которые возвращает LLM, «плывут» от разговора к разговору, и система не сможет надёжно отличить один критерий от другого.
- Не разносите критерий по отдельным полям — балл в одно поле, цитата в другое, комментарий в третье. Движок оценки такую форму не читает вообще.
- Название поля — это название критерия, а не инструкция для модели. Инструкции пишутся в системном промпте. Если положить сюда инструкцию, оператор увидит её как заголовок задачи в коучинге.
Настройка агрегации
На вкладке Оценка каждому критерию задаётся:
| Параметр | Описание |
|---|---|
| Вес | Вклад критерия в балл шага. По умолчанию 1 |
| Значение «неприменимо» | Какой ответ считать «критерий не применим к этому разговору». По умолчанию -1 |
| Стоп-фактор | Что произойдёт, если критерий провален (см. ниже) |
Дополнительно каждому критерию нужен свой виджет в UI-конфиге. Заголовок этого виджета — то название, которое увидит человек: и в карточке разговора, и в задаче коучинга.
Правила оценки сохраняются отдельным действием и версионируются — по истории правил видно, какая правка и когда могла повлиять на баллы. Там же правила можно проверить на уже разобранном разговоре. Подробнее — Вкладки редактора промпта.
Имя поля — это личность критерия
Идентичность критерия определяется именем поля в схеме. Переименование поля отвязывает оценку и начинает историю коучинга с нуля — накопленная статистика по критерию теряется.
- Добавляете критерий — сначала схема данных, потом вкладка «Оценка».
- Удаляете или переименовываете — сначала вкладка «Оценка», потом схема данных.
Система не даст сохранить правку схемы, которая оставит работающий сегодня критерий без поля.
Неприменимо — это не ноль
Если критерий по условиям разговора не мог быть выполнен, он не должен стоить оператору ничего.
- Неприменимый критерий не считается за ноль — он выпадает из расчёта, как пустая строка при вычислении среднего.
- Балл шага пропорционально пересчитывается к объявленному максимуму, чтобы неприменимые критерии не съедали баллы.
- Если все критерии шага оказались неприменимы, шаг получает полный балл, а не ноль: отказывать в баллах было не за что.
Обратная сторона этого правила: критерий, который система не смогла прочитать, считается неприменимым, а значит — полным баллом. Ошибка в конфигурации не занижает оценки, а завышает их. Именно поэтому требования к форме критерия выше — жёсткие: сохранить заведомо нечитаемую конфигурацию система не даст.
Стоп-факторы
Стоп-фактор — критерий, провал которого не просто вычитает вес, а обнуляет результат. У каждого критерия он настраивается отдельно.
| Режим | Название в интерфейсе | Что происходит при провале |
|---|---|---|
none | — | Обычный критерий, просто не засчитывается его вес |
short_circuit | Блокер | Балл этого шага обнуляется целиком |
pipeline_short_circuit | Блокер конвейера | Обнуляется балл этого шага и итоговая оценка всего пайплайна |
penalty | Штраф | Из балла шага вычитается заданное число баллов |
Для режима Штраф обязательно указывается размер штрафа.
Блокер конвейера — самый сильный режим: он перебивает даже незавершённые соседние шаги, и разговор получает 0 с пометкой «не пройден». Используйте его для нарушений, после которых разговор не может считаться качественным ни при каких обстоятельствах — например, грубость или разглашение персональных данных.
Что дальше
Кросс-шаговая оценка — как баллы шагов складываются в оценку разговора.
Вкладки редактора промпта — история правил и проверка правил на реальном анализе.
Настройка коучинга — как включить отслеживание критерия в планах развития операторов.