Блог
2 минуты чтениякачествовнедрение

Как измерить качество ответов ИИ-агента

Качество ответов ИИ-агента измеряют на проверочном наборе: 30–50 реальных вопросов сотрудников с эталонными ответами. Каждый ответ оценивают по четырём признакам: правильность, полнота, наличие источника, отсутствие выдуманных фактов.

Как собрать проверочный набор

Собрать вопросы у будущих пользователей

Формулировки берут в том виде, в каком их пишут сотрудники, включая сокращения и внутренний жаргон компании. Вопросы руководителя проекта заменяют реальную выборку плохо.

Записать эталонные ответы

К каждому вопросу указывают верный ответ и документ с пунктом, откуда он взят. Эту работу выполняет специалист предметной области.

Добавить сложные случаи

Вопросы без ответа в документах, вопросы с противоречиями между редакциями, вопросы за пределами прав сотрудника. Такие случаи показывают поведение системы на границе.

По каким признакам оценивать

Правильность

Ответ совпадает с эталоном по содержанию. Оценка бинарная, без промежуточных градаций.

Полнота

Ответ содержит все условия из эталона, включая исключения и оговорки.

Источник

Указан документ и пункт, ссылка ведёт на актуальную редакцию.

Выдуманные факты

В ответе отсутствуют утверждения, которых нет в источниках.

Что считать рабочим результатом

85 %
правильных ответов на проверочном наборе
100 %
ответов со ссылкой на источник
0
выдуманных фактов на всём наборе

Планка по правильности зависит от цены ошибки. Для поиска по регламентам рабочим считается уровень около 85 %, для задач с юридической ответственностью ответ проверяет человек независимо от показателя.

Показатель имеет смысл при неизменном наборе вопросов. Замена вопросов между замерами превращает сравнение в набор несвязанных чисел.

Порядок работы с ошибками

  1. 01Разобрать каждый неверный ответ и найти причину: поиск, источник, формулировка запроса.
  2. 02Ошибки поиска закрывают настройкой индекса и разбиением документов.
  3. 03Ошибки источника означают устаревший или противоречивый документ, вопрос уходит владельцу процесса.
  4. 04Ошибки формулировки правят инструкцией системы, после чего замер повторяют.
  5. 05Повторный замер проводят на том же наборе и фиксируют изменение показателя.

Частые вопросы

Сколько вопросов нужно в проверочном наборе?
30–50 для первого сценария. Такой объём собирается за несколько дней и показывает разницу между версиями настройки.
Как часто повторять замер?
После каждого изменения настроек и при добавлении источников. На эксплуатации — раз в квартал.
Кто оценивает ответы?
Специалист предметной области со стороны заказчика. Оценка подрядчиком собственного решения даёт смещённый результат.
Как проверить качество ответов ИИ-агента перед покупкой?
На пилоте, по проверочному набору вопросов заказчика. Пилот Айвы (WAIVE) включает такой набор: доля верных ответов замеряется на старте и после каждой правки настроек.

Читать дальше