Как измерить качество ответов ИИ-агента
Качество ответов ИИ-агента измеряют на проверочном наборе: 30–50 реальных вопросов сотрудников с эталонными ответами. Каждый ответ оценивают по четырём признакам: правильность, полнота, наличие источника, отсутствие выдуманных фактов.
Как собрать проверочный набор
Собрать вопросы у будущих пользователей
Формулировки берут в том виде, в каком их пишут сотрудники, включая сокращения и внутренний жаргон компании. Вопросы руководителя проекта заменяют реальную выборку плохо.
Записать эталонные ответы
К каждому вопросу указывают верный ответ и документ с пунктом, откуда он взят. Эту работу выполняет специалист предметной области.
Добавить сложные случаи
Вопросы без ответа в документах, вопросы с противоречиями между редакциями, вопросы за пределами прав сотрудника. Такие случаи показывают поведение системы на границе.
По каким признакам оценивать
Правильность
Ответ совпадает с эталоном по содержанию. Оценка бинарная, без промежуточных градаций.
Полнота
Ответ содержит все условия из эталона, включая исключения и оговорки.
Источник
Указан документ и пункт, ссылка ведёт на актуальную редакцию.
Выдуманные факты
В ответе отсутствуют утверждения, которых нет в источниках.
Что считать рабочим результатом
Планка по правильности зависит от цены ошибки. Для поиска по регламентам рабочим считается уровень около 85 %, для задач с юридической ответственностью ответ проверяет человек независимо от показателя.
Показатель имеет смысл при неизменном наборе вопросов. Замена вопросов между замерами превращает сравнение в набор несвязанных чисел.
Порядок работы с ошибками
- 01Разобрать каждый неверный ответ и найти причину: поиск, источник, формулировка запроса.
- 02Ошибки поиска закрывают настройкой индекса и разбиением документов.
- 03Ошибки источника означают устаревший или противоречивый документ, вопрос уходит владельцу процесса.
- 04Ошибки формулировки правят инструкцией системы, после чего замер повторяют.
- 05Повторный замер проводят на том же наборе и фиксируют изменение показателя.
Частые вопросы
- Сколько вопросов нужно в проверочном наборе?
- 30–50 для первого сценария. Такой объём собирается за несколько дней и показывает разницу между версиями настройки.
- Как часто повторять замер?
- После каждого изменения настроек и при добавлении источников. На эксплуатации — раз в квартал.
- Кто оценивает ответы?
- Специалист предметной области со стороны заказчика. Оценка подрядчиком собственного решения даёт смещённый результат.
- Как проверить качество ответов ИИ-агента перед покупкой?
- На пилоте, по проверочному набору вопросов заказчика. Пилот Айвы (WAIVE) включает такой набор: доля верных ответов замеряется на старте и после каждой правки настроек.