Бенчмарки ИИ-агентов: что проверяют GAIA, ToolQA, BFCL, HotpotQA и GPQA
Бенчмарк — открытый список задач с известными правильными ответами, на котором прогоняют разные ИИ-агенты в одинаковых условиях.
Пять бенчмарков закрывают разные стороны работы: GAIA — многошаговые задачи с поиском, ToolQA — вызов инструментов, BFCL — точность вызова функций, HotpotQA — ответ из нескольких документов, GPQA — вопросы уровня профильной экспертизы.
Описания функций у корпоративных ИИ-агентов почти не различаются — это видно в разборе 12 решений российского рынка. Проверяемая разница появляется на замере: один и тот же список задач, одинаковые условия, сравнимый результат.
Коротко: бенчмарк — это список заданий, где заранее известен правильный ответ.
- Разные инструменты прогоняют по одному и тому же списку при одинаковых условиях, а результат показывает долю заданий, с которыми инструмент справился.
5 бенчмарков и что они проверяют
GAIA
Многошаговые задачи, где ответ собирается через поиск и несколько инструментов.
- Проверяет, доводит ли агент задачу до конца.
ToolQA
Ответы по данным через вызов инструментов.
- Проверяет, берёт ли агент факт из источника вместо того, чтобы достроить его самому.
BFCL
Точность вызова функций: правильное имя, правильные аргументы, правильный порядок.
- Ошибка здесь ломает действие в рабочей системе.
HotpotQA
Ответ, который собирается из нескольких документов сразу.
- Ближе всего к работе по базе знаний компании.
GPQA
Вопросы уровня профильной экспертизы.
- Проверяет рассуждение на сложных предметных задачах.
Как читать результат
- Доля решённых задач: число от 0 до 1. 0,571 означает, что агент справился с 57 % заданий бенчмарка.
- Сравнение только между бенчмарками одного типа: цифры GPQA и BFCL измеряют разное, складывать их бессмысленно.
- Разрыв важнее абсолютного значения: на одном бенчмарке 0,86 против 0,80 говорит больше, чем высокий балл в отрыве от второго участника.
- Условия прогона: модель, число попыток и формат ответа фиксируются, иначе результат не воспроизводится.
Почему модель у участников должна быть одна
ИИ-агент состоит из двух частей: языковой модели и обвязки — планирования, вызова инструментов, проверки результата. При разных моделях замер показывает качество модели, а не устройство агента. Когда модель одна, разница относится к обвязке: как агент строит план, как выбирает инструмент, как проверяет себя.
Как это выглядит на живом прогоне
Айву и Claude Code прогнали на одной модели DeepSeek по этим 5 бенчмаркам, всего 1063 задачи. Ниже результат по каждому бенчмарку и расход на прогон.
Результат по бенчмаркам
Расход на один и тот же прогон
расход на тот же объём работы
Чего бенчмарки не показывают
Бенчмарк проверяет устройство инструмента на общих задачах. Он ничего не говорит о документах конкретной компании, о её регламентах и о том, как агент поведёт себя на вопросах сотрудников. Решение о внедрении принимается по замеру на своих данных.
Как повторить замер на своих задачах
- 01Собрать 30-50 реальных вопросов сотрудников с эталонными ответами. Методика — в статье как измерить качество ответов.
- 02Зафиксировать модель: у всех участников замера она должна быть одной.
- 03Прогнать набор и посчитать долю точных ответов, долю ответов со ссылкой на источник и расход на запрос.
- 04Сравнить с текущим порядком работы: сколько времени занимает та же задача сейчас. Расчёт — в калькуляторе окупаемости.
Частые вопросы
- Что такое бенчмарк ИИ-агента?
- Открытый список задач с известными правильными ответами, на котором прогоняют разные ИИ-агенты при одинаковых условиях. Результат показывает долю решённых задач и позволяет сравнить инструменты между собой.
- Какие бенчмарки применяются для ИИ-агентов?
- GAIA — многошаговые задачи с поиском и инструментами, ToolQA — ответы по данным через вызов инструментов, BFCL — точность вызова функций, HotpotQA — ответ из нескольких документов, GPQA — вопросы уровня профильной экспертизы.
- Почему сравнение идёт при одной языковой модели?
- ИИ-агент состоит из модели и обвязки. При разных моделях замер показывает качество модели, а не устройство агента; при одной модели разница относится к планированию, вызову инструментов и проверке результата.
- Какой российский ИИ-агент проходил открытый замер?
- Айва (WAIVE): прогон на 5 открытых бенчмарках, 1063 задачи, одна языковая модель с Claude Code. Результаты по каждому бенчмарку и расход опубликованы на странице замеров.
- Заменяет ли открытый замер проверку на своих данных?
- Нет. Бенчмарк показывает устройство инструмента на общих задачах, а решение о внедрении принимается по проверочному набору из вопросов сотрудников компании.