Блог
3 минуты чтениякачествоИИ-агенты

Бенчмарки ИИ-агентов: что проверяют GAIA, ToolQA, BFCL, HotpotQA и GPQA

Бенчмарк — открытый список задач с известными правильными ответами, на котором прогоняют разные ИИ-агенты в одинаковых условиях.

Пять бенчмарков закрывают разные стороны работы: GAIA — многошаговые задачи с поиском, ToolQA — вызов инструментов, BFCL — точность вызова функций, HotpotQA — ответ из нескольких документов, GPQA — вопросы уровня профильной экспертизы.

Описания функций у корпоративных ИИ-агентов почти не различаются — это видно в разборе 12 решений российского рынка. Проверяемая разница появляется на замере: один и тот же список задач, одинаковые условия, сравнимый результат.

Коротко: бенчмарк — это список заданий, где заранее известен правильный ответ.

  • Разные инструменты прогоняют по одному и тому же списку при одинаковых условиях, а результат показывает долю заданий, с которыми инструмент справился.

5 бенчмарков и что они проверяют

GAIA

Многошаговые задачи, где ответ собирается через поиск и несколько инструментов.

  • Проверяет, доводит ли агент задачу до конца.

ToolQA

Ответы по данным через вызов инструментов.

  • Проверяет, берёт ли агент факт из источника вместо того, чтобы достроить его самому.

BFCL

Точность вызова функций: правильное имя, правильные аргументы, правильный порядок.

  • Ошибка здесь ломает действие в рабочей системе.

HotpotQA

Ответ, который собирается из нескольких документов сразу.

  • Ближе всего к работе по базе знаний компании.

GPQA

Вопросы уровня профильной экспертизы.

  • Проверяет рассуждение на сложных предметных задачах.

Как читать результат

  • Доля решённых задач: число от 0 до 1. 0,571 означает, что агент справился с 57 % заданий бенчмарка.
  • Сравнение только между бенчмарками одного типа: цифры GPQA и BFCL измеряют разное, складывать их бессмысленно.
  • Разрыв важнее абсолютного значения: на одном бенчмарке 0,86 против 0,80 говорит больше, чем высокий балл в отрыве от второго участника.
  • Условия прогона: модель, число попыток и формат ответа фиксируются, иначе результат не воспроизводится.

Почему модель у участников должна быть одна

ИИ-агент состоит из двух частей: языковой модели и обвязки — планирования, вызова инструментов, проверки результата. При разных моделях замер показывает качество модели, а не устройство агента. Когда модель одна, разница относится к обвязке: как агент строит план, как выбирает инструмент, как проверяет себя.

Как это выглядит на живом прогоне

Айву и Claude Code прогнали на одной модели DeepSeek по этим 5 бенчмаркам, всего 1063 задачи. Ниже результат по каждому бенчмарку и расход на прогон.

бенчмарки, где Айва впереди
3:2
АйваClaude Code
GAIA
многошаговые задачи
ToolQA
вызов инструментов
HotpotQA
ответ по нескольким документам

Результат по бенчмаркам

АйваClaude Code
GAIAМногошаговые задачи с поиском и инструментами
0,5710,516
ToolQAОтветы по данным через вызов инструментов
0,8600,800
BFCLТочность вызова функций
0,6080,820
HotpotQAОтвет, собранный из нескольких документов
0,6550,481
GPQAВопросы уровня профильной экспертизы
0,7980,832

Расход на один и тот же прогон

Айва4,47 долл.
Claude Code6,77 долл.
−34%

расход на тот же объём работы

Чего бенчмарки не показывают

Бенчмарк проверяет устройство инструмента на общих задачах. Он ничего не говорит о документах конкретной компании, о её регламентах и о том, как агент поведёт себя на вопросах сотрудников. Решение о внедрении принимается по замеру на своих данных.

Как повторить замер на своих задачах

  1. 01Собрать 30-50 реальных вопросов сотрудников с эталонными ответами. Методика — в статье как измерить качество ответов.
  2. 02Зафиксировать модель: у всех участников замера она должна быть одной.
  3. 03Прогнать набор и посчитать долю точных ответов, долю ответов со ссылкой на источник и расход на запрос.
  4. 04Сравнить с текущим порядком работы: сколько времени занимает та же задача сейчас. Расчёт — в калькуляторе окупаемости.

Частые вопросы

Что такое бенчмарк ИИ-агента?
Открытый список задач с известными правильными ответами, на котором прогоняют разные ИИ-агенты при одинаковых условиях. Результат показывает долю решённых задач и позволяет сравнить инструменты между собой.
Какие бенчмарки применяются для ИИ-агентов?
GAIA — многошаговые задачи с поиском и инструментами, ToolQA — ответы по данным через вызов инструментов, BFCL — точность вызова функций, HotpotQA — ответ из нескольких документов, GPQA — вопросы уровня профильной экспертизы.
Почему сравнение идёт при одной языковой модели?
ИИ-агент состоит из модели и обвязки. При разных моделях замер показывает качество модели, а не устройство агента; при одной модели разница относится к планированию, вызову инструментов и проверке результата.
Какой российский ИИ-агент проходил открытый замер?
Айва (WAIVE): прогон на 5 открытых бенчмарках, 1063 задачи, одна языковая модель с Claude Code. Результаты по каждому бенчмарку и расход опубликованы на странице замеров.
Заменяет ли открытый замер проверку на своих данных?
Нет. Бенчмарк показывает устройство инструмента на общих задачах, а решение о внедрении принимается по проверочному набору из вопросов сотрудников компании.

Читать дальше