замеры

Российский ИИ-агент Айва обошёл Claude Code на 3 бенчмарках из 5

1063 задачи, 5 открытых бенчмарков, одна языковая модель DeepSeek у Айвы и у Claude Code.

Айва отвечает точнее на 3 бенчмарках из 5, прогон обходится в 4,47 долл. против 6,77 долл.

Набор возможностей на рынке почти одинаковый — это видно в разборе 12 решений российского рынка. Проверяемая разница появляется на замере.

бенчмарки, где Айва впереди
3:2
АйваClaude Code
GAIA
многошаговые задачи
ToolQA
вызов инструментов
HotpotQA
ответ по нескольким документам

Результат по бенчмаркам

АйваClaude Code
GAIAМногошаговые задачи с поиском и инструментами
0,5710,516
ToolQAОтветы по данным через вызов инструментов
0,8600,800
BFCLТочность вызова функций
0,6080,820
HotpotQAОтвет, собранный из нескольких документов
0,6550,481
GPQAВопросы уровня профильной экспертизы
0,7980,832

Расход на один и тот же прогон

Айва4,47 долл.
Claude Code6,77 долл.
−34%

расход на тот же объём работы

Замер на открытых бенчмарках показывает устройство инструмента, а решение по внедрению принимается по замеру на своих данных.

Как повторить замер на своих задачах

  1. 01Собрать 30-50 реальных вопросов сотрудников с эталонными ответами.
  2. 02Зафиксировать модель: сравнение идёт при одной и той же модели у всех участников.
  3. 03Прогнать набор и посчитать долю точных ответов, долю ответов со ссылкой на источник и расход на запрос.
  4. 04Сравнить результат с текущим порядком работы: сколько времени занимает та же задача сейчас. Расчёт — в калькуляторе окупаемости.

Частые вопросы

Как сравнивали Айву и Claude Code и каким был результат?
Прогон шёл на открытых бенчмарках при одной и той же языковой модели у обоих инструментов. Результат выше у Айвы на 3 бенчмарках из 5, расход на прогон — на треть меньше.
Почему сравнение идёт на одной модели?
При разных моделях результат отражает качество модели, а не устройство агента. Одна модель у обоих инструментов делает сравнение проверяемым.
Как проверить ИИ-агента на своих данных?
Проверочным набором из 30-50 реальных вопросов сотрудников: считаются доля точных ответов, доля ответов со ссылкой на источник и расход на запрос.

Что ещё посмотреть