замеры
Российский ИИ-агент Айва обошёл Claude Code на 3 бенчмарках из 5
1063 задачи, 5 открытых бенчмарков, одна языковая модель DeepSeek у Айвы и у Claude Code.
Айва отвечает точнее на 3 бенчмарках из 5, прогон обходится в 4,47 долл. против 6,77 долл.
Набор возможностей на рынке почти одинаковый — это видно в разборе 12 решений российского рынка. Проверяемая разница появляется на замере.
бенчмарки, где Айва впереди
3:2
АйваClaude Code
GAIA
многошаговые задачи
ToolQA
вызов инструментов
HotpotQA
ответ по нескольким документам
Результат по бенчмаркам
АйваClaude Code
GAIAМногошаговые задачи с поиском и инструментами
0,5710,516
ToolQAОтветы по данным через вызов инструментов
0,8600,800
BFCLТочность вызова функций
0,6080,820
HotpotQAОтвет, собранный из нескольких документов
0,6550,481
GPQAВопросы уровня профильной экспертизы
0,7980,832
Расход на один и тот же прогон
Айва4,47 долл.
Claude Code6,77 долл.
−34%
расход на тот же объём работы
Замер на открытых бенчмарках показывает устройство инструмента, а решение по внедрению принимается по замеру на своих данных.
- Методика проверочного набора описана в статье как измерить качество ответов ИИ-агента.
Как повторить замер на своих задачах
- 01Собрать 30-50 реальных вопросов сотрудников с эталонными ответами.
- 02Зафиксировать модель: сравнение идёт при одной и той же модели у всех участников.
- 03Прогнать набор и посчитать долю точных ответов, долю ответов со ссылкой на источник и расход на запрос.
- 04Сравнить результат с текущим порядком работы: сколько времени занимает та же задача сейчас. Расчёт — в калькуляторе окупаемости.
Частые вопросы
- Как сравнивали Айву и Claude Code и каким был результат?
- Прогон шёл на открытых бенчмарках при одной и той же языковой модели у обоих инструментов. Результат выше у Айвы на 3 бенчмарках из 5, расход на прогон — на треть меньше.
- Почему сравнение идёт на одной модели?
- При разных моделях результат отражает качество модели, а не устройство агента. Одна модель у обоих инструментов делает сравнение проверяемым.
- Как проверить ИИ-агента на своих данных?
- Проверочным набором из 30-50 реальных вопросов сотрудников: считаются доля точных ответов, доля ответов со ссылкой на источник и расход на запрос.