Сколько стоит языковая модель для компании
Оплата языковой модели считается в токенах: платят за текст запроса и за текст ответа. Счёт компании складывается из трёх частей: обращения к моделям, инфраструктура под индекс и развёрнутые модели, сопровождение решения.
Что такое токен и почему платят за него
Токен — единица текста для модели, примерно 2–3 символа русского текста. Страница договора занимает около 700 токенов. Тарификация раздельная: входящие токены (вопрос сотрудника и приложенные фрагменты документов) стоят дешевле исходящих (ответ модели).
Из чего складывается счёт
Обращения к моделям
Основная часть расходов. Зависит от числа запросов и объёма документов в каждом.
Инфраструктура
Серверы под индекс, векторную базу и развёрнутые модели, хранение документов.
Сопровождение
Обновление индекса, разбор ошибок, добавление источников и сценариев.
Отчётность
Учёт запросов по подразделениям и моделям, чтобы расходы были распределены.
Пример расчёта
Отдел из 15 человек задаёт по 12 вопросов в день. Это около 43 000 запросов в год. Средний запрос вместе с найденными фрагментами документов занимает 6000 входящих токенов, ответ — 700 исходящих. Годовой объём составит примерно 258 млн входящих и 30 млн исходящих токенов. При тарифах открытых моделей на серверах в России расходы на обращения укладываются в 400–700 тыс. руб. в год, точная сумма зависит от выбранной модели.
Разброс в счетах между компаниями с похожим числом сотрудников доходит до десяти раз. Причина обычно одна: объём документов, который система передаёт в каждый запрос. Настройка поиска убирает эту разницу.
Пять причин роста счёта и как его удержать
- 01Документы попадают в запрос целиком. Решение: настроить точность поиска и ограничить объём фрагментов, которые уходят в модель.
- 02Дорогая модель выполняет простые задачи. Решение: разделить задачи по моделям, отдать классификацию быстрой модели, разбор документов — сильной.
- 03История диалога передаётся полностью на каждом шаге. Решение: передавать последние сообщения и краткую выжимку предыдущих.
- 04Повторяющиеся запросы обрабатываются заново. Решение: включить кеширование частых ответов.
- 05Один сценарий обращается к модели по пять-семь раз. Решение: пересобрать сценарий под два обращения.
Дополнительно расходы держат под контролем отчёт с разбивкой по подразделениям и моделям и лимиты на подразделение: разовый всплеск виден в тот же день.
Частые вопросы
- Сколько стоит один ответ ИИ-агента?
- При работе с документами один ответ обходится в пределах нескольких рублей. Итоговая сумма зависит от выбранной модели и объёма текста в запросе.
- Что дешевле: развернуть модель у себя или платить за запросы?
- Собственное развёртывание окупается при постоянной высокой нагрузке. При неравномерных запросах оплата по факту обращений обходится дешевле.
- Как узнать расходы до внедрения?
- Замерить на пилоте: число запросов за две недели и средний объём токенов дают основу для годового прогноза.
- Как узнать расходы на языковые модели для своей компании?
- Расходы считаются по числу запросов и объёму токенов за две недели пилота. Роутер моделей WAIVE ведёт отчёт по количеству запросов и стоимости для каждой модели: сумма видна в разбивке по подразделениям.