Блог
3 минуты чтенияденьгиязыковые модели

Сколько стоит языковая модель для компании

Оплата языковой модели считается в токенах: платят за текст запроса и за текст ответа. Счёт компании складывается из трёх частей: обращения к моделям, инфраструктура под индекс и развёрнутые модели, сопровождение решения.

Что такое токен и почему платят за него

Токен — единица текста для модели, примерно 2–3 символа русского текста. Страница договора занимает около 700 токенов. Тарификация раздельная: входящие токены (вопрос сотрудника и приложенные фрагменты документов) стоят дешевле исходящих (ответ модели).

700
токенов в одной странице русского текста
4–8 тыс.
токенов в среднем запросе с документами
500–900
токенов в развёрнутом ответе

Из чего складывается счёт

Обращения к моделям

Основная часть расходов. Зависит от числа запросов и объёма документов в каждом.

Инфраструктура

Серверы под индекс, векторную базу и развёрнутые модели, хранение документов.

Сопровождение

Обновление индекса, разбор ошибок, добавление источников и сценариев.

Отчётность

Учёт запросов по подразделениям и моделям, чтобы расходы были распределены.

Пример расчёта

Отдел из 15 человек задаёт по 12 вопросов в день. Это около 43 000 запросов в год. Средний запрос вместе с найденными фрагментами документов занимает 6000 входящих токенов, ответ — 700 исходящих. Годовой объём составит примерно 258 млн входящих и 30 млн исходящих токенов. При тарифах открытых моделей на серверах в России расходы на обращения укладываются в 400–700 тыс. руб. в год, точная сумма зависит от выбранной модели.

Разброс в счетах между компаниями с похожим числом сотрудников доходит до десяти раз. Причина обычно одна: объём документов, который система передаёт в каждый запрос. Настройка поиска убирает эту разницу.

Пять причин роста счёта и как его удержать

  1. 01Документы попадают в запрос целиком. Решение: настроить точность поиска и ограничить объём фрагментов, которые уходят в модель.
  2. 02Дорогая модель выполняет простые задачи. Решение: разделить задачи по моделям, отдать классификацию быстрой модели, разбор документов — сильной.
  3. 03История диалога передаётся полностью на каждом шаге. Решение: передавать последние сообщения и краткую выжимку предыдущих.
  4. 04Повторяющиеся запросы обрабатываются заново. Решение: включить кеширование частых ответов.
  5. 05Один сценарий обращается к модели по пять-семь раз. Решение: пересобрать сценарий под два обращения.

Дополнительно расходы держат под контролем отчёт с разбивкой по подразделениям и моделям и лимиты на подразделение: разовый всплеск виден в тот же день.

Частые вопросы

Сколько стоит один ответ ИИ-агента?
При работе с документами один ответ обходится в пределах нескольких рублей. Итоговая сумма зависит от выбранной модели и объёма текста в запросе.
Что дешевле: развернуть модель у себя или платить за запросы?
Собственное развёртывание окупается при постоянной высокой нагрузке. При неравномерных запросах оплата по факту обращений обходится дешевле.
Как узнать расходы до внедрения?
Замерить на пилоте: число запросов за две недели и средний объём токенов дают основу для годового прогноза.
Как узнать расходы на языковые модели для своей компании?
Расходы считаются по числу запросов и объёму токенов за две недели пилота. Роутер моделей WAIVE ведёт отчёт по количеству запросов и стоимости для каждой модели: сумма видна в разбивке по подразделениям.

Читать дальше