Экономика токенов начинается с простой вещи: большая языковая модель не работает бесплатно даже тогда, когда пользователь видит только одно поле для запроса и одну кнопку «Отправить». За каждым ответом стоят вычисления, входной контекст, генерация результата, обращения к инструментам и, в случае AI-агентов, целая последовательность промежуточных действий. Поэтому для бизнеса вопрос постепенно меняется: уже недостаточно знать, сколько стоит миллион токенов. CIO важно понимать, сколько стоит выполнение конкретной задачи с помощью AI и какую ценность эта работа создаёт.
Токены — это не ценность AI. Это счёт за использование AI.
Особенно заметно это становится с распространением агентных систем. Один запрос пользователя может запустить несколько AI-агентов, каждый из которых несколько раз обращается к LLM, использует собственный контекст, вызывает инструменты, проверяет результат и при необходимости повторяет операцию. В результате стоимость бизнес-задачи может оказаться на порядки выше стоимости одного ответа модели. Именно поэтому экономика AI постепенно превращается из задачи разработчиков в новую область управления для CIO.
- Что такое экономика токенов
- Почему цена токена перестаёт быть главным показателем
- От стоимости токена к стоимости бизнес-задачи
- Из чего складывается стоимость токенов
- Контекст становится экономическим активом
- Экономика контекста
- Почему AI-агент намного дороже обычного запроса
- Refinement — скрытый потребитель токенов
- Один запрос пользователя не равен одному LLM-вызову
- Экономика многоагентной системы
- Модель не должна быть одинаковой для всех задач
- Дорогая модель может оказаться дешёвой
- Token productivity: сколько полезной работы приходится на токен
- Стоимость ошибки иногда выше стоимости токенов
- AI FinOps: управление расходами на искусственный интеллект
- Какие показатели должен видеть CIO
- Стоимость одного результата важнее стоимости одного токена
- Экономика workflow
- Пример: AI для разработки программного обеспечения
- Экономика harness
- Самый дорогой токен — тот, который не приблизил систему к результату
- Почему оптимизация токенов может увеличить расходы
- Не токены, а ROI
- Стоимость автоматизации и стоимость интеллекта
- Экономика агента как новая единица управления
- Как CIO считать экономику AI-проекта
- Почему масштабирование меняет экономику
- Когда агент экономически невыгоден
- Экономика качества
- AI FinOps должен управлять не запретами, а спросом
- AI Gateway как экономический слой
- Экономика токенов и архитектура enterprise AI
- От Token Economics к Agent Economics
- Token Economics → Agent Economics → Business Economics
- Что должен считать CIO
- Токены становятся новой единицей IT-экономики
Что такое экономика токенов
Экономика токенов, или token economics применительно к LLM, — это подход к оценке и управлению затратами на использование больших языковых моделей. В простейшем случае речь идёт о стоимости входных и выходных токенов. В корпоративной системе этого уже недостаточно: необходимо учитывать контекст, количество обращений к модели, выбор модели, вызовы инструментов, повторные попытки, проверки и другие компоненты AI-workflow.
Токен — небольшая единица текста, которую модель использует при обработке информации. Пользователь видит слова, предложения и документы, а модель работает с последовательностью токенов. Поэтому стоимость LLM обычно рассчитывается не за символ или слово, а за определённое количество входных и выходных токенов.
В классическом сценарии всё выглядит достаточно просто:
Пользователь
│
▼
запрос
│
▼
LLM
│
▼
ответ
Но корпоративное применение AI быстро усложняет эту картину:
БИЗНЕС-ЗАДАЧА │ ▼ AI-агент / Harness │ ┌──────────────────┼──────────────────┐ ▼ ▼ ▼ LLM Context Tools │ │ │ └──────────────────┼──────────────────┘ ▼ ответ │ ▼ проверка результата │ ┌────────┴────────┐ │ │ OK RETRY │ │ ▼ └──────► LLM результат
В этом случае уже бессмысленно считать только цену одного вызова LLM. Нужно считать стоимость выполнения всего workflow.
Почему цена токена перестаёт быть главным показателем
В первые годы распространения генеративного AI было естественно сравнивать модели по стоимости одного миллиона токенов. Это действительно полезная характеристика при выборе API, но для корпоративной эксплуатации она показывает только часть картины.
Одна и та же задача может потребовать совершенно разного количества токенов в зависимости от того, какая модель используется, сколько информации ей передаётся, сколько раз она вызывается и сколько итераций проходит агент.
ОДНА И ТА ЖЕ БИЗНЕС-ЗАДАЧА
Вариант А:
запрос → LLM → ответ
↓
20 000 токенов
Вариант Б:
запрос → агент → LLM → поиск → LLM → проверка → LLM
↓
180 000 токенов
Вариант В:
запрос → агент 1 → агент 2 → агент 3
↓ ↓ ↓
LLM LLM LLM
↓ ↓ ↓
350 000 токенов
При этом третий вариант вовсе не обязательно плох. Если он позволяет автоматически выполнить сложную задачу, которую раньше несколько часов выполняли специалисты, дополнительные токены могут быть экономически оправданы.
Поэтому правильный вопрос звучит не так: «Как уменьшить количество токенов?» Намного важнее спросить: «Какую ценность мы получаем на каждый потраченный объём AI-вычислений?»
Эта логика всё чаще появляется и в корпоративной практике. В материалах McKinsey 2026 года подчёркивается, что снижение цены отдельных токенов не гарантирует снижения совокупных расходов: агентные процессы увеличивают число обращений к моделям, объём контекста, количество проверок и повторных операций.
От стоимости токена к стоимости бизнес-задачи
Для CIO полезно рассматривать несколько уровней экономики AI.
TOKEN ECONOMICS
Стоимость токенов
│
▼
MODEL ECONOMICS
Стоимость вызовов разных LLM
│
▼
AGENT ECONOMICS
Стоимость работы AI-агента
│
▼
WORKFLOW ECONOMICS
Стоимость выполнения процесса
│
▼
BUSINESS ECONOMICS
Стоимость и ценность бизнес-результата
Например, компания внедряет AI для обработки входящих договоров.
На первом уровне можно посчитать количество токенов. На втором — определить, какую модель использовать для распознавания, извлечения условий и анализа рисков. На третьем — посчитать стоимость работы агента. На четвёртом — учесть OCR, поиск документов, обращение к справочникам, проверки и передачу результатов в СЭД. И только на пятом уровне становится понятно, сколько стоит обработка одного договора целиком.
Если раньше сотрудник тратил на договор 40 минут, а AI-система выполняет основную работу за две минуты с последующей пятиминутной проверкой специалиста, именно это и является экономической единицей анализа.
Из чего складывается стоимость токенов
Стоимость одного обращения к LLM зависит не только от текста, который написал пользователь. В корпоративной системе в запрос может попадать значительный объём дополнительной информации.
| Компонент | Что происходит | Экономический эффект |
|---|---|---|
| System prompt | Правила работы модели | Постоянно увеличивает входной контекст |
| Запрос пользователя | Исходная задача | Обычно небольшая часть общего объёма |
| История диалога | Предыдущие сообщения | Может быстро увеличивать контекст |
| RAG-контекст | Найденные документы и фрагменты | Зависит от качества поиска |
| Инструменты | Результаты API, БД, поиска | Добавляют данные в последующие запросы |
| Output | Ответ модели | Часто стоит дороже входных токенов |
| Retry | Повторный запуск | Создаёт дополнительные расходы |
Таким образом, пользователь может написать всего 20 слов, но фактически LLM получит десятки тысяч токенов. Например, корпоративный агент поддержки может одновременно получить инструкцию, историю обращения, карточку клиента, регламент, найденные статьи базы знаний и результаты предыдущих действий.
Контекст становится экономическим активом
В обычном разговоре человек может сказать: «Продолжай с того места, где мы остановились». Для LLM это не всегда так просто. Модель не обладает человеческой памятью в том же смысле, поэтому необходимую информацию приходится передавать в контексте или получать из внешней памяти.
В агентных системах это особенно важно. Чем дольше выполняется задача, тем больше промежуточной информации появляется у агента.
ШАГ 1
Задача + инструкции
│
▼
LLM
│
▼
результат 1
ШАГ 2
Задача + инструкции + результат 1
│
▼
LLM
│
▼
результат 2
ШАГ 3
Задача + инструкции + результат 1 + результат 2
│
▼
LLM
Если архитектура каждый раз передаёт модели всё накопленное содержимое, контекст начинает расти. В результате компания платит не только за полезное рассуждение, но и за повторную обработку уже известной информации.
McKinsey в 2026 году отдельно выделяет long-lived context как один из ключевых факторов роста стоимости агентных процессов. В приведённом ими анализе агентные задачи могут потреблять на порядки больше токенов, чем обычные одношаговые обращения, именно из-за длительного контекста и последовательных взаимодействий.
Контекст в агентной системе становится не просто техническим ресурсом, а экономическим активом: чем больше информации система таскает между шагами, тем дороже обходится каждый следующий шаг.
Экономика контекста
Поэтому архитекторы AI-систем начинают решать задачу context engineering: какую информацию дать агенту, когда её дать, в каком виде и когда удалить или сжать.
Для этого используются разные подходы.
| Подход | Идея | Экономический эффект |
|---|---|---|
| RAG | Получать только релевантные фрагменты | Не передавать весь корпус документов |
| Context compression | Сжимать предыдущую информацию | Уменьшать повторную передачу контекста |
| Memory | Хранить информацию вне prompt | Избегать постоянного повторения данных |
| Selective retrieval | Запрашивать данные только при необходимости | Сокращать лишние вызовы |
| Caching | Повторно использовать уже обработанную информацию | Снижать стоимость повторных вычислений |
| Context isolation | Давать каждому агенту только нужную информацию | Не оплачивать обработку нерелевантного контекста |
Последний пункт особенно важен для многоагентной архитектуры. Если AI-разработчику не нужны все переговоры с заказчиком, зачем каждый раз передавать ему всю историю общения? Ему достаточно спецификации, архитектурных ограничений, relevant-кода и критериев готовности.
Почему AI-агент намного дороже обычного запроса
Обычная LLM отвечает на один запрос. Агент пытается достичь цели. Для этого он может планировать, обращаться к инструментам, анализировать полученные данные, исправлять собственные ошибки и повторять действия.
ПОЛЬЗОВАТЕЛЬ
│
▼
"Подготовь отчёт о продажах"
│
▼
┌──────────────────────────────┐
│ AI-АГЕНТ │
│ │
│ 1. Понять задачу │
│ 2. Найти данные │
│ 3. Вызвать API │
│ 4. Проанализировать данные │
│ 5. Построить расчёты │
│ 6. Проверить результат │
│ 7. Исправить ошибки │
│ 8. Сформировать отчёт │
│ │
└──────────────────────────────┘
│
▼
ОТЧЁТ
Каждый такой шаг потенциально означает новое обращение к модели или инструменту.
Поэтому одна пользовательская команда может превратиться в десятки LLM-вызовов.
Refinement — скрытый потребитель токенов
Первая генерация результата далеко не всегда является самой дорогой частью агентного процесса. Агенту необходимо убедиться, что результат соответствует требованиям. Он может запустить тест, увидеть ошибку, изменить решение, повторить тест и снова передать результат модели.
Генерация ↓ Проверка ↓ Ошибка? ┌─┴────────────────┐ Да Нет │ │ ▼ ▼ Исправление Результат │ ▼ Повторная проверка │ └──────► ...
Именно здесь появляется парадокс агентного AI: чем выше требование к качеству, тем больше вычислений может потребоваться для получения результата.
В исследовании экономики агентного программирования, которое цитирует McKinsey, значительная часть расходов приходится именно на refinement — проверку, исправление и повторную верификацию результата.
Один запрос пользователя не равен одному LLM-вызову
Это одно из самых важных правил для расчёта бюджета AI.
Предположим, сотрудник нажимает одну кнопку: «Проверь договор».
Система может выполнить примерно такой workflow:
"Проверь договор"
│
▼
Агент получает документ
│
▼
LLM: определить тип договора
│
▼
RAG: найти соответствующий регламент
│
▼
LLM: проверить условия
│
▼
API: получить данные контрагента
│
▼
LLM: сравнить данные
│
▼
LLM: сформировать список рисков
│
▼
LLM: проверить собственный вывод
│
▼
Результат
Для пользователя это один запрос. Для инфраструктуры — целая последовательность операций.
Экономика многоагентной системы
Следующий уровень сложности — несколько специализированных агентов. Здесь уже появляется архитектура, которую удобно связывать с понятием harness.
HARNESS ┌───────────────────────────────────────────────────────┐ │ │ │ ┌──────────────┐ ┌───────────────┐ │ │ │ AI-АНАЛИТИК │───►│ AI-РАЗРАБОТЧИК│ │ │ │ │ │ │ │ │ │ Context A │ │ Context B │ │ │ │ Tools A │ │ Tools B │ │ │ │ LLM │ │ LLM │ │ │ └──────────────┘ └──────┬────────┘ │ │ │ │ │ ▼ │ │ ┌───────────────┐ │ │ │ AI-ТЕСТИРОВЩИК│ │ │ │ │ │ │ │ Context C │ │ │ │ Tools C │ │ │ │ LLM │ │ │ └───────────────┘ │ │ │ │ Оркестрация • Правила • Memory • Tools • Checks │ └───────────────────────────────────────────────────────┘
Каждый агент может использовать одну и ту же или разные модели. У каждого может быть собственный контекст. Один агент может использовать дешёвую модель для классификации, другой — более мощную модель для проектирования, третий — специализированную модель для анализа кода.
С экономической точки зрения это означает, что единицей затрат становится уже не LLM-вызов, а агентный запуск.
Модель не должна быть одинаковой для всех задач
Одна из самых очевидных ошибок — использовать самую мощную и дорогую модель для любой операции.
ЗАДАЧА
│
┌─────────┼─────────┐
▼ ▼ ▼
Простая Средняя Сложная
│ │ │
▼ ▼ ▼
Small LLM Mid LLM Frontier LLM
Классификация документа, извлечение даты, преобразование формата или определение языка обычно не требуют той же вычислительной мощности, что архитектурное проектирование, сложное программирование или анализ неоднозначного бизнес-кейса.
Поэтому появляется model routing — автоматический выбор модели под конкретную задачу.
Например:
| Задача | Подход | Почему |
|---|---|---|
| Классификация тикета | Недорогая модель | Небольшая сложность |
| Извлечение реквизитов | Недорогая модель | Структурированная операция |
| Подготовка резюме | Средняя модель | Нужно понимание контекста |
| Анализ архитектуры | Мощная модель | Высокая сложность рассуждения |
| Сложная генерация кода | Мощная модель | Высокая цена ошибки |
McKinsey в анализе корпоративной AI-экономики также выделяет intelligent model routing как один из способов сопоставлять уровень «интеллекта» модели с конкретным этапом работы. Использовать frontier-модель для каждой операции — не обязательно экономически оправданно.
Дорогая модель может оказаться дешёвой
Здесь есть важный нюанс. Сравнивать модели только по цене токена неправильно.
Представим две модели.
Модель А Стоимость: $1 Решает задачу за 10 итераций Модель Б Стоимость: $4 Решает задачу за 2 итерации
На уровне цены одного вызова модель Б кажется в четыре раза дороже. Но если одна задача требует десяти обращений к модели А и двух к модели Б, совокупная экономика может оказаться совсем другой.
Поэтому правильная метрика — не только cost per token, но и cost per completed task.
Token productivity: сколько полезной работы приходится на токен
Можно ввести условный показатель token productivity — производительность токенов.
TOKEN PRODUCTIVITY полезный результат ──────────────────────── затраченные AI-ресурсы
Например, система потратила 100 000 токенов. Но из них 30 000 ушли на повторную передачу контекста, 15 000 — на неудачные tool calls, 10 000 — на retries.
100 000 токенов │ ├── 45 000 — полезная работа ├── 30 000 — повторный контекст ├── 15 000 — неудачные действия └── 10 000 — retries
Это не означает, что 55% токенов обязательно являются «плохими». Иногда проверка и повторная попытка необходимы для качества. Но такая декомпозиция позволяет увидеть, где именно возникает расход.
Стоимость ошибки иногда выше стоимости токенов
Представим AI-агента, который автоматически обрабатывает закупочные заявки.
Дополнительные 50 000 токенов могут стоить компании относительно немного. Но ошибка, из-за которой система неверно интерпретировала заявку на крупную сумму, может привести к гораздо большим последствиям.
Поэтому оптимизация AI не должна выглядеть так:
"Уменьшить токены любой ценой"
Правильнее:
Снизить ненужные расходы
+
сохранить требуемое качество
+
снизить стоимость человеческой проверки
+
сохранить управляемость риска
Именно поэтому в экономике агентных систем необходимо учитывать human-in-the-loop, стоимость контроля и стоимость ошибок. В анализе McKinsey 2026 года для ряда агентных сценариев человеческий контроль может составлять большую часть переменных расходов, то есть стоимость токенов сама по себе не показывает полную стоимость процесса.
AI FinOps: управление расходами на искусственный интеллект
Когда AI использует несколько подразделений, десятки приложений и несколько поставщиков моделей, возникает новая управленческая задача — AI FinOps.
По смыслу это близко к FinOps в облачной инфраструктуре: компания должна понимать, кто, где, зачем и сколько потребляет вычислительных ресурсов.
AI FINOPS
│
┌────────────────────┼────────────────────┐
▼ ▼ ▼
Visibility Optimization Governance
│ │ │
▼ ▼ ▼
Кто тратит? Как снизить? Кто может?
На что? Какую модель? Какие лимиты?
Сколько? Какой workflow? Какие правила?
Для CIO особенно важно, что AI-затраты могут быть распределены между API моделей, корпоративными copilot-продуктами, AI-функциями SaaS, собственными приложениями и экспериментальными средами. В исследовании McKinsey 2026 года отмечается, что у компаний существенная часть AI-расходов может оставаться фрагментированной между такими каналами, что затрудняет получение единой картины затрат.
Какие показатели должен видеть CIO
Простого показателя «потрачено $X на OpenAI» или «потрачено Y миллионов токенов» недостаточно.
| Метрика | Что показывает |
|---|---|
| Tokens per user | Потребление AI отдельным пользователем |
| Tokens per task | Расход на выполнение задачи |
| Cost per task | Стоимость одной AI-операции |
| Cost per agent run | Стоимость запуска агента |
| Input / output ratio | Соотношение входного и выходного объёма |
| Context size | Размер передаваемой модели информации |
| Retry rate | Доля повторных запусков |
| Tool calls per task | Сложность agentic workflow |
| Human review rate | Доля результатов, требующих человека |
| Cost per completed outcome | Стоимость реально завершённого результата |
Последний показатель особенно важен. Если 10 000 AI-запусков создали только 6 000 пригодных результатов, нельзя считать экономику как стоимость 10 000 успешных операций.
Стоимость одного результата важнее стоимости одного токена
Рассмотрим условный Service Desk.
AI-агент получает обращение пользователя, определяет категорию, ищет решение в базе знаний, проверяет состояние оборудования и формирует ответ.
Допустим:
Стоимость AI-обработки тикета = 0,08 $ Стоимость обработки человеком = 2,50 $ Доля тикетов, решённых AI = 60% Доля тикетов с передачей человеку = 40%
Тогда имеет смысл считать не стоимость токенов как таковых, а среднюю стоимость закрытого тикета с учётом человеческой работы.
Если же AI начинает ошибаться и 70% тикетов требуют проверки человека, дешёвый token cost уже не спасает экономику процесса.
Экономика workflow
Для CIO удобнее всего перейти от отдельных вызовов к модели полной стоимости workflow.
FULLY LOADED AI COST LLM + RAG + Vector DB + Tools / API + Orchestration + Harness + Monitoring + Security + Human review + Retries = СТОИМОСТЬ ВЫПОЛНЕННОЙ ЗАДАЧИ
Это особенно важно в enterprise. LLM API может быть относительно небольшой строкой расходов, но вокруг него появляется инфраструктура: API Gateway, observability, безопасность, оркестрация, базы данных, хранение контекста, интеграции и контроль действий агентов.
Поэтому правильный TCO корпоративного AI должен включать не только счёт поставщика LLM.
Пример: AI для разработки программного обеспечения
Рассмотрим AI SDLC.
Пользователь создаёт User Story:
Как руководитель подразделения, я хочу видеть статус согласования заявки, чтобы понимать, где находится процесс.
Наивный подход предполагает один запрос к LLM: «Напиши код».
А AI-native workflow может выглядеть иначе:
User Story
│
▼
AI Product Analyst
│
├── Context: требования
└── LLM
│
▼
Specification
│
▼
AI Architect
│
├── Context: архитектура
└── LLM
│
▼
Technical Design
│
▼
AI Developer
│
├── Context: код + specification
└── LLM
│
▼
Code
│
▼
AI Tester
│
├── Context: требования + код + тесты
└── LLM
│
▼
Tests
│
├── FAIL ──► Developer
│
└── PASS
│
▼
Release
Стоимость такой системы будет складываться из работы нескольких агентов, а не одного запроса.
Но если она сокращает время разработки с нескольких дней до нескольких часов, экономический эффект может многократно превышать стоимость токенов.
Экономика harness
Здесь появляется важная связь с архитектурой AI-систем.
Harness можно рассматривать как управляющую среду, которая соединяет LLM, AI-агентов, контексты, инструменты, память, правила и проверки.
HARNESS ┌──────────────────────────────────────────────────┐ │ │ │ Context Rules Memory Tools │ │ │ │ │ │ │ │ └─────────────┼───────────┼───────────┘ │ │ ▼ │ │ ┌──────────────┐ │ │ │ Orchestrator │ │ │ └───────┬──────┘ │ │ │ │ │ ┌───────────┼───────────┐ │ │ ▼ ▼ ▼ │ │ Agent Agent Agent │ │ │ │ │ │ │ LLM LLM LLM │ │ │ │ │ │ │ Ctx A Ctx B Ctx C │ │ │ │ Checks / Guardrails │ └──────────────────────────────────────────────────┘
Экономика harness заключается в том числе в том, как он организует использование интеллекта.
Хорошо спроектированный harness может не отправлять огромный контекст каждому агенту, выбирать подходящую модель, ограничивать ненужные циклы, кэшировать повторяющиеся операции и останавливать workflow после достижения необходимого результата.
Таким образом, harness становится не только технической обвязкой, но и механизмом управления AI-расходами.
Самый дорогой токен — тот, который не приблизил систему к результату
Это полезное практическое правило для проектирования AI-систем.
Токены могут расходоваться на работу, которая непосредственно создаёт результат. А могут — на повторное чтение документов, лишние рассуждения, неправильные вызовы инструментов, бесконечные циклы и чрезмерно подробные ответы.
ТОКЕНЫ
│
┌───────────┴───────────┐
▼ ▼
Приближают к цели Не приближают
│ │
▼ ▼
Полезный расход Оптимизировать
Однако здесь важно не впасть в другую крайность. Проверка результата тоже требует токенов, но может существенно снизить стоимость ошибок. Поэтому задача AI FinOps — не вырезать все дополнительные вызовы, а определить, какие вычисления создают экономическую ценность.
Почему оптимизация токенов может увеличить расходы
Представим систему, которая автоматически анализирует заявки.
Архитектор решил сократить контекст в два раза. Расход токенов действительно снизился. Но одновременно модель стала получать меньше информации и чаще ошибаться.
Меньше контекста
↓
Меньше токенов
↓
Меньше стоимость LLM
↓
Больше ошибок
↓
Больше ручных проверок
↓
Больше работы людей
↓
ВЫШЕ ПОЛНАЯ СТОИМОСТЬ
Поэтому правильная оптимизация должна смотреть на полный workflow.
Не токены, а ROI
В конечном счёте CIO интересует не количество токенов, а соотношение стоимости AI и создаваемого эффекта.
Условную модель можно представить так:
ЦЕННОСТЬ
│
▼
┌─────────────────┐
│ AI WORKFLOW │
└────────┬────────┘
│
▼
ЗАТРАТЫ
│
┌───────────────┼────────────────┐
▼ ▼ ▼
LLM Infrastructure People
tokens tools oversight
Например, автоматизация обработки одного обращения может стоить 0,30 доллара AI-ресурсов и требовать ещё 0,50 доллара человеческого контроля. Итого стоимость операции — 0,80 доллара. Если раньше аналогичная операция обходилась компании в 5 долларов, появляется экономический эффект.
Если же AI стоит 0,10 доллара, но требует 5 долларов ручной проверки, никакой экономии нет.
Стоимость автоматизации и стоимость интеллекта
Традиционная автоматизация обычно работает по принципу:
ЕСЛИ условие A ТО выполнить действие B
AI-агент способен действовать в менее детерминированной среде:
Понять задачу
↓
Найти информацию
↓
Оценить варианты
↓
Выбрать действие
↓
Проверить результат
↓
При необходимости изменить решение
За эту гибкость компания и платит. Поэтому появляется новая экономическая категория — стоимость машинного интеллекта.
В этом смысле токен похож на киловатт-час в энергетике или CPU time в вычислительной инфраструктуре. Но для бизнеса важен не сам ресурс, а то, какую работу он позволяет выполнить.
Экономика агента как новая единица управления
В традиционном IT бюджет часто строится вокруг серверов, лицензий, пользователей, приложений и проектов. Для AI постепенно добавляется новая единица — AI run, то есть один завершённый запуск интеллектуального workflow.
| Старая модель IT | AI-native модель |
|---|---|
| Количество пользователей | Количество AI-запусков |
| Лицензия | Потребление интеллекта |
| Серверная нагрузка | Token / inference load |
| Транзакция | Agent run |
| Стоимость процесса | Cost per completed outcome |
| Поддержка системы | Human oversight + AI operations |
Это меняет и подход к бюджетированию.
Как CIO считать экономику AI-проекта
Практически расчёт можно начать с одной конкретной бизнес-задачи.
Например, компания хочет автоматизировать обработку входящих заявок.
1. Сколько заявок в месяц?
↓
2. Сколько стоит обработка человеком?
↓
3. Сколько заявок может обработать AI?
↓
4. Сколько стоит один AI run?
↓
5. Сколько стоит инфраструктура?
↓
6. Сколько требуется human review?
↓
7. Сколько ошибок возникает?
↓
8. Сколько стоит полностью завершённая операция?
↓
9. Какой экономический эффект?
Только после этого можно принимать решение о масштабировании.
Почему масштабирование меняет экономику
У AI-систем есть интересная особенность: некоторые расходы являются фиксированными, а некоторые зависят от количества операций.
FIXED COSTS
Архитектура
Интеграции
Разработка
Security
Monitoring
│
▼
VARIABLE COSTS
LLM
Tools
Storage
API
Human review
│
▼
TOTAL COST
```
Если система выполняет 100 операций в месяц, стоимость разработки и интеграции может выглядеть огромной относительно результата. Если та же система выполняет миллион операций, фиксированные затраты распределяются по большему числу результатов.
Поэтому для agentic AI особенно интересны масштабируемые повторяющиеся процессы. McKinsey в анализе 2026 года отмечает, что экономика агентных workflow особенно привлекательна там, где есть большой объём повторяемой работы и возможность многократно использовать созданных агентов.
Когда агент экономически невыгоден
Не всякую задачу имеет смысл превращать в agentic workflow.
Если операция занимает у человека десять секунд и выполняется сто раз в месяц, создание многоагентной системы может быть бессмысленным.
Простая задача
│
▼
Обычная автоматизация
│
▼
Rule / API / SQL / Script
Сложная задача
│
▼
AI Agent
│
▼
LLM + Context + Tools
```
Агент имеет смысл там, где присутствует достаточная сложность, вариативность, объём или стоимость человеческого труда.
Поэтому вопрос «можно ли здесь использовать AI?» должен уступить место вопросу: «даёт ли agentic workflow лучшую экономику, чем существующий способ выполнения работы?»
Экономика качества
У AI есть ещё одна особенность: качество результата и его стоимость часто связаны.
Можно попросить модель ответить быстро и дёшево. Можно дать ей больше контекста, использовать более мощную модель, включить дополнительные проверки и получить более надёжный результат.
КАЧЕСТВО
▲
│
│ ●
│ ●
│ ●
│ ●
└────────────────►
COST
Но эта зависимость не является линейной. Иногда небольшое увеличение расходов резко повышает качество. Иногда дополнительные токены практически ничего не меняют.
Поэтому задача архитектора — найти экономически оптимальный уровень качества для конкретного процесса.
AI FinOps должен управлять не запретами, а спросом
Плохая стратегия выглядит так: поставить всем жёсткий лимит токенов.
"Не трать больше X токенов" ```
Это действительно снижает расход, но может одновременно ухудшить качество и ограничить полезные сценарии. Более зрелая модель выглядит иначе:
AI DEMAND
│
┌───────────┼───────────┐
▼ ▼ ▼
Простая Средняя Критичная
задача задача задача
│ │ │
▼ ▼ ▼
Small Mid Frontier
│ │ │
└───────────┼───────────┘
▼
AI Gateway
│
Cost / Quality
Control
Система сама определяет, сколько интеллекта нужно конкретной операции.
AI Gateway как экономический слой
В крупной организации полезным архитектурным компонентом становится единая точка управления обращениями к моделям — AI Gateway. Отвечает за:
- маршрутизацию запросов между моделями;
- учёт токенов;
- контроль бюджета;
- кэширование;
- политику выбора модели;
- логирование;
- безопасность;
- ограничение доступа;
- сбор метрик по подразделениям и приложениям.
Тогда AI-потребление становится наблюдаемым и управляемым.
Applications
│
▼
┌───────────────────┐
│ AI GATEWAY │
│ │
│ Routing │
│ Cost control │
│ Security │
│ Logging │
│ Caching │
└─────────┬─────────┘
│
┌────┼────┬────┐
▼ ▼ ▼ ▼
LLM1 LLM2 LLM3 LLM4
Экономика токенов и архитектура enterprise AI
В результате экономика токенов начинает влиять непосредственно на архитектуру.
| Архитектурное решение | Экономический вопрос |
|---|---|
| RAG | Сколько контекста действительно нужно передать? |
| Memory | Что хранить вне контекста? |
| Multi-agent | Оправдывает ли специализация дополнительные вызовы? |
| Model routing | Какую модель использовать для каждого шага? |
| Harness | Как контролировать workflow и не допускать лишних циклов? |
| Human-in-the-loop | Где человек снижает риск, а где только увеличивает стоимость? |
| AI Gateway | Как централизовать управление потреблением? |
Таким образом, экономика AI становится архитектурной дисциплиной. Решения, которые раньше принимались только с точки зрения производительности, безопасности или удобства, теперь дополнительно оцениваются по стоимости интеллектуального потребления.
От Token Economics к Agent Economics
Постепенно происходит важный сдвиг.
2023
"Сколько стоит токен?"
↓
2024
"Сколько стоит запрос?"
↓
2025
"Сколько стоит использование AI?"
↓
2026
"Сколько стоит AI-agent run?"
↓
Дальше
"Сколько стоит завершённый бизнес-результат?"
Это не означает, что стоимость токенов перестаёт быть важной. Она остаётся фундаментальным параметром. Но она становится одним из компонентов более крупной экономической модели.
Token Economics → Agent Economics → Business Economics
В итоге всю концепцию можно свести к одной цепочке.
┌─────────────────────────────────────────────────────────┐
│ TOKEN ECONOMICS │
│ │
│ Input tokens + Output tokens + Context + Cache │
└──────────────────────────┬──────────────────────────────┘
↓
┌─────────────────────────────────────────────────────────┐
│ AGENT ECONOMICS │
│ │
│ LLM + Tools + Retries + Memory + Orchestration │
└──────────────────────────┬──────────────────────────────┘
↓
┌─────────────────────────────────────────────────────────┐
│ WORKFLOW ECONOMICS │
│ │
│ Agents + Systems + Human review + Security + Ops │
└──────────────────────────┬──────────────────────────────┘
↓
┌─────────────────────────────────────────────────────────┐
│ BUSINESS ECONOMICS │
│ │
│ Cost of completed task ↔ Value of completed task │
└─────────────────────────────────────────────────────────┘
Именно последний уровень становится главным для CIO. Бизнесу не нужны токены сами по себе. Ему нужны обработанные документы, закрытые обращения, написанный и протестированный код, подготовленные предложения, принятые решения и выполненные бизнес-процессы.
Что должен считать CIO
Зрелая система управления AI должна постепенно переходить от нескольких простых показателей к полноценной экономической модели.
AI COST
│
┌──────────────┼──────────────┐
▼ ▼ ▼
TOKEN AGENT HUMAN
COST COST COST
│ │ │
└──────────────┼──────────────┘
▼
WORKFLOW COST
│
▼
COMPLETED OUTCOME
│
▼
BUSINESS VALUE
Поэтому минимальный набор вопросов для AI-проекта выглядит примерно так:
- Сколько AI-операций выполняется?
- Сколько токенов приходится на одну операцию?
- Какие модели используются?
- Почему именно эти модели?
- Сколько стоит один agent run?
- Сколько стоит контекст?
- Сколько раз агент вызывает инструменты?
- Как часто происходят retries?
- Какова доля human review?
- Сколько стоит полностью завершённая задача?
- Какова стоимость ошибки?
- Какой экономический результат создаёт автоматизация?
Токены становятся новой единицей IT-экономики
В традиционном IT компания привыкла считать серверные ресурсы, лицензии, пользователей, транзакции и часы специалистов. В AI-native архитектуре появляется ещё одна важная категория — потребление машинного интеллекта.
Но токен сам по себе не является целью оптимизации. Его роль скорее похожа на единицу измерения вычислительной работы. Компания должна понимать, где токены превращаются в полезный результат, а где просто создают нагрузку.
Главная задача AI FinOps — не потратить как можно меньше токенов, а купить нужное количество машинного интеллекта и направить его туда, где он создаёт максимальную бизнес-ценность.
Отсюда меняется и роль CIO. Управление AI постепенно выходит за рамки выбора LLM и закупки лицензий. Нужно проектировать экономику AI-системы целиком: от контекста и маршрутизации моделей до harness, многоагентных workflow, человеческого контроля и стоимости конечного результата.
В этом смысле экономика токенов — только первый уровень новой дисциплины. Следующий уровень — экономика AI-агентов, затем экономика AI-enabled процессов, а конечная цель — экономика бизнес-результата, созданного искусственным интеллектом.
Именно поэтому вопрос будущего корпоративного AI звучит уже не как «какая LLM дешевле», а значительно шире: какое количество интеллекта нужно бизнесу, где его применять, как им управлять и сколько стоит один действительно завершённый результат.
