Apsara 2026 · Экономика · октябрь 2026
Сколько стоит ИИ-агент и как посчитать его эффект
Почему токены и часы разработки сбивают с толку, из чего на деле складывается цена агента и как компании на Apsara Conference 2026 считают его отдачу.
Артём Борисов - бизнес-консультант, внедрение AI-сотрудников ·
Коротко
Стоимость ИИ-агента правильно считать не в часах разработки и не в токенах, а как стоимость одной успешно выполненной задачи: все затраты на агента, делённые на число задач, которые он довёл до принятого результата. Так на Apsara Conference 2026 предложили мерить агентов Alibaba Cloud и NVIDIA. Ниже - из чего складывается цена агента, почему неудачные запуски съедают больше половины токенов, как я считаю эффект и почему дорогая модель часто не нужна.
Из чего складывается стоимость ИИ-агента
Когда меня спрашивают, сколько стоит ИИ-агент, почти всегда имеют в виду цену разработки. Это только первая строка сметы. Полная стоимость владения выглядит так:
- Внедрение: разбор процесса, подключение к CRM и учётным системам, настройка, экзамен на реальных кейсах. У меня внедрение стоит от 250 000 ₽.
- Модель: оплата токенов или собственного сервера с моделью.
- Инструменты и инфраструктура: вызовы API, поиск по базе знаний, песочница, хранение журналов.
- Повторы и неудачи. Запуски, которые до результата не дошли, но счёт за них пришёл.
- Люди вокруг агента. Кто-то проверяет черновики, разбирает исключения, поддерживает и дорабатывает. Эту строку забывают чаще остальных.
На SaaS-секции Apsara это сказали без обиняков: токены, маршрутизация между моделями, оценка качества и ручная проверка съедают маржу. Кто считает только цену модели, не видит большую часть затрат.
Ли Вэйнань из Alibaba разложил по секундам одну агентную задачу по коду длиной 130 секунд. Языковая модель работала всего 12% времени (16 с). Выполнение инструментов заняло 37% (48,5 с), ожидание и повторы - 43% (56 с). Его вывод мне нравится своей прямотой: оптимизировать только модель - значит оптимизировать самую маленькую часть системы.
Главная метрика - стоимость успешно выполненной задачи
Формула умещается в одну строку: стоимость успешной задачи = все затраты на агента / число успешно выполненных задач. Её показали сразу несколько секций: Alibaba на докладе о вычислительных кластерах, NVIDIA и партнёры по голосовым агентам. Когда одну и ту же метрику независимо приносят разные спикеры, я обычно к ней присматриваюсь.
Почему не токены? По данным Alibaba, неудачные запуски всё равно съедают 58% бюджета токенов. А одна и та же задача в разных запусках расходует токенов до 30 раз больше или меньше. Получается неприятная картина: цена токена падает, а цена результата растёт, если агент часто не доходит до конца.
| Как считают обычно | Что с этим не так | Что считать вместо |
|---|---|---|
| Часы разработки | Не говорят, сколько задач агент закроет | Затраты на внедрение и сопровождение на задачу |
| Цена токена | 58% токенов уходит на неудачные запуски | Стоимость одной успешной задачи |
| Скорость ответа | Модель - лишь 12% времени задачи | Время полного выполнения задачи |
| «Сэкономили часы» | Часы не всегда превращаются в деньги | Прирост выручки + экономия - полная стоимость |
Для голосовых агентов на секции Qwen Audio предложили свою версию метрики: стоимость одного успешно решённого обращения с учётом повторов, передачи человеку и контроля. Напомню, что все цифры конференции здесь - заявления спикеров, независимо их никто не проверял.
Как посчитать эффект ИИ-агента
Бао Юаньсун из Alibaba Cloud на логистическом форуме показал формулу, которой я пользуюсь почти без изменений:
«Эффект агента = прирост выручки + эффект эффективности - полная стоимость. При запуске ставить метрики и на эффективность, и на выручку.»
Сяо Вэнькэ из службы доставки ZTO добавил то, о чём забывают на старте: внедрение ещё не эффект. Эффект проверяется цепочкой «постоянное использование → реальное исполнение → улучшение метрики → бизнес-результат». Агент установлен, а сотрудники открывают его раз в неделю? Эффекта нет, сколько бы ни стоила разработка.
- Доля принятых черновиков. В медицинской сети PKU Healthcare врачи проверяют и подписывают AI-черновики медкарт. Доля принятых выросла с 61% на старте до 85% в среднем. По-моему, это самый трезвый KPI из всех: он показывает, сколько работы агент действительно снял с людей.
- Выручка, а не только экономия. Биржа грузов Manbang тиражировала опыт лучших продавцов на тысячи менеджеров: конверсия 8% выросла на 5-15 п.п., ROI 3,5.
- Каждый следующий сценарий дешевле. Там же новый сценарий обходится на 30% дешевле предыдущего, потому что инфраструктура и данные уже готовы.
Был и обратный пример, за который спикеру отдельное спасибо. Taobao Shangou показал, что при полной автоматизации из примерно 2000 задач разработки ИИ мог взять около 1000, а приёмку прошли только 66. Срок поставки сократился на 30%, но не в разы. Без метрики «принято с первого раза» такой результат легко записать в успехи.
Оплата за результат: как продают агентов
Раз меряют результат, логично за него и платить. На SaaS-секции описали лестницу монетизации: места и модули → вызовы или токены → единицы результата → доля от прироста.
Голосовое взыскание долгов
Агент Cloopen для потребкредитной компании: 20 тыс.+ звонков в день, затраты на 70% ниже, чем с людьми, возврат +15%.
Подтверждение заказов
Сеть ресторанов: 92% подтверждений, затраты -60%, приход гостей +18%.
Поддержка интернет-магазина
78% вопросов решены без человека, удовлетворённость 85%, пропускная способность ×5.
Там же назвали ограничение. Чистая оплата за результат возможна, только когда результат однозначно атрибутируется и принимается. Звонок подтвердил заказ - понятно. Агент «помог отделу продаж» - уже спорно. Поэтому на практике работает смесь: подписка, оплата за использование, оплата за результат и услуги.
Дорогая модель нужна реже, чем кажется
Самый наглядный пример - бенчмарк игровой платформы TapTap. Модель Qwen3.8-Max прошла уровень в 83,3% случаев при $1,17 за кейс, Qwen3.8-Flash - в 82,5% при $0,10. Разница в качестве 0,8 п.п., в цене - около 12 раз. Я бы на месте большинства заказчиков начинал с быстрой модели и переходил на дорогую, только когда видно, где именно она нужна.
- Делить работу между моделями. В Beike сильная модель отвечает за сложные рассуждения, а быстрая - за извлечение данных, сжатие и фоновые задачи.
- Пересматривать модель. В Full Truck Alliance замена базовой модели при тех же промптах и обвязке снизила стоимость той же задачи примерно до 1/4.
- Сравнивать поставщиков. У разных поставщиков API одной и той же модели пропускная способность на одинаковом запросе различалась до 4,9 раза, задержка первого токена - до 4,3 раза.
Как это посчитать в российском проекте
Цены моделей Alibaba в долларах и юанях к российскому проекту напрямую не приложить, а доступ российских компаний к продуктам Alibaba Cloud не подтверждён. Поэтому с конференции я везу метод расчёта, а не продукты и прайсы.
Во внедрениях я считаю эффект так. До запуска фиксирую базу: сколько времени и денег задача стоит сейчас. После запуска считаю стоимость одной успешной задачи и долю результатов, принятых без правок. В отчёте клиенту стоят рубли за выполненную задачу. Формулировку «сэкономили часы» я туда не пишу: часы не всегда превращаются в деньги.
- Электромонтажная компания «ЧенцЭлектро»: пакет документов по проекту за 15 минут вместо 2-3 дней, освобождено 35% времени команды.
- Юридическая компания: пакет до 13 документов за 3-5 минут вместо 30-60.
- Частная школа Babelfish: вместо четырёх систем одна, подписки с ~30 000 до ~2 000 ₽/мес.
Я бы начал с одной частой задачи, у которой понятен результат, и посчитал её текущую стоимость. Прикинуть окупаемость можно в калькуляторе. А чтобы агент не превратился в статью расходов, которую никто не контролирует, бюджет и права закладывают с первого дня - об этом статья о безопасности ИИ-агентов.
Вывод
Цена разработки говорит о стоимости агента меньше, чем кажется: в полную стоимость входят модель, инфраструктура, неудачные запуски и люди, которые проверяют работу агента. Сравнивать стоит стоимость одной успешно выполненной задачи с тем, во что эта задача обходится сейчас. По данным Alibaba, 58% токенов уходит на неудачные запуски, поэтому цена токена мало что говорит о цене результата. А дорогая модель нужна реже, чем кажется: в бенчмарке TapTap дешёвая отстала на 0,8 п.п. при цене в 12 раз ниже.
Что сделать
- 1Выберите одну частую задачу с понятным результатом и запишите, сколько раз в месяц её делают и сколько минут уходит на один раз.
- 2Посчитайте текущую стоимость этой задачи в рублях: время сотрудников, умноженное на стоимость их часа, плюс подписки на сервисы, которые для неё нужны.
- 3Договоритесь, что будет считаться успешно выполненной задачей, и заведите таблицу, куда записываются принятые без правок и отклонённые результаты.
- 4Прогоните цифры через калькулятор окупаемости на сайте и сравните текущую стоимость задачи с ожидаемой стоимостью успешной задачи у агента.
Частые вопросы
Сколько стоит ИИ-агент для бизнеса?+
Цена складывается из внедрения, оплаты модели, инфраструктуры и работы людей вокруг агента. У Артёма Борисова внедрение стоит от 250 000 ₽. Но сравнивать правильнее не цену разработки, а стоимость одной успешно выполненной задачи с тем, сколько эта задача стоит сейчас.
Как посчитать эффект от ИИ-агента?+
Эффект равен приросту выручки плюс экономия минус полная стоимость агента. Перед запуском фиксируют текущую стоимость задачи, после - стоимость успешной задачи с агентом. Полезный показатель - доля результатов, принятых без правок.
Почему нельзя считать стоимость агента в токенах?+
Потому что большая часть токенов уходит впустую: по данным Alibaba, неудачные запуски съедают 58% бюджета токенов. Одна и та же задача может потратить токенов в 30 раз больше или меньше. Значение имеет цена результата, а не цена токена.
Что такое стоимость успешно выполненной задачи?+
Все затраты на агента, делённые на число задач, которые он довёл до принятого результата. Метрика учитывает повторы, неудачные запуски и передачу задачи человеку. На Apsara 2026 её назвали главной метрикой агентов.
Нужна ли для агента самая дорогая модель?+
Чаще нет. В бенчмарке TapTap дешёвая модель Qwen3.8-Flash отстала от дорогой Max на 0,8 п.п. качества при цене примерно в 12 раз ниже. Сильную модель оставляют для сложных рассуждений, остальное отдают быстрой.
Источники
- Apsara Conference 2026, Ханчжоу, 22-24 сентября 2026
- Секция «Lingjun Full Upgrade: The AI Supercomputer for the Agentic Era» (Alibaba): разбор времени агентной задачи, стоимость успешной задачи
- Секция «NVIDIA Forum: Extreme Full Stack Co-Design Accelerates Agentic AI and Physical AI»: метрики агентной инфраструктуры
- Форум «H3C: Maximizing Token Efficiency»: различия поставщиков API
- Форум «Intelligence in Motion: Logistics & Mobility AI Forum»: формула эффекта, ZTO, Manbang
- Секция «Qwen Audio: Reshaping the Interaction Gateway»: оплата за результат, кейсы Cloopen
- Секция «The Agent Moment for SaaS: From Dev Efficiency to Business Growth»: монетизация, Taobao Shangou
- Форум «Trusted AI Cloud: Apsara Stack Full-Stack AI Innovation Forum»: кейс PKU Healthcare
- Форум «Create Without Limits: Alibaba Cloud AI Gaming Forum»: бенчмарк TapTap
- Секция «Enterprise Agents in Practice»: Full Truck Alliance, Beike
Об авторе. Артём Борисов - бизнес-консультант, внедряет AI-сотрудников в малом и среднем бизнесе: продажи, документы, учёт, мониторинг. Кейсы с цифрами - на главной странице.
Читайте также
Инструмент
Калькулятор окупаемости ИИ-сотрудника
Читать →
Apsara 2026 · Безопасность
Безопасность ИИ-агентов в компании: как дать агенту права и не потерять контроль
Читать →
Apsara 2026 · Внедрение ИИ
Почему внедрение ИИ в бизнес не даёт отдачи
Читать →
Apsara 2026 · Методика
Как внедрить ИИ-агента в компанию: один отдел, один сценарий, 90 дней
Читать →
Хотите применить это в своей компании?
Опишите процесс, который съедает больше всего ручного времени. Я покажу, как выглядело бы решение на ИИ-агенте и какие метрики оно изменит.