Apsara 2026 · Данные · октябрь 2026
ИИ для аналитики данных: почему агент ошибается в цифрах и как это исправить
Словарь метрик, расчёт кодом и эталонный набор вопросов: как Starbucks, Yanfeng, Anker и Amap добивались верных цифр от агентов, по докладам Apsara Conference 2026
Артём Борисов - бизнес-консультант, внедрение AI-сотрудников ·
Коротко
ИИ для аналитики данных перестаёт ошибаться в цифрах, когда у агента есть словарь метрик (семантический слой), считает детерминированный код, а модель только понимает вопрос и объясняет ответ. Так это устроили Starbucks, Yanfeng и Anker, чьи кейсы показали на Apsara Conference 2026 в Ханчжоу. Ниже разбираю, почему «голый» перевод вопроса в SQL не работает, какую точность компании получили до и после, как навести порядок в данных и как я применяю эту схему во внедрениях.
Почему ИИ ошибается в цифрах, даже когда SQL написан верно
Секции по данным на Apsara 2026 крутились вокруг одной неприятной мысли. Универсальный агент пишет синтаксически правильный SQL-запрос и делает по нему неверный вывод. Он не знает, что в вашей компании называют «выручкой», из какой таблицы брать правильную цифру и какие заказы считать отменёнными. Об этом говорили в Alibaba DataWorks, и отсюда их ставка на граф бизнес-смыслов.
Цифры спикеры привели отрезвляющие. На реальном корпоративном хранилище BEAVER точность выборки данных была 10,8%, с добавленным бизнес-контекстом - 30,1%. Втрое лучше, но всё равно меньше трети. Пилоты ИИ прошли 88% китайских компаний, заметный эффект получили только 14%, и причину докладчик AnalyticDB назвал без дипломатии: данные не готовы для ИИ. Со ссылкой на Gartner прозвучало, что не меньше половины проектов генеративного ИИ бросают после пилота.
Оговорка: все цифры в статье - заявления спикеров и компаний на конференции, независимой проверки у них нет. Я беру из них схему, а не обещания.
Сначала словарь метрик, потом агент: Starbucks, Yanfeng, Anker
Три компании из разных отраслей пришли к одному выводу. Сначала договориться о смысле данных, потом подключать агента. Не наоборот.
| Компания | Что сделали | Результат (по их данным) |
|---|---|---|
| Starbucks China, 8000+ точек | Отказались от классического NL2SQL, построили семантический слой: 167 стандартных метрик по 18 областям (за 4 месяца с 99 до 167) | Пилот: 30+ активных пользователей и 300+ реальных вопросов в неделю, разовая выгрузка за минуты вместо дней |
| Yanfeng International, автокомпоненты | Агент по данным за 12 недель в 4 этапа | Точность 45% → 82% → больше 91%, ответ на запрос 2 минуты вместо недели, нагрузка на команду данных -70% |
| Anker | «Альбомы данных»: границы сценария, эталонные источники, смысл полей, правила запросов, проверочная база | На тесте из 100 вопросов точность с ~50% до 90%+, на сложных вопросах с ~20% почти до 90% |
Принципы Starbucks звучат почти как правила хорошего бухгалтера. Сначала согласовать термин, потом отвечать. У каждого ответа есть уровень достоверности. Знания - актив компании. Защиту от конкурентов они видят в семантическом слое, а не в чат-интерфейсе, и с этим я согласен: интерфейс скопировать легко, договорённости о смысле данных - нет. Anker, к их чести, сам оговорился, что тест был без даты и на рабочих данных результат не гарантирован.
«Без петли обратной связи ИИ навсегда остаётся в первом дне.»
Считает код, а модель понимает вопрос и объясняет
Второй принцип: языковая модель не должна сама считать деньги. Она разбирает вопрос, выбирает нужный расчёт и пересказывает результат человеческим языком. Считают детерминированные модули, которые на одних и тех же данных всегда выдают один и тот же ответ. Скучно? Да. Зато цифра в отчёте директору завтра не поменяется сама собой.
Amap: 22% → 54% → 78%
На 98 реальных пространственных задачах обычный агент решил 22%, агент с картографическим навыком 54%, платформа Qyu с 20+ детерминированными операторами и цепочкой доказательств 78%.
WarrenQ / GAOS: 95% на 330 вопросах
Финансовая платформа данных: модель только понимает запрос и формулирует ответ, считают модули. Неописанные термины к исполнению не допускаются. Точность 95,01% (самоотчёт).
Fuiou Pay: модель только объясняет
Вместо 400+ ручных правил три слоя: аналитика, ML-модели и LLM только для объяснения. Покрытие рисков больше 90%, ложных блокировок меньше 1%.
Третий принцип показали на демо сервиса логов Alibaba, и его я бы повесил над столом каждого, кто строит агентов: «нет записи - нет утверждения». Агенту разрешено ответить «подарок начислен», только если он нашёл запись о начислении. Нет записи в системе - нет и утверждения в ответе.
Там же прозвучало правило для самого словаря. ИИ предлагает черновик определения, эксперт его утверждает. Любое изменение смысла метрики проходит как правка кода: прогон на тестовых вопросах, согласование владельца, версия и возможность откатить.
Сначала порядок в данных: лестница Weicai
Форум по обработке данных держался на тезисе, что агент надёжен, только если до него навели порядок: единые определения метрик, права доступа, происхождение данных, тесты. Финтех-компания Weicai показала это на разработке признаков для скоринга, и цифры у неё красноречивые.
- L0, как было: 10 человеко-дней (исследование данных 3 дня, сверка логики 2, код 3, тесты 2).
- L1, регламенты и слои хранилища: 3 дня.
- L2, ИИ получил доступ к метаданным и определениям: 2 дня.
- L3, несколько агентов встроены в регламент работы: 30 минут, человеку передаётся 5% случаев.
Обратите внимание, где случился самый большой скачок: с 10 дней до 3, ещё до всякого ИИ, на регламентах. Сама компания сформулировала вывод так: узкое место не в написании кода, а в доступе к смыслу данных. Игровая компания Lesyang Yuanyou прошла тем же путём - сначала единое хранилище, потом агент-аналитик. Отклонение финансовых метрик у агента меньше 1,6%, управленческий отчёт собирается за минуту вместо дня.
Как измерить точность: эталонный набор вопросов
Пока нет замера, фраза «агент хорошо отвечает» остаётся мнением. Все сильные кейсы конференции опирались на набор вопросов с заранее известными правильными ответами.
- Anker мерил точность на 100 вопросах до и после «альбомов данных».
- У агента Lesyang Yuanyou около 150 регрессионных тестов, проходит 85%, и вывод агента компания подаёт как гипотезу, а не доказанную причину.
- Yanfeng фиксировал точность на каждом из четырёх этапов: 45%, 82%, больше 91%.
- Ошибки из работы и отзывы экспертов превращаются в новые тестовые вопросы, и набор растёт вместе с агентом.
Этот же набор пригодится при выборе модели: на нём сразу видно, тянет ли дешёвая модель или без дорогой не обойтись. В DataWorks заявили, что облегчённая Qwen3.8-flash в анализе данных близка к старшей Max. Возможно. Но я бы проверил это на своих вопросах, прежде чем верить слайду.
Как перенести эту схему в российскую компанию
Доступ российских компаний к продуктам Alibaba Cloud не подтверждён, так что с конференции я беру идеи и схемы, а не продукты. Схема переносится на любой стек: 1С, CRM, Google-таблицы, свою базу данных.
Внедрение агента по данным я начинаю так:
- Эталонные вопросы. Собираю с руководителем 20-30 вопросов, которые он реально задаёт, и правильные ответы на них из текущих отчётов.
- Словарь метрик. Для каждой метрики записываем определение, источник, формулу и владельца. Пока термин не согласован, агент на него не отвечает.
- Расчёт кодом. Цифры считают запросы и скрипты, модель выбирает расчёт и объясняет результат.
- Правило «нет записи - нет утверждения». Каждая цифра в ответе ссылается на запись в системе.
- Приёмка по точности. Агента принимают по доле верных ответов на эталонном наборе, а не по впечатлению от демо.
По такой схеме устроен, например, ежедневный отчёт руководителю о работе менеджеров в CRM, который мы сделали для серф-школы «Камчатка Серф». Подробнее про контроль продаж - в статье ИИ-контроль продаж в amoCRM. А почему пилоты без такой подготовки не дают эффекта, я разбираю в статье почему ИИ не даёт отдачи.
Вывод
Агент для аналитики ошибается в цифрах не из-за плохого SQL, а потому что не знает, что в вашей компании значат «выручка» и «активный клиент». Компании на Apsara чинили это словарём метрик, расчётом цифр кодом и эталонным набором вопросов: Yanfeng так поднял точность с 45% до больше 91% за 12 недель. Без бизнес-контекста точность на реальном хранилище была около 10%. Поэтому до выбора модели и подрядчика нужно навести порядок в определениях и решить, как вы будете мерить правильность ответов.
Что сделать
- 1Выпишите 20-30 вопросов, которые вы на самом деле задаёте по цифрам компании, и рядом правильные ответы из текущих отчётов.
- 2Возьмите 10 метрик из этих вопросов и для каждой запишите определение, источник, формулу и ответственного.
- 3Спросите двух руководителей, как они считают выручку за прошлый месяц, и сравните ответы: расхождение покажет, какие термины надо согласовать первыми.
Частые вопросы
Почему ИИ ошибается в цифрах в отчётах?+
Модель не знает, что в конкретной компании значит «выручка» или «активный клиент» и из какой таблицы брать правильную цифру. Она пишет корректный запрос и делает неверный вывод. Лечится это словарём метрик и расчётом цифр кодом, а не моделью.
Что такое семантический слой для ИИ?+
Словарь бизнеса для агента: определения метрик, источники данных, формулы, смысл полей и правила запросов. Агент сначала сверяется со словарём, потом обращается к данным. Starbucks China, например, собрал 167 стандартных метрик по 18 областям.
Насколько точен ИИ-агент для аналитики данных?+
Зависит от подготовки данных. По данным компаний на Apsara 2026, Yanfeng поднял точность с 45% до 91% за 12 недель, Anker - с 50% до 90% на тесте из 100 вопросов. Без бизнес-контекста точность на реальном хранилище бывает около 10%.
Можно ли просто подключить ChatGPT к базе данных?+
Подключить можно, надёжных ответов это не даст. Starbucks China отказался от такого подхода и перешёл на агента со словарём метрик и детерминированной обвязкой. Сначала порядок в данных и эталонные вопросы, потом агент.
Как проверить, что ИИ-агент отвечает правильно?+
Собрать набор реальных вопросов с заранее известными правильными ответами и прогонять на нём агента после каждого изменения. Доля верных ответов на этом наборе и есть метрика приёмки. Ошибки из работы добавляются в набор как новые тесты.
Источники
- Apsara Conference 2026, Ханчжоу, 22-24 сентября 2026
- Секция «Operate and Evolve: New Growth for Agentic Retail» (Starbucks China, Danone, BSH)
- Секция «Reshaping Data Services for Agents: Data Agent Entry, Collaboration, and Deployment» (Yanfeng International, Fuiou Pay, AnalyticDB)
- Секция «From Model to Token: Alibaba Cloud Model Studio» (кейс Anker)
- Секция «AMAP Platform Developer Conference: Spatial Intelligence Powering AI Across Every Industry»
- Секция «The Agent Moment for SaaS: From Dev Efficiency to Business Growth» (WarrenQ, GAOS)
- Секция «Omni-Modal Data Processing and Model Training & Inference Forum» (Weicai, Lesyang Yuanyou)
- Секции «The Omni-Modal Agentic Lake» и «Real-Time Data Intelligence for AI» (DataWorks, SLS)
Об авторе. Артём Борисов - бизнес-консультант, внедряет AI-сотрудников в малом и среднем бизнесе: продажи, документы, учёт, мониторинг. Кейсы с цифрами - на главной странице.
Читайте также
Apsara 2026 · Главное
Apsara 2026: 10 выводов главной ИИ-конференции Китая для бизнеса
Читать →
Apsara 2026 · Внедрение ИИ
Почему внедрение ИИ в бизнес не даёт отдачи
Читать →
Кейс · Продажи
Контроль отдела продаж в AmoCRM без ручного чтения переписок: как это делает ИИ
Читать →
Apsara 2026 · Методика
Как внедрить ИИ-агента в компанию: один отдел, один сценарий, 90 дней
Читать →
Хотите применить это в своей компании?
Опишите процесс, который съедает больше всего ручного времени. Я покажу, как выглядело бы решение на ИИ-агенте и какие метрики оно изменит.