Apsara 2026 · Данные · октябрь 2026

ИИ для аналитики данных: почему агент ошибается в цифрах и как это исправить

Словарь метрик, расчёт кодом и эталонный набор вопросов: как Starbucks, Yanfeng, Anker и Amap добивались верных цифр от агентов, по докладам Apsara Conference 2026

Артём Борисов - бизнес-консультант, внедрение AI-сотрудников ·

Коротко

ИИ для аналитики данных перестаёт ошибаться в цифрах, когда у агента есть словарь метрик (семантический слой), считает детерминированный код, а модель только понимает вопрос и объясняет ответ. Так это устроили Starbucks, Yanfeng и Anker, чьи кейсы показали на Apsara Conference 2026 в Ханчжоу. Ниже разбираю, почему «голый» перевод вопроса в SQL не работает, какую точность компании получили до и после, как навести порядок в данных и как я применяю эту схему во внедрениях.

Почему ИИ ошибается в цифрах, даже когда SQL написан верно

Секции по данным на Apsara 2026 крутились вокруг одной неприятной мысли. Универсальный агент пишет синтаксически правильный SQL-запрос и делает по нему неверный вывод. Он не знает, что в вашей компании называют «выручкой», из какой таблицы брать правильную цифру и какие заказы считать отменёнными. Об этом говорили в Alibaba DataWorks, и отсюда их ставка на граф бизнес-смыслов.

Цифры спикеры привели отрезвляющие. На реальном корпоративном хранилище BEAVER точность выборки данных была 10,8%, с добавленным бизнес-контекстом - 30,1%. Втрое лучше, но всё равно меньше трети. Пилоты ИИ прошли 88% китайских компаний, заметный эффект получили только 14%, и причину докладчик AnalyticDB назвал без дипломатии: данные не готовы для ИИ. Со ссылкой на Gartner прозвучало, что не меньше половины проектов генеративного ИИ бросают после пилота.

Оговорка: все цифры в статье - заявления спикеров и компаний на конференции, независимой проверки у них нет. Я беру из них схему, а не обещания.

Сначала словарь метрик, потом агент: Starbucks, Yanfeng, Anker

Три компании из разных отраслей пришли к одному выводу. Сначала договориться о смысле данных, потом подключать агента. Не наоборот.

КомпанияЧто сделалиРезультат (по их данным)
Starbucks China, 8000+ точекОтказались от классического NL2SQL, построили семантический слой: 167 стандартных метрик по 18 областям (за 4 месяца с 99 до 167)Пилот: 30+ активных пользователей и 300+ реальных вопросов в неделю, разовая выгрузка за минуты вместо дней
Yanfeng International, автокомпонентыАгент по данным за 12 недель в 4 этапаТочность 45% → 82% → больше 91%, ответ на запрос 2 минуты вместо недели, нагрузка на команду данных -70%
Anker«Альбомы данных»: границы сценария, эталонные источники, смысл полей, правила запросов, проверочная базаНа тесте из 100 вопросов точность с ~50% до 90%+, на сложных вопросах с ~20% почти до 90%

Принципы Starbucks звучат почти как правила хорошего бухгалтера. Сначала согласовать термин, потом отвечать. У каждого ответа есть уровень достоверности. Знания - актив компании. Защиту от конкурентов они видят в семантическом слое, а не в чат-интерфейсе, и с этим я согласен: интерфейс скопировать легко, договорённости о смысле данных - нет. Anker, к их чести, сам оговорился, что тест был без даты и на рабочих данных результат не гарантирован.

«Без петли обратной связи ИИ навсегда остаётся в первом дне.»

Starbucks China, секция «Operate and Evolve: New Growth for Agentic Retail», Apsara 2026 (пересказ)

Считает код, а модель понимает вопрос и объясняет

Второй принцип: языковая модель не должна сама считать деньги. Она разбирает вопрос, выбирает нужный расчёт и пересказывает результат человеческим языком. Считают детерминированные модули, которые на одних и тех же данных всегда выдают один и тот же ответ. Скучно? Да. Зато цифра в отчёте директору завтра не поменяется сама собой.

Amap: 22% → 54% → 78%

На 98 реальных пространственных задачах обычный агент решил 22%, агент с картографическим навыком 54%, платформа Qyu с 20+ детерминированными операторами и цепочкой доказательств 78%.

WarrenQ / GAOS: 95% на 330 вопросах

Финансовая платформа данных: модель только понимает запрос и формулирует ответ, считают модули. Неописанные термины к исполнению не допускаются. Точность 95,01% (самоотчёт).

Fuiou Pay: модель только объясняет

Вместо 400+ ручных правил три слоя: аналитика, ML-модели и LLM только для объяснения. Покрытие рисков больше 90%, ложных блокировок меньше 1%.

Третий принцип показали на демо сервиса логов Alibaba, и его я бы повесил над столом каждого, кто строит агентов: «нет записи - нет утверждения». Агенту разрешено ответить «подарок начислен», только если он нашёл запись о начислении. Нет записи в системе - нет и утверждения в ответе.

Там же прозвучало правило для самого словаря. ИИ предлагает черновик определения, эксперт его утверждает. Любое изменение смысла метрики проходит как правка кода: прогон на тестовых вопросах, согласование владельца, версия и возможность откатить.

Сначала порядок в данных: лестница Weicai

Форум по обработке данных держался на тезисе, что агент надёжен, только если до него навели порядок: единые определения метрик, права доступа, происхождение данных, тесты. Финтех-компания Weicai показала это на разработке признаков для скоринга, и цифры у неё красноречивые.

  • L0, как было: 10 человеко-дней (исследование данных 3 дня, сверка логики 2, код 3, тесты 2).
  • L1, регламенты и слои хранилища: 3 дня.
  • L2, ИИ получил доступ к метаданным и определениям: 2 дня.
  • L3, несколько агентов встроены в регламент работы: 30 минут, человеку передаётся 5% случаев.

Обратите внимание, где случился самый большой скачок: с 10 дней до 3, ещё до всякого ИИ, на регламентах. Сама компания сформулировала вывод так: узкое место не в написании кода, а в доступе к смыслу данных. Игровая компания Lesyang Yuanyou прошла тем же путём - сначала единое хранилище, потом агент-аналитик. Отклонение финансовых метрик у агента меньше 1,6%, управленческий отчёт собирается за минуту вместо дня.

Как измерить точность: эталонный набор вопросов

Пока нет замера, фраза «агент хорошо отвечает» остаётся мнением. Все сильные кейсы конференции опирались на набор вопросов с заранее известными правильными ответами.

  • Anker мерил точность на 100 вопросах до и после «альбомов данных».
  • У агента Lesyang Yuanyou около 150 регрессионных тестов, проходит 85%, и вывод агента компания подаёт как гипотезу, а не доказанную причину.
  • Yanfeng фиксировал точность на каждом из четырёх этапов: 45%, 82%, больше 91%.
  • Ошибки из работы и отзывы экспертов превращаются в новые тестовые вопросы, и набор растёт вместе с агентом.

Этот же набор пригодится при выборе модели: на нём сразу видно, тянет ли дешёвая модель или без дорогой не обойтись. В DataWorks заявили, что облегчённая Qwen3.8-flash в анализе данных близка к старшей Max. Возможно. Но я бы проверил это на своих вопросах, прежде чем верить слайду.

Как перенести эту схему в российскую компанию

Доступ российских компаний к продуктам Alibaba Cloud не подтверждён, так что с конференции я беру идеи и схемы, а не продукты. Схема переносится на любой стек: 1С, CRM, Google-таблицы, свою базу данных.

Внедрение агента по данным я начинаю так:

  • Эталонные вопросы. Собираю с руководителем 20-30 вопросов, которые он реально задаёт, и правильные ответы на них из текущих отчётов.
  • Словарь метрик. Для каждой метрики записываем определение, источник, формулу и владельца. Пока термин не согласован, агент на него не отвечает.
  • Расчёт кодом. Цифры считают запросы и скрипты, модель выбирает расчёт и объясняет результат.
  • Правило «нет записи - нет утверждения». Каждая цифра в ответе ссылается на запись в системе.
  • Приёмка по точности. Агента принимают по доле верных ответов на эталонном наборе, а не по впечатлению от демо.

По такой схеме устроен, например, ежедневный отчёт руководителю о работе менеджеров в CRM, который мы сделали для серф-школы «Камчатка Серф». Подробнее про контроль продаж - в статье ИИ-контроль продаж в amoCRM. А почему пилоты без такой подготовки не дают эффекта, я разбираю в статье почему ИИ не даёт отдачи.

Вывод

Агент для аналитики ошибается в цифрах не из-за плохого SQL, а потому что не знает, что в вашей компании значат «выручка» и «активный клиент». Компании на Apsara чинили это словарём метрик, расчётом цифр кодом и эталонным набором вопросов: Yanfeng так поднял точность с 45% до больше 91% за 12 недель. Без бизнес-контекста точность на реальном хранилище была около 10%. Поэтому до выбора модели и подрядчика нужно навести порядок в определениях и решить, как вы будете мерить правильность ответов.

Что сделать

  1. 1Выпишите 20-30 вопросов, которые вы на самом деле задаёте по цифрам компании, и рядом правильные ответы из текущих отчётов.
  2. 2Возьмите 10 метрик из этих вопросов и для каждой запишите определение, источник, формулу и ответственного.
  3. 3Спросите двух руководителей, как они считают выручку за прошлый месяц, и сравните ответы: расхождение покажет, какие термины надо согласовать первыми.

Частые вопросы

Почему ИИ ошибается в цифрах в отчётах?+

Модель не знает, что в конкретной компании значит «выручка» или «активный клиент» и из какой таблицы брать правильную цифру. Она пишет корректный запрос и делает неверный вывод. Лечится это словарём метрик и расчётом цифр кодом, а не моделью.

Что такое семантический слой для ИИ?+

Словарь бизнеса для агента: определения метрик, источники данных, формулы, смысл полей и правила запросов. Агент сначала сверяется со словарём, потом обращается к данным. Starbucks China, например, собрал 167 стандартных метрик по 18 областям.

Насколько точен ИИ-агент для аналитики данных?+

Зависит от подготовки данных. По данным компаний на Apsara 2026, Yanfeng поднял точность с 45% до 91% за 12 недель, Anker - с 50% до 90% на тесте из 100 вопросов. Без бизнес-контекста точность на реальном хранилище бывает около 10%.

Можно ли просто подключить ChatGPT к базе данных?+

Подключить можно, надёжных ответов это не даст. Starbucks China отказался от такого подхода и перешёл на агента со словарём метрик и детерминированной обвязкой. Сначала порядок в данных и эталонные вопросы, потом агент.

Как проверить, что ИИ-агент отвечает правильно?+

Собрать набор реальных вопросов с заранее известными правильными ответами и прогонять на нём агента после каждого изменения. Доля верных ответов на этом наборе и есть метрика приёмки. Ошибки из работы добавляются в набор как новые тесты.

Источники

  • Apsara Conference 2026, Ханчжоу, 22-24 сентября 2026
  • Секция «Operate and Evolve: New Growth for Agentic Retail» (Starbucks China, Danone, BSH)
  • Секция «Reshaping Data Services for Agents: Data Agent Entry, Collaboration, and Deployment» (Yanfeng International, Fuiou Pay, AnalyticDB)
  • Секция «From Model to Token: Alibaba Cloud Model Studio» (кейс Anker)
  • Секция «AMAP Platform Developer Conference: Spatial Intelligence Powering AI Across Every Industry»
  • Секция «The Agent Moment for SaaS: From Dev Efficiency to Business Growth» (WarrenQ, GAOS)
  • Секция «Omni-Modal Data Processing and Model Training & Inference Forum» (Weicai, Lesyang Yuanyou)
  • Секции «The Omni-Modal Agentic Lake» и «Real-Time Data Intelligence for AI» (DataWorks, SLS)

Об авторе. Артём Борисов - бизнес-консультант, внедряет AI-сотрудников в малом и среднем бизнесе: продажи, документы, учёт, мониторинг. Кейсы с цифрами - на главной странице.

Хотите применить это в своей компании?

Опишите процесс, который съедает больше всего ручного времени. Я покажу, как выглядело бы решение на ИИ-агенте и какие метрики оно изменит.