Apsara 2026 · Данные · октябрь 2026
База знаний для ИИ-агента: как устроить RAG и память, чтобы агент не забывал
Что показали на Apsara 2026 про память агентов, поиск по своим документам и хранилища под агентов, и что из этого можно собрать в небольшой компании без дорогой инфраструктуры.
Артём Борисов - бизнес-консультант, внедрение AI-сотрудников ·
Коротко
База знаний для ИИ-агента - это хранилище документов, переписки и решений компании, из которого агент в момент запроса достаёт нужный фрагмент. Рядом с ней работает память: то, что агент запомнил о клиенте и прошлых задачах. Вместе они делают так, что агент отвечает про ваш бизнес, а не пересказывает интернет. Ниже разбираю по докладам Apsara Conference 2026, как это устроено у Alibaba и её клиентов, сколько токенов экономит правильный контекст и с чего начать без дорогой инфраструктуры.
RAG и память агента: в чём разница
RAG (retrieval-augmented generation) - схема, при которой агент перед ответом ищет подходящие фрагменты в ваших документах и подставляет их в запрос к модели. Модель отвечает, опираясь на найденное, а не на то, что помнит с обучения. Регламент, прайс, договор, инструкция - всё это материал для RAG.
Память устроена иначе. Это записи о том, что происходило: клиент просил перезвонить после обеда, в прошлый раз скидку не согласовали, у этого поставщика задержки. Память пополняет сам агент по ходу работы, а базу знаний обычно ведут люди.
| База знаний (RAG) | Память агента | |
|---|---|---|
| Что внутри | Документы, регламенты, справочники | События, договорённости, предпочтения |
| Кто пополняет | Сотрудники | Агент по ходу задач |
| Как меняется | Редко, по версиям | Постоянно |
| Типичная ошибка | Устаревший документ | Лишнее или неверно запомненное |
В докладе Alibaba про хранилища для агентов это свели в одну формулу: контекст собирается в момент запроса из двух каналов, знаний и памяти. И мысль, которую я бы повесил над столом любого, кто проектирует агента: агенту нужно не больше памяти, а нужный контекст в нужный момент.
Почему правильный контекст экономит 67-90% токенов
Самый простой способ дать агенту знания - вставить в запрос все документы целиком. Работает, пока документов мало. Потом счёт за токены растёт, а точность падает: модель тонет в лишнем. Поэтому на Apsara почти каждый доклад про данные заканчивался цифрой экономии. Одна оговорка сразу: это заявления самих компаний, независимо их никто не проверял.
Agent Context: до 67%
Единая база документов, учётных систем, переписки и мультимодальных данных плюс память агентов между задачами. По данным Alibaba, в поддержке, разработке и аналитике экономит до 67% токенов.
ПодробнееСвернуть
Agent Context анонсировали на открытии конференции как часть «движка контекста» Alibaba Cloud. Идея в том, что агент не собирает знания по разным системам сам, а обращается к одному слою, где уже лежат документы, данные учётных систем и переписка. Память там общая для задач и команд: что один агент узнал о клиенте, доступно следующему.
67% - верхняя граница, которую Alibaba называет для трёх сценариев: поддержка клиентов, написание кода с ИИ и анализ данных. Как именно меряли, в пресс-релизе не раскрыто.
Память агента: минус 90%
Сервис долговременной памяти Tablestore, по данным Alibaba, сокращает расход токенов на 90%, а выборочная подгрузка снижает объём контекста примерно на 96,7%.
ПодробнееСвернуть
Память там собирается цепочкой «сообщения → память → ночная уборка» (Message → Memory → Dream). Сначала агент копит сырые сообщения, потом выделяет из них факты, а в фоне чистит и объединяет записи, как человек, который вечером разбирает заметки за день. В запрос попадают только записи, нужные под текущую задачу.
Точность на тесте памяти LoCoMo - 92,34%, поиск десяти ближайших записей за 174 мс. Компания сама оговорила, что это не гарантия производительности и конфигурации тестов разные.
Поиск с памятью: 68%
Память поисковой платформы Alibaba OpenSearch, по внутренней оценке, экономит 68,18% входных токенов.
Выдержки вместо страниц
Поисковик для агентов Exa отдаёт выдержку около 353 символов вместо полного текста страницы в 38 522 символа.
ПодробнееСвернуть
Пример хорошо показывает, откуда берётся экономия. Exa сжимает выдачу ступенями: 1,5 трлн адресов в индексе, 80 млрд страниц, 10 результатов, и в контекст агента уходят только короткие фрагменты. Разница между выдержкой и полной страницей больше чем в сто раз.
С внутренними документами то же самое. Агенту, который отвечает про условия возврата, не нужен весь договор на 20 страниц, ему нужен один пункт.
Ещё один приём - семантический кэш: если похожий вопрос уже задавали, ответ отдают повторно, без нового обращения к модели. В тесте Alibaba на 13 676 диалогах доля таких попаданий выросла с 13,10% до 79,64%. Сами докладчики предупредили, что переносить эти цифры на другие сценарии нельзя.
Слой памяти для CRM: сводка звонка за 10 секунд
Самый прикладной кейс показал грузоперевозчик Full Truck Alliance (Manbang). Для CRM и внутреннего ИИ-портала там собрали общую базу памяти, знаний и онтологии, то есть описания того, как связаны клиенты, грузы, маршруты и сделки. Пользуются ею больше тысячи продавцов.
- Сводка по звонку готова примерно через 10 секунд.
- Система обрабатывает больше 100 тысяч сценариев в день, задержка ответа у 99% запросов около 120 мс.
- В пилоте обзвона ценность сделки выросла на 15%, а запуск нового сценария подешевел на 30%.
- Правило: цены и обещания клиенту проверяет человек.
Последний пункт мне нравится больше цифр. Агент помнит историю клиента и готовит сводку, но всё, что звучит как обязательство компании, проходит через продавца. Похожую схему я ставлю в отделах продаж: утренний отчёт по работе менеджеров в CRM, как у «Камчатка Серф», собирает агент, а выводы по менеджерам делает руководитель.
Ещё один кейс из того же доклада - помощник по ремонту у автопроизводителя. Заявлено «ноль галлюцинаций» в пределах стандартной базы знаний и ссылка на источник в 100% ответов. Формулировка «ноль галлюцинаций» по-моему звучит смелее, чем стоило бы, но сама идея верная: агент, который обязан сослаться на документ, выдумывает заметно реже.
RAG простыми средствами: с чего начать небольшой компании
На Apsara показывали хранилища на петабайты и миллион арендаторов. Малому бизнесу это не нужно. Полезнее другой тренд: Alibaba складывает векторы, полнотекстовый поиск и графы в одну базу на PostgreSQL, вместо зоопарка отдельных систем. Для компании на 20-200 человек я бы начинал так же, с одной базы.
Показательный кейс из доклада про хранилища: компания Matrees.cn положила знания в векторное хранилище, долгую память в отдельный сервис памяти, и команда из трёх человек запустилась за три дня. Технологии тут оказались самой быстрой частью. Дольше решают, что класть в базу.
- Соберите 20-50 документов, по которым сотрудники чаще всего задают вопросы: регламенты, прайсы, типовые договоры, инструкции.
- Уберите устаревшие версии. Агент с двумя прайсами ответит по обоим.
- Назначьте владельца базы, который обновляет документы при изменениях.
- Требуйте от агента ссылку на документ в каждом ответе, тогда ошибку видно сразу.
- Память о клиентах подключайте вторым шагом, когда агент уже уверенно работает с документами. Для этого есть открытые библиотеки, например Mem0, совместимость с которой Alibaba заявляет в своих базах.
Про резервные копии в докладе была точная фраза: агента можно перезапустить, а данные с нуля не создашь. Бэкапить нужно и базу знаний, и то, что агент накопил в памяти. Если агент должен считать выручку и остатки, база документов не поможет, там нужен словарь метрик, об этом в статье про ИИ для аналитики данных.
Записи встреч как база знаний
Отдельная секция была про голос. DingTalk, корпоративный мессенджер Alibaba, продвигает ИИ-диктофоны и сервис ИИ-записей встреч как вход для знаний компании. Схема: запись, расшифровка и структура, связь с отраслевыми знаниями, черновик результата, правка человеком и возврат правки в базу.
«Из 60-минутной консультации ценны около 12 минут, а 90% ключевой информации существует только в голосе.»
У преподавателя проверенная им запись урока превращается в конспект, фрагменты для переслушивания и задания. Все задания он проверяет перед выдачей. Общее правило всех кейсов секции: итог утверждает профессионал. По-моему, это самый недооценённый источник знаний в небольших компаниях: созвоны с клиентами и планёрки идут каждый день, а в базу не попадает ничего.
Что из этого взять российской компании
Продукты Alibaba Cloud российскому бизнесу, скорее всего, недоступны, подтверждения доступа на конференции не было. Забирать стоит схему: знания и память раздельно, контекст собирается под запрос, ответ со ссылкой на источник, решения с последствиями за человеком.
Одно ограничение у нас жёстче, чем в докладах. Память агента о клиентах почти всегда содержит персональные данные, а значит попадает под 152-ФЗ. Где хранить такую базу и что можно отправлять в облачную модель, я разбирал в статье про 152-ФЗ и нейросети. Для начала хватит обычного сервера в России и базы, которую ваша ИТ-служба уже умеет обслуживать.
Вывод
Агент знает ваш бизнес настолько, насколько хорошо устроены его база знаний и память. По данным Alibaba, точный контекст под запрос вместо «всех документов сразу» экономит от 67 до 90% токенов, а ссылка на источник в каждом ответе снижает выдумки. Начинать стоит с 20-50 актуальных документов и одного владельца базы. Память о клиентах подключают вторым шагом, с бэкапами и с учётом 152-ФЗ.
Что сделать
- 1Соберите в одну папку документы, по которым сотрудники чаще всего спрашивают друг друга.
- 2Удалите из неё устаревшие версии и назначьте человека, который будет её обновлять.
- 3Выпишите 10 частых вопросов клиентов и проверьте, на какие из них в папке есть ответ.
- 4Решите, какие записи встреч и звонков стоит сохранять как источник знаний.
Частые вопросы
Что такое база знаний для ИИ-агента?+
Это хранилище документов компании, из которого агент перед ответом достаёт подходящие фрагменты: регламенты, прайсы, договоры, инструкции. Благодаря ей агент отвечает по вашим правилам, а не по общим знаниям модели.
Что такое RAG-система?+
RAG - схема, при которой агент сначала ищет нужные фрагменты в ваших документах, а потом передаёт их модели вместе с вопросом. Модель отвечает на основе найденного. Так меньше выдумок и можно дать ссылку на источник.
Чем память агента отличается от базы знаний?+
База знаний - документы, которые ведут сотрудники. Память - записи о событиях и договорённостях, которые агент копит сам по ходу работы. В момент запроса агент собирает контекст из обоих источников.
Сколько можно сэкономить на токенах с правильной базой знаний?+
Alibaba на Apsara 2026 называла экономию от 67% до 90% токенов за счёт того, что в запрос попадает только нужный фрагмент. Это заявления компании без независимой проверки, но порядок экономии понятен: выдержка из документа в десятки раз короче самого документа.
С чего начать базу знаний для агента в небольшой компании?+
С 20-50 документов, по которым сотрудники чаще всего задают вопросы. Уберите устаревшие версии, назначьте владельца и требуйте от агента ссылку на документ в каждом ответе.
Источники
- Apsara Conference 2026, Ханчжоу, 22-24 сентября 2026: открытие и пресс-релиз Alibaba (Agent Context)
- Apsara Conference 2026: секция «Rebuilding the Data Layer for Agents: Unified LTAP Architecture and Multi-Modal Data Management»
- Apsara Conference 2026: секции «Agent-Native Data Infrastructure for the Intelligent Computing Era» и «Storage Solutions for AI and Agentic Workloads»
- Apsara Conference 2026: секция «Rebuilding Databases for Agents: Architecture and Practice of Agentic Database»
- Apsara Conference 2026: секция «Agentic Search from Retrieval to Reasoning»
- Apsara Conference 2026: секция «Language Data Consumption in the AI Era»
Об авторе. Артём Борисов - бизнес-консультант, внедряет AI-сотрудников в малом и среднем бизнесе: продажи, документы, учёт, мониторинг. Кейсы с цифрами - на главной странице.
Читайте также
Apsara 2026 · Данные
ИИ для аналитики данных: почему агент ошибается в цифрах и как это исправить
Читать →
Право · 152-ФЗ
152-ФЗ и нейросети: почему нельзя просто отправить данные клиентов в ChatGPT
Читать →
Кейс · Продажи
Контроль отдела продаж в AmoCRM без ручного чтения переписок: как это делает ИИ
Читать →
Хотите применить это в своей компании?
Опишите процесс, который съедает больше всего ручного времени. Я покажу, как выглядело бы решение на ИИ-агенте и какие метрики оно изменит.