Игорь Моисеев

Бизнес быстро оценил потенциал ИИ-агентов: они отвечают на вопросы менеджмента, собирают отчёты, находят причины отклонений в финансовых показателях и разгружают аналитиков, юристов и бухгалтеров. 39% российских компаний уже применяют ИИ сервисы на практике. Но у этой истории есть уязвимое место — корпоративные данные. Если агент не понимает, какие данные верны, как рассчитываются показатели и какую информацию нельзя показывать конкретному пользователю, он неизбежно будет ошибаться. Будет ошибаться быстро, уверенно и весьма убедительно. Поэтому обязательный этап внедрения ИИ в компаниях — наведение порядка в данных. И здесь ключевую роль играет каталог данных.

Почему бизнесу мало подключить нейросеть к данным и зачем ИИ-агентам нужен каталог данных

Интерес к агентам действительно растёт быстро. По исследованию McKinsey 2025 года, 88% организаций уже регулярно используют ИИ хотя бы в одной бизнес-функции, а 23% уже масштабируют агентные системы как минимум в одной из них. Но важно учитывать, что рынок уже вышел из стартовой фазы, но и до зрелости ему ещё далеко. Пилотные проекты есть почти у всех, а вот устойчивые процессы — пока у немногих.

Сейчас ИИ-агентов часто представляют как новый корпоративный суперскил. Например, руководитель задаёт вопрос обычным языком: «Почему просела маржа в мае?», и система сама находит данные, формирует запрос, сравнивает показатели и выдаёт ответ. Почти как если бы у каждого директора появился личный аналитик, который не устаёт, не уходит в отпуск и не просит согласовать приоритеты задач.

В реальной жизни организации этот процесс быстро упирается в более сложный и дорогой вопрос: «А откуда агент взял данные? Из проверенной аналитиками таблицы? Из утверждённой витрины? Из отчёта, которому доверяет финансовый блок? Или из устаревшего набора, созданного когда-то „временно“ и, как часто это бывает, пережившего уже несколько реорганизаций?» Здесь начинается история про корпоративный ИИ. История не о том, какая LLM модель умнее, а о том, где в компании находится достоверная информация, над которой предстоит работать ИИ агенту. Согласно исследованиям McKinsey, до 80% корпоративных ИИ-проектов не приносят ожидаемой отдачи из-за «сломанного фундамента данных», включая их разрозненность и низкое качество. Искусственный интеллект наследует ошибки и «слепые зоны» из-за некачественных данных. Если источники данных, исторические, текущие или внешние данные содержат систематические искажения (например, непоследовательную маркировку, отсутствующие или устаревшие данные), модели ИИ будут усиливать эти искажения, а так как модели ИИ постоянно обучаются на основе своих конвейеров обработки данных, поэтому ошибки или искажения усиливаются.

Агенты уже примеряют на себя разные роли. Один помогает аналитикам отвечать на вопросы по продажам и запасам, другой готовит комментарии к финансовой отчётности, третий ищет риски в договорах, четвёртый сравнивает поставщиков, а пятый анализирует причины роста брак или простоев на производстве. Но есть нюанс. ИИ-агент может звучать уверенно и при этом ошибаться. Не потому, что он «плохой». А потому, что он не жил внутри вашей компании последние десять лет и не знает её внутренних договорённостей, исключений, временных решений и тех самых таблиц, которые нельзя трогать без благословения главного аналитика.

Проблема не в интеллекте, а в контексте

Большая языковая модель хорошо работает с текстом, кодом, запросами, объяснениями. Но сама по себе она не знает, что в вашей компании называется, например, «выручкой». А это, вопреки ожиданиям, не такой простой вопрос. Выручка может быть бухгалтерской, управленческой, валовой, чистой, с НДС, без НДС, с учётом возвратов или без них, по отгрузке, оплате, закрытому периоду или оперативным данным. То же самое касается маржи, клиента, остатков. В одном подразделении «активный клиент» — тот, кто купил за последние 30 дней, в другом — тот, кто сделал заказ за квартал. Специалист-аналитик обычно знает эти ловушки. Он помнит, какая таблица устарела, где данные ещё не закрыты, какой отчёт смотрит руководство. ИИ-агент без контекста не различает этих тонкостей. Он видит похожие названия, похожие поля, похожие таблицы и выбирает то, что кажется наиболее вероятным. В итоге иногда угадывает, но часто нет. И для бизнеса это чувствительно, так как ошибка может попасть в управленческий отчёт, комментарий для совета директоров, расчёт бонусов, решение по закупкам или прогноз продаж. Deloitte в отчёте пишет, что использование агентного ИИ будет быстро расти в ближайшие два года, но только одна из пяти компаний имеет зрелую модель управления автономными ИИ-агентами. Стратегия и пилоты уже есть, а вот слой данных, который выдержит нагрузку агентных систем, во многих организациях по-прежнему напоминает склад после переезда: коробки подписаны, но не все, и никто до конца не уверен, где лежат документы за прошлый год.

Почему нельзя просто дать агенту доступ к хранилищу

Самая соблазнительная идея для бизнеса — подключить агента ко всем ИТ-системам и хранилищам данных. Что может пойти не так? Почти всё.

Лидеры разработки агентских сервисов первыми столкнулись с проблемами некачественной работы агентов. Например, Anthropic (компания занимается исследованиями и разработкой в области искусственного интеллекта, одна из главных и наиболее технологически развитых конкурентов OpenAI и Google) показала на собственном опыте внедрения self-service-аналитики с LLM моделью Claude. Компания пишет, что сейчас около 95% внутренних бизнес-аналитических запросов автоматизируются через Claude с точностью примерно 95%. Но ключевой вывод не в самой цифре, а в том, как к ней пришли. Точность аналитического агента — это проблема контекста и проверки, а не генерации кода. Ещё показательнее другая часть их опыта. Без использования каталога данных, включающего описание домена, правил, структуры таблиц, исключений и типовых ошибок Claude отвечал на аналитические вопросы с точностью не выше 21% на внутренних проверках. После добавления инструментов управления данными точность выросла выше 95%, а в отдельных доменах доходила примерно до 99%. Но и это не конец истории. Когда описание данных перестаёт обновляться, качество снова падает. Anthropic говорит, что без активной и регулярной актуализации структуры данных точность агента за месяц упала примерно с 95 до 65%.

Вот она, суровая правда корпоративного ИИ: даже сильная модель от лидирующего разработчика начинает давать сбои, если работает с устаревшим контекстом. Нейросеть не спасает от хаоса в данных. Она лишь делает его быстрее, масштабнее и убедительнее.

Каталог данных не просто «справочник для айтишников»

Каталог данных раньше часто воспринимали как инструмент для data-команд: описать таблицы, владельцев, поля, связи, термины. Процессы обычно выглядели как «наведём порядок, когда появится время». С приходом ИИ-агентов роль каталога меняется. Он становится не просто справочником для аналитиков, а слоем управляемого контекста для ИИ. Агенту недостаточно просто найти таблицу. Ему нужно понять, что она означает, можно ли ей доверять, кто за неё отвечает, когда она обновлялась, какие ограничения к ней применяются и в каких случаях её вообще нельзя использовать. Фактически каталог отвечает на несколько базовых, но критичных вопросов. Насколько данным можно доверять? Являются ли они финальными, предварительными, тестовыми, устаревшими? Откуда пришёл показатель? Содержит ли он персональные данные, коммерческую тайну, сведения о зарплатах или договорные условия, какие действуют ограничения по ролям? Без такого слоя ИИ-агент работает как новый необученный сотрудник, которому дали ключи от всех кабинетов, но не объяснили, где бухгалтерия, где архив, а где комната, в которую лучше не заходить совсем. В ближайшее время машины и ИИ-агенты вытеснят людей в качестве главных потребителей корпоративных данных.

В крупных российских компаниях данные редко сосредоточены в одном месте. Обычно это сложный ИТ-ландшафт, состоящий из множества ИТ-систем, инструментов и решений. При этом рынок данных и ИИ растёт быстро. НИУ ВШЭ в 2025 году проанализировал данные более 15 тыс. крупных и средних организаций. Среди таких компаний 50% используют технологии интеллектуальной поддержки принятия решений и управления, а среди барьеров примерно треть компаний называет дефицит массивов данных, необходимых для работы с ИИ, и каждая пятая — низкое качество и сложность обработки данных.

То есть проблема уже не в том, что бизнес не верит в ИИ, а в том, что, чтобы агент давал правильные ответы, ему нужны данные, которым можно доверять. Не просто большие объёмы, а данные описанные, проверенные, связанные с бизнес-терминами и правилами.

Как выглядит качественная работа агента с данными

Рассмотрим типичный вопрос руководства: «Почему в мае снизилась маржа по региону?» Плохой агент быстро ищет таблицы с подходящими словами (продажи, маржа, регион, месяц), пишет запрос, строит график и выдаёт объяснение. Получается убедительно. Только вот агент мог опереться не на ту маржу, использовать неверный региональный справочник, взять незакрытый период, не учесть скидки или затраты на логистику.

Хороший агент идёт другим путём. Сначала он обращается к бизнес-глоссарию и находит утверждённое определение маржи. Затем определяет, какие источники по продажам, себестоимости, скидкам и логистике имеют статус доверенных. Проверяет, закрыты ли данные за май. Анализирует происхождение показателей: откуда пришли данные, какие преобразования применялись, какие системы участвовали. И только потом формулирует вывод. Например, он может показать, что снижение маржи связано не с падением цены, а с ростом логистических затрат и изменением структуры продаж. При этом важно, чтобы агент явно указал, на какие источники опирался, когда они обновлялись и кто отвечает за эти данные.

Или другой пример, когда пользователь просит подготовить комментарий к динамике выручки за квартал. Без каталога агент легко смешает управленческую и бухгалтерскую отчётности, сравнит разные периметры компаний, возьмёт предварительные данные вместо закрытых или забудет про возвраты. С каталогом он сначала понимает, какую выручку использовать, какие периоды сравнивать, какие бизнес-единицы включать и какие данные уже можно считать финальными.

Почему каталог данных становится частью AI-ready-инфраструктуры

AI-ready data — качественная, доступная и доверенная информация, которую организация может уверенно применять для ИИ-инициатив. Gartner говорит, что компании с успешными ИИ-инициативами инвестируют в четыре раза больше доли выручки в качество и управление данными, AI-ready-команды и управление изменениями. Каталог данных становится одним из элементов этой AI-ready-инфраструктуры. Он не заменяет хранилище, озеро данных, BI, MDM, DQ-инструменты или систему управления доступами. Но связывает их в карту, которую понимают люди и могут использовать агенты.

Начинать стоит не с масштабного внедрения ИИ-агентов во все процессы. Лучше выбрать несколько сценариев, где агент действительно может принести пользу: аналитика продаж, управленческая отчётность, поддержка закупок, проверка договоров, анализ качества, клиентский сервис, производственная аналитика. У каждого сценария есть свой набор критичных данных и свои риски. После этого нужно определить ключевые бизнес-термины. Для продаж это выручка, маржа, скидка, заказ, клиент, возврат, остаток. Для производства — партия, смена, линия, дефект, простой, норматив, качество сырья. Для финансов — EBITDA, бюджет, план-факт, дебиторская задолженность, закрытый период.

Дальше необходимо договориться, что считается официальной правдой. Выяснить, кто владелец показателя, как тот считается, какие источники нельзя использовать для управленческих решений и так далее.

Разметка данных идёт следующим этапом. Она заключается в том, чтобы присвоить статус источникам: доверенный, предварительный, тестовый, устаревший, ограниченный, проблемный по качеству.

И отдельно необходимо прописать все доступы. ИИ-агент не должен становиться универсальной отмычкой. Его права нужно сделать зависимыми от роли пользователя, сценария, чувствительности данных и корпоративных правил.

Что будет дальше

ИИ-агенты почти наверняка станут обычным интерфейсом к корпоративным данным. Не потому, что чат — идеальная форма общения. А потому, что бизнес давно хочет задавать вопросы человеческим языком и получать ответы без недельного ожидания в очереди к аналитикам. Но вместе с этим изменятся требования к данным. Раньше некачественное описание таблицы было проблемой аналитика, а теперь это становится проблемой агента, который может выбрать не тот источник и мгновенно разнести ошибочный вывод по компании.

Поэтому каталог данных перестаёт быть полезной практикой для зрелых data-команд. Он становится инфраструктурой доверия для корпоративного ИИ. Компании, которые сейчас наведут порядок в терминах, владельцах, качестве, происхождении данных и доступах, получат не просто более аккуратную аналитику. Но и основу для безопасного масштабирования ИИ-агентов. А те, кто попробует перескочить этот этап, тоже внедрят ИИ-агентов. Только эти агенты будут быстро, уверенно и очень убедительно воспроизводить весь корпоративный хаос. Технологически это будет выглядеть современно, но по факту не принесёт пользы бизнесу и даже навредит.

Источник: