Внедрение ИИ обещает бизнесу сокращение издержек, но на практике его рекомендации не всегда приводят к ожидаемому финансовому результату и могут требовать дополнительной проверки. Проблема не в алгоритмах, а в данных — противоречивых или некорректных. Как неподтвержденные данные превращают любую ML-модель или языкового агента в генератор ошибок и что с этим делать бизнесу, разбираемся вместе с Арутюном Саргсяном, руководителем направления по управлению данными компании «Навикон».

Два пути плохих данных: ML и LLM

Российские компании одна за другой запускают пилоты с генеративным ИИ. По данным Ассоциации больших данных (АБД) и Аналитического центра при Правительстве РФ, объем российского рынка искусственного интеллекта (ИИ) по итогам 2025 года составил 520 млрд рублей, а его доля в ВВП достигла 0,22%. Однако уже в 2026–2027 годах часть этих проектов рискует пополнить статистику провалов.

В вопросе качества данных для ИИ важно различать два класса систем. Классический machine learning (ML) — это прогнозные модели: скоринг, управление цепочками поставок, рекомендательные движки. Большие языковые модели (LLM), которые сейчас у всех на слуху, — это другое: поиск по базе знаний, генерация отчетов, text-to-sql агенты. Некачественные данные бьют по их эффективности одинаково, но механизмы разные.

В случае ML модель обучается на исторических выборках. Если в исторических данных присутствуют дубли, нарушены связи между сущностями или показатели искажены аномалиями, результат прогноза будет недостоверным.

Представьте модель прогноза оттока, обученную на витрине, где после миграции из CRM в хранилище данных один и тот же клиент оказался представлен несколькими одинаковыми записями. Для алгоритма это выглядит как несколько независимых примеров с одинаковым поведением. В результате модель завышает значимость подобных признаков и ошибочно относит к группе риска клиентов, которые на самом деле не планируют уходить.

ML-модель, обученная на данных с ошибками, потерянным контекстом и нарушенной целостностью, формирует закономерности, которых в реальном бизнесе не существует. В результате прогнозы выглядят убедительно, но не помогают принимать правильные решения.

С LLM история иная. Полноценное дообучение фундаментальной модели под корпоративные данные могут позволить себе немногие компании. На практике чаще используются RAG-подходы и агентские системы, которые обращаются к корпоративным источникам данных во время выполнения запроса. Пользователь спрашивает «какая дебиторская задолженность у клиента X», агент превращает вопрос в SQL-запрос, получает результат и возвращает ответ на естественном языке. Но если корпоративные данные плохо структурированы и содержат ошибки, ответ будет столь же бессмысленным. LLM, работающая на основе базы знаний, сможет давать корректные ответы лишь настолько, насколько качественны данные, к которым она обращается.

Показателен пример внедрения ИИ в аналитике: агент text-to-sql, запущенный поверх данных без единой семантической модели, с неоднозначными названиями таблиц и полей, отсутствием описаний бизнес-объектов и дублями сущностей, выдавал пользователям противоречивые ответы на один и тот же вопрос. В результате сотрудники теряли доверие не к конкретному отчету, а к самой идее использовать ИИ в аналитике.

Деградация открытых источников

Еще один удар по качеству наносит деградация открытых источников.

Доля пригодного для обучения контента в сети стремительно сжимается. Большая часть интернета — бессвязные тексты, спам, дубликаты и стремительно растущий объем «нейрослопа». Еще в 2022 году «Европол» прогнозировал, что к 2026 году до 90% контента в интернете может оказаться синтетическим. Прогноз сбывается: уже сейчас поисковая выдача по многим запросам забита SEO-статьями, написанными ИИ. Обучать чувствительные к качеству модели на таком сырье — все равно что готовить деликатесы из продуктов с истекшим сроком годности.

К этому добавляются регуляторные барьеры. Для множества промышленных, оборонных и финансовых задач использование внешних LLM попросту запрещено. Развертывание моделей внутри контура стоит дорого, требует железа и специалистов, а по качеству ответов внутренние решения часто уступают публичным аналогам. В сухом остатке бизнес оказывается запертым наедине со своими данными, но даже самая продвинутая нейросеть не способна качественно выявить закономерности, если данные не структурированы и не подготовлены должным образом.

Что по деньгам

Некачественные данные — это гарантированные убытки.

Возьмем простейший пример: клиентская рассылка. Каждое отправление стоит денег. Количество дублей клиентов в базе, помноженное на стоимость одного сообщения и периодичность, дает прямые убытки. Более сложный сценарий — управленческое решение, принятое на основе искаженных данных. Например, склад получает команду закупить дополнительную партию товара, который по факту лежит на полках мертвым грузом; производство наращивает выпуск позиции, спрос на которую давно упал. Цена таких ошибок может исчисляться миллионами рублей замороженных средств и упущенной прибыли.

Ошибки в одном-единственном поле данных могут порождать каскадные отказы. В кредитном скоринге некорректно посчитанный или вручную скорректированный признак заемщика — и ИИ либо одобряет заведомо невозвратный кредит, либо отсекает платежеспособного клиента, который уйдет к конкуренту.

Опечатка в сроке годности товара превращает просрочку в «свежий» продукт, и система управления полкой рекомендует выложить его на витрину. Любая ошибка в поле-ссылке на другую сущность — например, неверный ID клиента в реестре отгрузок — приводит к тому, что text-to-sql агент, честно отрабатывая запрос «покажи дебиторскую задолженность», просто не находит часть должников. Компания теряет контроль над деньгами.

Даже без дорогих инструментов точечные проверки критичных данных не требуют гигантских трудозатрат, но способны предотвратить ущерб, многократно превышающий стоимость таких проверок.

Когда без ИИ лучше

Может ли ИИ на плохих данных навредить?

Прежде всего оцените риски и поймите, насколько критические данные отражают реальность. Если цифры в ключевых витринах систематически врут, ИИ теоретически способен устроить катастрофу. Предположим, система автоматического заказа, обученная на искаженной статистике продаж, решает пополнить склад на 30% выше реальной потребности. Компания получает кассовый разрыв и затарку, которые полностью сжигают положительный эффект цифровизации.

Если после внедрения вы вынуждены постоянно проверять каждую рекомендацию ИИ руками, вы сами обнаружите, что данные не в порядке, но это произойдет постфактум, когда время и деньги на пилот уже потрачены. Поэтому DQ-оценка до старта проекта может спасти ситуацию. Именно отсутствие такой практики породило волну разочарования, когда руководители винят технологию, а проблема находится на уровне данных.

Диагностика готовности: что спрашивать у CEO

Как понять, что компания еще не созрела для масштабного ИИ, и нужно навести порядок в данных?

Простейший чек-лист для CEO состоит из двух вопросов. Первый: насколько вы доверяете своим данным? Можете ли вы принять управленческое решение, глядя на автоматизированный дашборд, или вначале обязательно запрашиваете ручную выгрузку в Excel, собранную и перепроверенную доверенным аналитиком? Если второй вариант — ваш повседневный ритуал, то доверять ИИ, работающему на тех же данных, вы не будете. И правильно сделаете.

Второй вопрос: как часто вы используете автоматизированную аналитику для операционных решений? Если отчеты существуют для галочки, а реальный контур управления завязан на личные ощущения и разрозненные данные в Excel-таблицах , внедрять нейросети поверх этого зыбкого фундамента бессмысленно. Сначала нужно поднять доверие к самим данным — выстроить элементарные процедуры валидации, избавиться от дублей и обеспечить прослеживаемость связей между сущностями.

План действий для CEO, настроенного на внедрение, выглядит так: оцените уровень качества данных, приоритезируйте ИИ-инициативы, выбирая для старта те, которые опираются на данные с высоким уровнем доверия. Параллельно займитесь улучшением качества данных в проблемных зонах. Такой подход не затормозит начало использования ИИ, но сразу встроит в программу осознание рисков.

DQ как страховка от катастроф

Можно ли считать плохие данные одной из главных причин разочарования бизнеса в ИИ?

Да, в совокупности это некачественные, противоречивые, несвязанные и плохо описанные данные. Технологии генеративного ИИ и предиктивного моделирования сегодня достаточно зрелые, но без индикаторов DQ нет доверия ни к данным, ни к результату работы ИИ, построенному на них.

Пока не появится культура отношения к данным как к критическому активу, любые инвестиции в ИИ останутся дорогой лотереей с невысокими шансами на выигрыш.

Источник: