Данные стали одним из ключевых ресурсов современной информационной системы. Они формируются практически во всех бизнес-процессах: при продажах и закупках, взаимодействии с клиентами, работе сотрудников, производстве, логистике и использовании цифровых сервисов. К этому добавляются журналы событий, телеметрия, документы, изображения, видео и данные внешних источников.
Рост количества источников и объемов информации приводит к тому, что задача ИТ выходит далеко за рамки простого хранения файлов и записей в базах данных. Необходимо определить, где хранить данные, как их структурировать, как обеспечить их качество и безопасность, как связать информацию из разных систем и как предоставить ее бизнесу для аналитики и принятия решений.
- Классификация
- Данные и информация в ИТ
- Несколько важных терминов
- Data Catalog
- Data Governance
- Data Quality
- Data Lineage
- Data Fabric
- Data Mesh
- Streaming и Event Streaming
- Способы хранения данных
- База данных (БД) — структурированное хранение данных
- DWH (Data Warehouse) — централизованное хранилище для аналитики
- Data Lake — хранение больших объемов исходных данных
- Data Lakehouse — объединение Data Lake и DWH
- Data Cube — многомерное представление данных для аналитики
- Другие способы
- Обработка и преобразование данных
- Передача и интеграция данных
- API — взаимодействие систем через программный интерфейс
- ETL / ELT — извлечение, преобразование и загрузка данных
- Streaming / Event Streaming — передача данных в реальном времени
- Message Broker — обмен сообщениями между системами
- ESB — интеграционная шина предприятия
- Специализированные способы интеграции
- Управление данными
- MDM — управление мастер-данными
- DMP — платформы управления данными
- Data Governance — правила и ответственность за данные
- Data Quality — качество данных
- Data Catalog — каталог данных
- Анализ данных
- BI — бизнес-аналитика
- Прогнозирование
- Рост объемов данных и проблема масштабирования
- От хранения данных к платформе данных
Классификация
С точки зрения структуры данные традиционно разделяют на три основные категории.
- Структурированные данные имеют заранее определенную структуру и обычно представлены в виде таблиц. К ним относятся сведения о клиентах, товарах, заказах, платежах и других бизнес-объектах.
- Полуструктурированные данные имеют определенную внутреннюю структуру, но не обязательно укладываются в жесткую табличную модель. Примеры — JSON, XML, логи и события информационных систем.
- Неструктурированные данные не имеют заранее определенной табличной модели. Это документы, электронная почта, изображения, аудио, видео и другие файлы.
Отдельно выделяют данные по их роли в бизнесе. Транзакционные данные описывают конкретные операции, мастер-данные (Master Data) — ключевые сущности организации, такие как клиент, товар или контрагент, а аналитические данные используются для отчетности, прогнозирования и поддержки управленческих решений.
Данные и информация в ИТ
В ИТ понятия «данные» и «информация» близки, но не являются полными синонимами. Данные представляют собой зафиксированные факты, значения и события, которые могут храниться и обрабатываться информационными системами. Информация возникает тогда, когда данные получают контекст, обрабатываются и приобретают практический смысл.
Например, набор значений Клиент: 1542, Заказ: 78231, Сумма: 125 000, Дата: 24.08.2026 является данными. После обработки и сопоставления с другими сведениями из них можно получить информацию: «Выручка клиента за август составила 125 000 рублей, что на 15% больше, чем в июле».
Упрощенно этот процесс можно представить как последовательность:
Данные → обработка и контекст → информация → знания → решение.
При этом в современной ИТ-терминологии граница между данными и информацией не всегда строго определена. Например, DWH (Data Warehouse) называется хранилищем данных, хотя информация в нем уже очищена, структурирована и подготовлена для аналитики.
Для описания архитектуры информационных систем обычно используется более широкий термин «данные»: хранение данных, передача и интеграция данных, обработка данных, управление данными и анализ данных. Информация в таком подходе рассматривается как результат осмысленной обработки данных, который используется человеком или информационной системой для принятия решений.
Несколько важных терминов
Вокруг хранения и обработки данных сформировался отдельный набор подходов и технологий, которые отвечают за управление, качество, интеграцию и использование информации в организации.
Data Catalog
Data Catalog — каталог данных, который содержит информацию о доступных наборах данных, их расположении, структуре, назначении и владельцах. Каталог помогает сотрудникам находить нужные данные и понимать, что именно они содержат.
Data Governance
Data Governance — система правил, ролей и процессов управления данными в организации. Она определяет, кто отвечает за данные, требования к их качеству и безопасности, порядок доступа и правила использования информации.
Data Quality
Data Quality — управление и контроль качества данных. Оцениваются такие характеристики, как точность, полнота, актуальность, непротиворечивость и отсутствие дубликатов.
Data Lineage
Data Lineage — отслеживание происхождения и движения данных. Показывает, откуда данные поступили, какие преобразования прошли и в каких системах или отчетах используются. Это особенно важно для контроля качества, аудита и анализа последствий изменений.
Data Fabric
Data Fabric — архитектурный подход к организации единого доступа к данным, распределенным между различными системами, хранилищами и источниками. Он предполагает использование интеграционных механизмов, метаданных и средств управления для того, чтобы данные можно было находить и использовать независимо от места их физического хранения.
Data Mesh
Data Mesh — децентрализованный подход к управлению данными, при котором ответственность за данные передается непосредственно бизнес-доменам. Каждая доменная команда становится владельцем своих данных и предоставляет их другим подразделениям как Data Product — продукт данных, отвечая за его качество, доступность и понятность.
Streaming и Event Streaming
Streaming и Event Streaming — подходы к обработке потоков данных по мере их поступления, практически в реальном времени. В отличие от пакетной обработки, при которой данные собираются и обрабатываются периодически, потоковая обработка позволяет реагировать на события практически сразу.
Потоковая архитектура используется, например, для обработки транзакций, телеметрии, событий пользователей, данных IoT, мониторинга оборудования и систем обнаружения подозрительной активности.
Способы хранения данных
В корпоративных информационных системах данные могут храниться и организовываться по-разному в зависимости от их структуры, объема, назначения и требований к скорости обработки. Для операционных процессов используются базы данных, для аналитики — специализированные хранилища, а для больших объемов разнообразной информации — Data Lake и Data Lakehouse.
База данных (БД) — структурированное хранение данных
База данных (БД) — организованное хранилище данных, предназначенное для их структурированного хранения, поиска и изменения. Базы данных являются основой большинства информационных систем: ERP, CRM, интернет-магазинов, банковских систем и других корпоративных приложений.
Для управления базами данных используются СУБД (системы управления базами данных). Они обеспечивают хранение и обработку информации, управление доступом, целостность данных, выполнение запросов и другие операции. Наиболее распространены реляционные СУБД, в которых данные представлены в виде связанных таблиц.
DWH (Data Warehouse) — централизованное хранилище для аналитики
DWH (Data Warehouse, хранилище данных) — централизованное хранилище, предназначенное прежде всего для аналитики, отчетности и поддержки принятия управленческих решений.
В DWH данные поступают из различных информационных систем — например, ERP, CRM, систем продаж и бухгалтерского учета. Перед загрузкой или непосредственно в процессе загрузки они могут очищаться, преобразовываться и приводиться к единому формату. Это позволяет получать согласованную аналитическую информацию из нескольких источников.
Data Lake — хранение больших объемов исходных данных
Data Lake (озеро данных) — хранилище больших объемов разнообразной информации, в котором данные могут сохраняться в исходном или близком к исходному виде. В отличие от классического DWH, Data Lake не требует заранее привести все данные к единой табличной структуре.
В Data Lake могут храниться структурированные данные из баз данных, JSON и XML, журналы событий, документы, изображения, видео, телеметрия и другие типы информации. Такой подход особенно востребован при работе с большими объемами данных, машинным обучением и искусственным интеллектом.
При отсутствии каталогизации, контроля качества и понятных правил управления Data Lake может превратиться в Data Swamp («болото данных») — хранилище, в котором данные существуют, но их сложно найти, интерпретировать и использовать.
Data Lakehouse — объединение Data Lake и DWH
Data Lakehouse — современный подход, объединяющий возможности Data Lake и Data Warehouse. Он позволяет сохранять большие объемы разнообразных данных и одновременно предоставлять структурированный доступ к ним для аналитики и других задач.
Lakehouse стремится объединить гибкость Data Lake с управляемостью, качеством данных и аналитическими возможностями, характерными для DWH. Такой подход удобен, когда одни и те же данные должны использоваться одновременно для BI, аналитики, машинного обучения и AI.
Data Cube — многомерное представление данных для аналитики
Data Cube (куб данных) — способ организации и представления данных в многомерном виде для аналитического анализа. Информация может одновременно рассматриваться по нескольким измерениям, например по товарам, регионам, периодам и каналам продаж.
Кубы данных традиционно связаны с технологиями OLAP (Online Analytical Processing), которые позволяют быстро выполнять многомерные аналитические операции: сравнивать показатели, делать детализацию данных, строить срезы и анализировать динамику.
Другие способы
Помимо основных подходов существуют специализированные способы организации хранения данных. Например, Data Mart (витрина данных) предназначена для конкретного подразделения или аналитической задачи, а Object Storage (объектное хранилище) используется для хранения файлов и других объектов и часто служит технологической основой Data Lake.
Для специализированных задач применяются графовые базы данных, базы данных временных рядов, колоночные базы данных и другие типы хранилищ. Они оптимизированы под определенные структуры данных и характер запросов.
Распределенные хранилища позволяют размещать данные на нескольких серверах или узлах и обрабатывать их параллельно. Такой подход применяется для масштабирования систем, повышения производительности и обеспечения отказоустойчивости при работе с большими объемами информации.
Обработка и преобразование данных
После передачи данных в целевую систему их необходимо подготовить для дальнейшего использования. Данные из разных источников могут иметь различный формат, структуру и уровень качества, содержать дубли, пропуски или противоречивые значения. Обработка и преобразование данных позволяют привести информацию к единому виду, устранить ошибки и подготовить ее для операционных процессов, аналитики и других задач.
К основным операциям относятся очистка данных (Data Cleansing), удаление дубликатов, проверка корректности, нормализация, преобразование форматов, объединение информации из разных источников и расчет производных показателей. Например, данные о клиентах из CRM и ERP могут быть объединены в единый набор, а даты, адреса и идентификаторы приведены к единому формату.
Обработка может выполняться пакетно (Batch Processing) — когда данные собираются и обрабатываются периодически, либо потоково (Stream Processing) — непосредственно по мере поступления. Выбор подхода зависит от требований к скорости обработки: для ежедневной отчетности может быть достаточно пакетной обработки, тогда как для мониторинга транзакций, оборудования или пользовательских событий необходима обработка практически в реальном времени.
Преобразованные данные могут использоваться для загрузки в DWH, Data Lakehouse и аналитические витрины, а также непосредственно в бизнес-приложениях. Таким образом, обработка и преобразование являются промежуточным звеном между исходными данными и их практическим использованием.
Передача и интеграция данных
Информационные системы редко работают изолированно. CRM, ERP, системы электронного документооборота, интернет-сервисы, мобильные приложения, аналитические платформы и другие компоненты корпоративной ИТ-инфраструктуры должны обмениваться данными. Для этого используются различные механизмы интеграции — от прямого взаимодействия через API до централизованных интеграционных платформ и потоковой передачи событий.
API — взаимодействие систем через программный интерфейс
API (Application Programming Interface) — программный интерфейс, через который одна информационная система может обращаться к функциям или данным другой системы по заранее определенным правилам.
API особенно важны в микросервисной архитектуре, где отдельные сервисы взаимодействуют между собой через стандартизированные интерфейсы. API позволяют получать данные, передавать информацию и инициировать операции без прямого доступа к внутренней реализации другой системы.
ETL / ELT — извлечение, преобразование и загрузка данных
ETL (Extract, Transform, Load) и ELT (Extract, Load, Transform) — подходы к перемещению и преобразованию данных между информационными системами и хранилищами.
В ETL данные сначала извлекаются из источника, затем преобразуются и после этого загружаются в целевую систему. В ELT данные сначала загружаются, а преобразование выполняется уже внутри целевого хранилища. Эти подходы широко используются при построении DWH, Data Lake и других аналитических платформ.
Streaming / Event Streaming — передача данных в реальном времени
Streaming и Event Streaming обеспечивают передачу и обработку данных по мере их возникновения. Вместо периодической передачи больших пакетов информации системы обрабатывают отдельные события или непрерывные потоки данных практически в реальном времени.
Такой подход применяется для обработки транзакций, телеметрии, пользовательских событий, данных IoT, мониторинга оборудования и других сценариев, где важна минимальная задержка между возникновением события и его обработкой.
Message Broker — обмен сообщениями между системами
Message Broker (брокер сообщений) — промежуточный программный компонент, который принимает сообщения от одной системы и передает их другим системам или сервисам. Отправитель и получатель при этом могут работать независимо друг от друга.
Брокеры сообщений позволяют реализовать асинхронное взаимодействие, когда система-отправитель не должна ждать немедленного ответа получателя. Это повышает устойчивость и масштабируемость распределенных и микросервисных систем.
ESB — интеграционная шина предприятия
ESB (Enterprise Service Bus) — архитектурный подход и программная инфраструктура для централизованной интеграции большого количества корпоративных информационных систем.
ESB может обеспечивать маршрутизацию сообщений, преобразование форматов данных, взаимодействие различных протоколов и централизованное управление интеграциями. Такой подход особенно распространен в крупных организациях с большим количеством разнородных информационных систем, которые необходимо связать в единый интеграционный контур.
Специализированные способы интеграции
Помимо основных механизмов существуют специализированные способы обмена данными, применяемые в отдельных архитектурах и бизнес-сценариях.
CDC (Change Data Capture) — механизм фиксации изменений в источнике данных. Система отслеживает добавление, изменение или удаление записей и передает информацию об этих изменениях в другие системы. CDC позволяет синхронизировать данные без постоянной полной выгрузки всей базы.
EDI (Electronic Data Interchange) — стандартизированный электронный обмен документами и структурированными данными между организациями. EDI применяется, например, для автоматизированного обмена заказами, счетами, уведомлениями о поставках и другими коммерческими документами.
File Transfer — передача данных в виде файлов. Для интеграции могут использоваться CSV, XML, JSON, Excel и другие форматы. Несмотря на относительную простоту, файловый обмен до сих пор используется для интеграции систем, когда постоянное API-взаимодействие не требуется или невозможно.
Выбор механизма зависит от требований к скорости передачи, объему данных, надежности, связанности систем и необходимости обработки информации в реальном времени. В современной архитектуре несколько подходов обычно используются одновременно: например, API для синхронного взаимодействия, Message Broker для асинхронного обмена, ETL/ELT для загрузки данных в аналитические системы и Streaming для обработки событий в реальном времени.
Управление данными
По мере роста количества информационных систем данные становятся не только ресурсом, который необходимо хранить и обрабатывать, но и объектом постоянного управления. В компании одни и те же сведения могут использоваться сразу в нескольких системах, поступать из разных источников и изменяться разными подразделениями. Поэтому необходимо определить, какие данные являются эталонными, кто за них отвечает, насколько они качественны и где именно они используются.
Управление данными объединяет процессы, правила и технологии, которые обеспечивают согласованность, качество, доступность, безопасность и контролируемое использование данных на протяжении их жизненного цикла.
MDM — управление мастер-данными
MDM (Master Data Management) — подход к управлению ключевыми бизнес-сущностями организации, такими как клиенты, товары, контрагенты, сотрудники и подразделения.
Основная задача MDM — сформировать согласованное представление таких объектов во всех информационных системах. Например, один и тот же клиент может присутствовать в CRM, ERP и системе лояльности. MDM помогает устранить дублирование, согласовать атрибуты и определить эталонную запись, которая используется другими системами.
DMP — платформы управления данными
DMP (Data Management Platform) — платформа для сбора, объединения, сегментации и анализа данных, поступающих из различных источников. DMP исторически широко применялись в маркетинге для работы с данными о пользователях, рекламных взаимодействиях и цифровом поведении, позволяя формировать аудитории и использовать их для персонализации рекламных кампаний.
В отличие от MDM, которое отвечает за управление ключевыми бизнес-сущностями, DMP ориентированы прежде всего на объединение и использование массивов пользовательских и маркетинговых данных. В современных архитектурах задачи DMP частично пересекаются с CDP (Customer Data Platform), Data Lake и другими платформами работы с данными.
Data Governance — правила и ответственность за данные
Data Governance — система правил, ролей и процессов, определяющих порядок управления данными в организации. Она устанавливает, кто отвечает за конкретные данные, какие требования предъявляются к их качеству и безопасности, кто имеет право доступа и как данные должны использоваться.
Data Governance позволяет перейти от ситуации, когда данные существуют в отдельных системах и подразделениях, к управляемой корпоративной среде, в которой определены владельцы данных, политики и единые правила работы с информацией.
Data Quality — качество данных
Data Quality — направление, связанное с оценкой и обеспечением качества данных. Для корпоративных данных важны такие характеристики, как точность, полнота, актуальность, непротиворечивость и уникальность.
Например, наличие нескольких карточек одного контрагента, устаревший адрес клиента или различающиеся реквизиты организации в разных системах снижают качество данных и могут приводить к ошибкам в бизнес-процессах и отчетности. Поэтому контроль качества включает выявление, исправление и предотвращение подобных проблем.
Data Catalog — каталог данных
Data Catalog — каталог, содержащий сведения о данных, доступных в информационной среде организации. Он позволяет определить, какие данные существуют, где они находятся, что означают, кто является их владельцем и как они связаны с другими данными.
Каталог данных особенно важен в крупных организациях, где информация распределена между десятками или сотнями систем. Вместо поиска нужных данных вручную сотрудники могут использовать единый каталог, содержащий описание наборов данных, их структуры, источников и назначения.
В совокупности MDM, Data Governance, Data Quality и Data Catalog формируют основу управляемой работы с корпоративными данными: MDM обеспечивает согласованность ключевых сущностей, Data Governance определяет правила и ответственность, Data Quality контролирует качество, а Data Catalog делает данные понятными и доступными для поиска и использования.
Анализ данных
После хранения, интеграции, обработки и управления данные становятся основой для аналитики и принятия управленческих решений. Анализ данных позволяет выявлять закономерности, оценивать результаты деятельности компании, находить отклонения и формировать прогнозы.
BI — бизнес-аналитика
BI (Business Intelligence) — класс технологий и инструментов для анализа корпоративных данных, подготовки отчетности и визуализации ключевых показателей. BI-системы объединяют данные из различных источников и представляют их в виде отчетов, дашбордов, графиков и других аналитических представлений.
BI позволяет руководителям и специалистам получать актуальную информацию о продажах, финансах, производстве, запасах, работе подразделений и других направлениях бизнеса. Важная задача BI — предоставить пользователю единую картину деятельности компании и возможность быстро анализировать отклонения и их причины.
Прогнозирование
Прогнозирование использует накопленные исторические и текущие данные для оценки будущих показателей. С помощью статистических методов, математических моделей и алгоритмов машинного обучения можно прогнозировать спрос, продажи, финансовые результаты, потребность в ресурсах, загрузку производственных мощностей и другие параметры бизнеса.
Прогнозирование является важной составляющей IBP (Integrated Business Planning) — подхода к интегрированному бизнес-планированию. IBP-системы объединяют данные и планы различных функциональных направлений, позволяя сопоставлять прогноз продаж со складскими запасами, производственными и логистическими возможностями, финансовыми показателями и другими ограничениями.
В результате анализ данных выходит за рамки фиксации уже произошедших событий. Компания получает возможность оценивать несколько сценариев развития, заранее выявлять потенциальные проблемы и принимать решения с учетом прогнозируемых изменений.
Рост объемов данных и проблема масштабирования
Цифровизация приводит к постоянному увеличению количества создаваемой и хранимой информации. Новые данные появляются не только в корпоративных приложениях, но и в веб-сервисах, мобильных устройствах, IoT, системах видеонаблюдения, телеметрии и AI-системах.
Поэтому в ИТ часто говорят об экспоненциальном росте данных. Строго говоря, это не универсальный математический закон, описывающий любой период и любую организацию. Это скорее характеристика долгосрочной тенденции: количество источников данных, частота их генерации и разнообразие форматов растут настолько быстро, что традиционного подхода «просто добавим еще дисков» становится недостаточно.
Современная архитектура должна учитывать не только объем хранения, но и скорость поступления данных, стоимость хранения и обработки, требования к доступности, безопасность, качество и возможность повторного использования информации.
От хранения данных к платформе данных
В результате корпоративная работа с данными постепенно превращается из набора отдельных систем хранения в полноценную Data Platform (Data Management Platform, DMP)
Упрощенно ее можно представить как последовательность:
Источники данных → интеграция → хранение → управление → обработка → аналитика → принятие решений.
На уровне источников находятся операционные системы и базы данных. Затем данные передаются через ETL, ELT или потоковые механизмы. Для хранения могут использоваться DWH, Data Lake и Data Lakehouse. MDM отвечает за согласованность ключевых бизнес-сущностей, а Data Governance — за правила, качество, доступ и ответственность. На верхнем уровне данные становятся основой BI, аналитики, машинного обучения и AI.
Таким образом, современная работа с данными — это уже не вопрос выбора одной технологии хранения. Это архитектура, объединяющая данные, хранилища, интеграционные процессы, управление и аналитические инструменты в единый информационный контур.


