Данные и информация в ИТ: хранение, управление и использование

Данные стали одним из ключевых ресурсов современной информационной системы. Они формируются практически во всех бизнес-процессах: при продажах и закупках, взаимодействии с клиентами, работе сотрудников, производстве, логистике и использовании цифровых сервисов. К этому добавляются журналы событий, телеметрия, документы, изображения, видео и данные внешних источников.

Рост количества источников и объемов информации приводит к тому, что задача ИТ выходит далеко за рамки простого хранения файлов и записей в базах данных. Необходимо определить, где хранить данные, как их структурировать, как обеспечить их качество и безопасность, как связать информацию из разных систем и как предоставить ее бизнесу для аналитики и принятия решений.

Содержание
  1. Классификация
  2. Данные и информация в ИТ
  3. Несколько важных терминов
  4. Data Catalog
  5. Data Governance
  6. Data Quality
  7. Data Lineage
  8. Data Fabric
  9. Data Mesh
  10. Streaming и Event Streaming
  11. Способы хранения данных
  12. База данных (БД) — структурированное хранение данных
  13. DWH (Data Warehouse) — централизованное хранилище для аналитики
  14. Data Lake — хранение больших объемов исходных данных
  15. Data Lakehouse — объединение Data Lake и DWH
  16. Data Cube — многомерное представление данных для аналитики
  17. Другие способы
  18. Обработка и преобразование данных
  19. Передача и интеграция данных
  20. API — взаимодействие систем через программный интерфейс
  21. ETL / ELT — извлечение, преобразование и загрузка данных
  22. Streaming / Event Streaming — передача данных в реальном времени
  23. Message Broker — обмен сообщениями между системами
  24. ESB — интеграционная шина предприятия
  25. Специализированные способы интеграции
  26. Управление данными
  27. MDM — управление мастер-данными
  28. DMP — платформы управления данными
  29. Data Governance — правила и ответственность за данные
  30. Data Quality — качество данных
  31. Data Catalog — каталог данных
  32. Анализ данных
  33. BI — бизнес-аналитика
  34. Прогнозирование
  35. Рост объемов данных и проблема масштабирования
  36. От хранения данных к платформе данных

Классификация

С точки зрения структуры данные традиционно разделяют на три основные категории.

  • Структурированные данные имеют заранее определенную структуру и обычно представлены в виде таблиц. К ним относятся сведения о клиентах, товарах, заказах, платежах и других бизнес-объектах.
  • Полуструктурированные данные имеют определенную внутреннюю структуру, но не обязательно укладываются в жесткую табличную модель. Примеры — JSON, XML, логи и события информационных систем.
  • Неструктурированные данные не имеют заранее определенной табличной модели. Это документы, электронная почта, изображения, аудио, видео и другие файлы.

Отдельно выделяют данные по их роли в бизнесе. Транзакционные данные описывают конкретные операции, мастер-данные (Master Data) — ключевые сущности организации, такие как клиент, товар или контрагент, а аналитические данные используются для отчетности, прогнозирования и поддержки управленческих решений.

Данные и информация в ИТ

В ИТ понятия «данные» и «информация» близки, но не являются полными синонимами. Данные представляют собой зафиксированные факты, значения и события, которые могут храниться и обрабатываться информационными системами. Информация возникает тогда, когда данные получают контекст, обрабатываются и приобретают практический смысл.

Например, набор значений Клиент: 1542, Заказ: 78231, Сумма: 125 000, Дата: 24.08.2026 является данными. После обработки и сопоставления с другими сведениями из них можно получить информацию: «Выручка клиента за август составила 125 000 рублей, что на 15% больше, чем в июле».

Упрощенно этот процесс можно представить как последовательность:

Данные → обработка и контекст → информация → знания → решение.

При этом в современной ИТ-терминологии граница между данными и информацией не всегда строго определена. Например, DWH (Data Warehouse) называется хранилищем данных, хотя информация в нем уже очищена, структурирована и подготовлена для аналитики.

Для описания архитектуры информационных систем обычно используется более широкий термин «данные»: хранение данных, передача и интеграция данных, обработка данных, управление данными и анализ данных. Информация в таком подходе рассматривается как результат осмысленной обработки данных, который используется человеком или информационной системой для принятия решений.

Несколько важных терминов

Вокруг хранения и обработки данных сформировался отдельный набор подходов и технологий, которые отвечают за управление, качество, интеграцию и использование информации в организации.

Data Catalog

Data Catalog — каталог данных, который содержит информацию о доступных наборах данных, их расположении, структуре, назначении и владельцах. Каталог помогает сотрудникам находить нужные данные и понимать, что именно они содержат.

Data Governance

Data Governance — система правил, ролей и процессов управления данными в организации. Она определяет, кто отвечает за данные, требования к их качеству и безопасности, порядок доступа и правила использования информации.

Data Quality

Data Quality — управление и контроль качества данных. Оцениваются такие характеристики, как точность, полнота, актуальность, непротиворечивость и отсутствие дубликатов.

Data Lineage

Data Lineage — отслеживание происхождения и движения данных. Показывает, откуда данные поступили, какие преобразования прошли и в каких системах или отчетах используются. Это особенно важно для контроля качества, аудита и анализа последствий изменений.

Data Fabric

Data Fabric — архитектурный подход к организации единого доступа к данным, распределенным между различными системами, хранилищами и источниками. Он предполагает использование интеграционных механизмов, метаданных и средств управления для того, чтобы данные можно было находить и использовать независимо от места их физического хранения.

Data Mesh

Data Mesh — децентрализованный подход к управлению данными, при котором ответственность за данные передается непосредственно бизнес-доменам. Каждая доменная команда становится владельцем своих данных и предоставляет их другим подразделениям как Data Product — продукт данных, отвечая за его качество, доступность и понятность.

Streaming и Event Streaming

Streaming и Event Streaming — подходы к обработке потоков данных по мере их поступления, практически в реальном времени. В отличие от пакетной обработки, при которой данные собираются и обрабатываются периодически, потоковая обработка позволяет реагировать на события практически сразу.

Потоковая архитектура используется, например, для обработки транзакций, телеметрии, событий пользователей, данных IoT, мониторинга оборудования и систем обнаружения подозрительной активности.

Способы хранения данных

В корпоративных информационных системах данные могут храниться и организовываться по-разному в зависимости от их структуры, объема, назначения и требований к скорости обработки. Для операционных процессов используются базы данных, для аналитики — специализированные хранилища, а для больших объемов разнообразной информации — Data Lake и Data Lakehouse.

База данных (БД) — структурированное хранение данных

База данных (БД) — организованное хранилище данных, предназначенное для их структурированного хранения, поиска и изменения. Базы данных являются основой большинства информационных систем: ERP, CRM, интернет-магазинов, банковских систем и других корпоративных приложений.

Для управления базами данных используются СУБД (системы управления базами данных). Они обеспечивают хранение и обработку информации, управление доступом, целостность данных, выполнение запросов и другие операции. Наиболее распространены реляционные СУБД, в которых данные представлены в виде связанных таблиц.

DWH (Data Warehouse) — централизованное хранилище для аналитики

DWH (Data Warehouse, хранилище данных) — централизованное хранилище, предназначенное прежде всего для аналитики, отчетности и поддержки принятия управленческих решений.

В DWH данные поступают из различных информационных систем — например, ERP, CRM, систем продаж и бухгалтерского учета. Перед загрузкой или непосредственно в процессе загрузки они могут очищаться, преобразовываться и приводиться к единому формату. Это позволяет получать согласованную аналитическую информацию из нескольких источников.

Data Lake — хранение больших объемов исходных данных

Data Lake (озеро данных) — хранилище больших объемов разнообразной информации, в котором данные могут сохраняться в исходном или близком к исходному виде. В отличие от классического DWH, Data Lake не требует заранее привести все данные к единой табличной структуре.

В Data Lake могут храниться структурированные данные из баз данных, JSON и XML, журналы событий, документы, изображения, видео, телеметрия и другие типы информации. Такой подход особенно востребован при работе с большими объемами данных, машинным обучением и искусственным интеллектом.

При отсутствии каталогизации, контроля качества и понятных правил управления Data Lake может превратиться в Data Swamp («болото данных») — хранилище, в котором данные существуют, но их сложно найти, интерпретировать и использовать.

Data Lakehouse — объединение Data Lake и DWH

Data Lakehouse — современный подход, объединяющий возможности Data Lake и Data Warehouse. Он позволяет сохранять большие объемы разнообразных данных и одновременно предоставлять структурированный доступ к ним для аналитики и других задач.

Lakehouse стремится объединить гибкость Data Lake с управляемостью, качеством данных и аналитическими возможностями, характерными для DWH. Такой подход удобен, когда одни и те же данные должны использоваться одновременно для BI, аналитики, машинного обучения и AI.

Data Cube — многомерное представление данных для аналитики

Data Cube (куб данных) — способ организации и представления данных в многомерном виде для аналитического анализа. Информация может одновременно рассматриваться по нескольким измерениям, например по товарам, регионам, периодам и каналам продаж.

Кубы данных традиционно связаны с технологиями OLAP (Online Analytical Processing), которые позволяют быстро выполнять многомерные аналитические операции: сравнивать показатели, делать детализацию данных, строить срезы и анализировать динамику.

Другие способы

Помимо основных подходов существуют специализированные способы организации хранения данных. Например, Data Mart (витрина данных) предназначена для конкретного подразделения или аналитической задачи, а Object Storage (объектное хранилище) используется для хранения файлов и других объектов и часто служит технологической основой Data Lake.

Для специализированных задач применяются графовые базы данных, базы данных временных рядов, колоночные базы данных и другие типы хранилищ. Они оптимизированы под определенные структуры данных и характер запросов.

Распределенные хранилища позволяют размещать данные на нескольких серверах или узлах и обрабатывать их параллельно. Такой подход применяется для масштабирования систем, повышения производительности и обеспечения отказоустойчивости при работе с большими объемами информации.

Обработка и преобразование данных

После передачи данных в целевую систему их необходимо подготовить для дальнейшего использования. Данные из разных источников могут иметь различный формат, структуру и уровень качества, содержать дубли, пропуски или противоречивые значения. Обработка и преобразование данных позволяют привести информацию к единому виду, устранить ошибки и подготовить ее для операционных процессов, аналитики и других задач.

К основным операциям относятся очистка данных (Data Cleansing), удаление дубликатов, проверка корректности, нормализация, преобразование форматов, объединение информации из разных источников и расчет производных показателей. Например, данные о клиентах из CRM и ERP могут быть объединены в единый набор, а даты, адреса и идентификаторы приведены к единому формату.

Обработка может выполняться пакетно (Batch Processing) — когда данные собираются и обрабатываются периодически, либо потоково (Stream Processing) — непосредственно по мере поступления. Выбор подхода зависит от требований к скорости обработки: для ежедневной отчетности может быть достаточно пакетной обработки, тогда как для мониторинга транзакций, оборудования или пользовательских событий необходима обработка практически в реальном времени.

Преобразованные данные могут использоваться для загрузки в DWH, Data Lakehouse и аналитические витрины, а также непосредственно в бизнес-приложениях. Таким образом, обработка и преобразование являются промежуточным звеном между исходными данными и их практическим использованием.

Передача и интеграция данных

Информационные системы редко работают изолированно. CRM, ERP, системы электронного документооборота, интернет-сервисы, мобильные приложения, аналитические платформы и другие компоненты корпоративной ИТ-инфраструктуры должны обмениваться данными. Для этого используются различные механизмы интеграции — от прямого взаимодействия через API до централизованных интеграционных платформ и потоковой передачи событий.

API — взаимодействие систем через программный интерфейс

API (Application Programming Interface) — программный интерфейс, через который одна информационная система может обращаться к функциям или данным другой системы по заранее определенным правилам.

API особенно важны в микросервисной архитектуре, где отдельные сервисы взаимодействуют между собой через стандартизированные интерфейсы. API позволяют получать данные, передавать информацию и инициировать операции без прямого доступа к внутренней реализации другой системы.

ETL / ELT — извлечение, преобразование и загрузка данных

ETL (Extract, Transform, Load) и ELT (Extract, Load, Transform) — подходы к перемещению и преобразованию данных между информационными системами и хранилищами.

В ETL данные сначала извлекаются из источника, затем преобразуются и после этого загружаются в целевую систему. В ELT данные сначала загружаются, а преобразование выполняется уже внутри целевого хранилища. Эти подходы широко используются при построении DWH, Data Lake и других аналитических платформ.

Streaming / Event Streaming — передача данных в реальном времени

Streaming и Event Streaming обеспечивают передачу и обработку данных по мере их возникновения. Вместо периодической передачи больших пакетов информации системы обрабатывают отдельные события или непрерывные потоки данных практически в реальном времени.

Такой подход применяется для обработки транзакций, телеметрии, пользовательских событий, данных IoT, мониторинга оборудования и других сценариев, где важна минимальная задержка между возникновением события и его обработкой.

Message Broker — обмен сообщениями между системами

Message Broker (брокер сообщений) — промежуточный программный компонент, который принимает сообщения от одной системы и передает их другим системам или сервисам. Отправитель и получатель при этом могут работать независимо друг от друга.

Брокеры сообщений позволяют реализовать асинхронное взаимодействие, когда система-отправитель не должна ждать немедленного ответа получателя. Это повышает устойчивость и масштабируемость распределенных и микросервисных систем.

ESB — интеграционная шина предприятия

ESB (Enterprise Service Bus) — архитектурный подход и программная инфраструктура для централизованной интеграции большого количества корпоративных информационных систем.

ESB может обеспечивать маршрутизацию сообщений, преобразование форматов данных, взаимодействие различных протоколов и централизованное управление интеграциями. Такой подход особенно распространен в крупных организациях с большим количеством разнородных информационных систем, которые необходимо связать в единый интеграционный контур.

Специализированные способы интеграции

Помимо основных механизмов существуют специализированные способы обмена данными, применяемые в отдельных архитектурах и бизнес-сценариях.

CDC (Change Data Capture) — механизм фиксации изменений в источнике данных. Система отслеживает добавление, изменение или удаление записей и передает информацию об этих изменениях в другие системы. CDC позволяет синхронизировать данные без постоянной полной выгрузки всей базы.

EDI (Electronic Data Interchange) — стандартизированный электронный обмен документами и структурированными данными между организациями. EDI применяется, например, для автоматизированного обмена заказами, счетами, уведомлениями о поставках и другими коммерческими документами.

File Transfer — передача данных в виде файлов. Для интеграции могут использоваться CSV, XML, JSON, Excel и другие форматы. Несмотря на относительную простоту, файловый обмен до сих пор используется для интеграции систем, когда постоянное API-взаимодействие не требуется или невозможно.

Выбор механизма зависит от требований к скорости передачи, объему данных, надежности, связанности систем и необходимости обработки информации в реальном времени. В современной архитектуре несколько подходов обычно используются одновременно: например, API для синхронного взаимодействия, Message Broker для асинхронного обмена, ETL/ELT для загрузки данных в аналитические системы и Streaming для обработки событий в реальном времени.

Управление данными

По мере роста количества информационных систем данные становятся не только ресурсом, который необходимо хранить и обрабатывать, но и объектом постоянного управления. В компании одни и те же сведения могут использоваться сразу в нескольких системах, поступать из разных источников и изменяться разными подразделениями. Поэтому необходимо определить, какие данные являются эталонными, кто за них отвечает, насколько они качественны и где именно они используются.

Управление данными объединяет процессы, правила и технологии, которые обеспечивают согласованность, качество, доступность, безопасность и контролируемое использование данных на протяжении их жизненного цикла.

MDM — управление мастер-данными

MDM (Master Data Management) — подход к управлению ключевыми бизнес-сущностями организации, такими как клиенты, товары, контрагенты, сотрудники и подразделения.

Основная задача MDM — сформировать согласованное представление таких объектов во всех информационных системах. Например, один и тот же клиент может присутствовать в CRM, ERP и системе лояльности. MDM помогает устранить дублирование, согласовать атрибуты и определить эталонную запись, которая используется другими системами.

DMP — платформы управления данными

DMP (Data Management Platform) — платформа для сбора, объединения, сегментации и анализа данных, поступающих из различных источников. DMP исторически широко применялись в маркетинге для работы с данными о пользователях, рекламных взаимодействиях и цифровом поведении, позволяя формировать аудитории и использовать их для персонализации рекламных кампаний.

В отличие от MDM, которое отвечает за управление ключевыми бизнес-сущностями, DMP ориентированы прежде всего на объединение и использование массивов пользовательских и маркетинговых данных. В современных архитектурах задачи DMP частично пересекаются с CDP (Customer Data Platform), Data Lake и другими платформами работы с данными.

Data Governance — правила и ответственность за данные

Data Governance — система правил, ролей и процессов, определяющих порядок управления данными в организации. Она устанавливает, кто отвечает за конкретные данные, какие требования предъявляются к их качеству и безопасности, кто имеет право доступа и как данные должны использоваться.

Data Governance позволяет перейти от ситуации, когда данные существуют в отдельных системах и подразделениях, к управляемой корпоративной среде, в которой определены владельцы данных, политики и единые правила работы с информацией.

Data Quality — качество данных

Data Quality — направление, связанное с оценкой и обеспечением качества данных. Для корпоративных данных важны такие характеристики, как точность, полнота, актуальность, непротиворечивость и уникальность.

Например, наличие нескольких карточек одного контрагента, устаревший адрес клиента или различающиеся реквизиты организации в разных системах снижают качество данных и могут приводить к ошибкам в бизнес-процессах и отчетности. Поэтому контроль качества включает выявление, исправление и предотвращение подобных проблем.

Data Catalog — каталог данных

Data Catalog — каталог, содержащий сведения о данных, доступных в информационной среде организации. Он позволяет определить, какие данные существуют, где они находятся, что означают, кто является их владельцем и как они связаны с другими данными.

Каталог данных особенно важен в крупных организациях, где информация распределена между десятками или сотнями систем. Вместо поиска нужных данных вручную сотрудники могут использовать единый каталог, содержащий описание наборов данных, их структуры, источников и назначения.

В совокупности MDM, Data Governance, Data Quality и Data Catalog формируют основу управляемой работы с корпоративными данными: MDM обеспечивает согласованность ключевых сущностей, Data Governance определяет правила и ответственность, Data Quality контролирует качество, а Data Catalog делает данные понятными и доступными для поиска и использования.

Анализ данных

После хранения, интеграции, обработки и управления данные становятся основой для аналитики и принятия управленческих решений. Анализ данных позволяет выявлять закономерности, оценивать результаты деятельности компании, находить отклонения и формировать прогнозы.

BI — бизнес-аналитика

BI (Business Intelligence) — класс технологий и инструментов для анализа корпоративных данных, подготовки отчетности и визуализации ключевых показателей. BI-системы объединяют данные из различных источников и представляют их в виде отчетов, дашбордов, графиков и других аналитических представлений.

BI позволяет руководителям и специалистам получать актуальную информацию о продажах, финансах, производстве, запасах, работе подразделений и других направлениях бизнеса. Важная задача BI — предоставить пользователю единую картину деятельности компании и возможность быстро анализировать отклонения и их причины.

Прогнозирование

Прогнозирование использует накопленные исторические и текущие данные для оценки будущих показателей. С помощью статистических методов, математических моделей и алгоритмов машинного обучения можно прогнозировать спрос, продажи, финансовые результаты, потребность в ресурсах, загрузку производственных мощностей и другие параметры бизнеса.

Прогнозирование является важной составляющей IBP (Integrated Business Planning) — подхода к интегрированному бизнес-планированию. IBP-системы объединяют данные и планы различных функциональных направлений, позволяя сопоставлять прогноз продаж со складскими запасами, производственными и логистическими возможностями, финансовыми показателями и другими ограничениями.

В результате анализ данных выходит за рамки фиксации уже произошедших событий. Компания получает возможность оценивать несколько сценариев развития, заранее выявлять потенциальные проблемы и принимать решения с учетом прогнозируемых изменений.

Рост объемов данных и проблема масштабирования

Цифровизация приводит к постоянному увеличению количества создаваемой и хранимой информации. Новые данные появляются не только в корпоративных приложениях, но и в веб-сервисах, мобильных устройствах, IoT, системах видеонаблюдения, телеметрии и AI-системах.

Поэтому в ИТ часто говорят об экспоненциальном росте данных. Строго говоря, это не универсальный математический закон, описывающий любой период и любую организацию. Это скорее характеристика долгосрочной тенденции: количество источников данных, частота их генерации и разнообразие форматов растут настолько быстро, что традиционного подхода «просто добавим еще дисков» становится недостаточно.

Современная архитектура должна учитывать не только объем хранения, но и скорость поступления данных, стоимость хранения и обработки, требования к доступности, безопасность, качество и возможность повторного использования информации.

От хранения данных к платформе данных

В результате корпоративная работа с данными постепенно превращается из набора отдельных систем хранения в полноценную Data Platform (Data Management Platform, DMP)

Упрощенно ее можно представить как последовательность:

Источники данных → интеграция → хранение → управление → обработка → аналитика → принятие решений.

На уровне источников находятся операционные системы и базы данных. Затем данные передаются через ETL, ELT или потоковые механизмы. Для хранения могут использоваться DWH, Data Lake и Data Lakehouse. MDM отвечает за согласованность ключевых бизнес-сущностей, а Data Governance — за правила, качество, доступ и ответственность. На верхнем уровне данные становятся основой BI, аналитики, машинного обучения и AI.

Таким образом, современная работа с данными — это уже не вопрос выбора одной технологии хранения. Это архитектура, объединяющая данные, хранилища, интеграционные процессы, управление и аналитические инструменты в единый информационный контур.

CIO-NAVIGATOR