Экосистема
управления
данными
Разберем это определение на наглядном примере.
это процесс, связанный с накоплением, организацией, обновлением, хранением данных и поиском информации
Классическое определение управления данными:
В первой статье мы обсудили, что такое дата-грамотность и принятие решений на основе данных, а также почему эти навыки так важны для современных компаний.

Сегодня разберемся с тем, какие элементы необоходимы в компании для эффективного управления данными.
Как выглядит процесс управления данными?
Шаг первый: Накопление
Система
хранения информации
Интерфейс
для ввода данных
Для сложных процессов обычно разрабатываются специальные приложения, например, мобильные или web-приложения, которые сохраняют вносимую информацию в БД.
  • Excel
  • Карандаш и блокнот
Интерфейсом для ввода данных и системой хранения могут быть:
Допустим ваша задача — продать услуги интернета в новостройках.

Чтобы собрать необходимые данные — их нужно откуда-то получать. Данные должны где-то накапливаться.

В нашем примере нужны данные о том, где строятся новые дома. Эту информацию мы можем получить у городских служб или напрямую у застройщиков.

Будем считать, что накопление информации уже происходит. Городские службы, или застройщики фиксируют нужные данные в электронном виде. Каждый факт строительства нового дома заносится в информационные системы.

Если бы мы говорили о незаконном строительстве, то процесс накопления информации пришлось бы организовать — выявлять все строительство в городе (например, по космическим снимкам), сверять списки объектов недвижимости с разрешениями на строительство, и фиксировать незаконно строящиеся объекты.

В большинстве случаев, для накопления данных нужны:
Шаг второй: Организация
Договориться с владельцем источника данных
Можно, конечно, взять и взломать чужую систему, но мы рассматриваем только законные пути.
Научиться забирать данные из источника
Не будем рассматривать экзотические варианты с работой с источником «блокнот» или «excel».
В нашем примере, вероятнее всего, информация о новостройках будет храниться в БД. И нам потребуется настроить интеграцию с системой, чтобы подключиться и выгрузить нужную информацию.
Создать систему, в которую мы будем сохранять данные
Мы не можем работать с данными прямо в источнике, потому что система-источник и так сильно нагружена. С ней работают пользователи: вносят данные, ищут нужную информацию, и им очень не понравится, если система будет «зависать», когда мы нагружаем ее своими запросами.

Поэтому данные из источника перегружают в хранилище данных, и уже там с ними работают аналитики. О том, что такое хранилища данных и как их строить мы поговорим подробнее в следующей статье.
После того как мы начали накапливать информацию (или, как в нашем примере, нашли источник данных — компанию, которая накапливает нужные данные), потребуется организовать процесс работы с данными.

Для этого нужно:
Шаг третий: Обновление
Периодичность
Мы должны понимать, с какой периодичностью хотим обновлять информацию.
Для некоторых задач (например, аналитика курсов валют) свежая информация нужна каждую секунду. Для нашей задачи нам подойдет ежемесячное обновление.
Тайминг
Мы должны договориться с владельцем источника о технологических окнах, в которые мы можем забирать данные из системы.
Обычно загрузку данных выполняют в ночное время, когда тяжелые процессы выгрузки больших массивов информации не мешают пользователям.
Контроль
Мы должны настроить процессы загрузки данных так, чтобы они отрабатывали автоматически и сообщали нам, если что-то пошло не так.
Пойти не так может все что угодно. Например, в процессе загрузки может пропасть интернет соединение и часть данных пропадет.
Мы нашли источник, где хранятся нужные данные, договорились с владельцем и прегрузили данные в хранилище, чтобы анализировать большие объемы информации в разных разрезах.

Например, считать — сколько новостроек в интересующих районах. Но если мы выгрузили данные сегодня, то завтра они уже устареют — в системе-источнике появится новые дома, о которых мы ничего не узнаем, если не настроим обновление.

Процесс обновления данных очень похож на процесс организации загрузки данных: подключаемся к источнику, забираем информацию и сохраняем к себе в хранилище.

Но есть несколько нюансов:
Данные
на сегодня
Данные
на завтра
Данные
на послезавтра
Кроме того, при хранении информации могут возникнуть и другие сложности. Когда мы описываем окружающую среду, мы используем привычные в нашем круге общения термины и определения. Можно придумать миллион синонимов к слову «дом» — здание, сооружение, таунхаус, жилой дом, многоэтажка, объект капительного строительства.

С таким многообразием сложно работать. Если в двух системах один и тот же объект назван по-разному, то при формировании сводного отчета потребуется ручная обработка данных, чтобы понять — это один и тот же дом.

Для решения этой проблемы используются MDM системы или справочники. MDM позволяют устранить проблемы разнородности ключевых понятий в разных информационных системах и сопоставить данные автоматически с помощью кодов.
Если нужен только актуальный срез данных на сейчас, то можно просто перезалить информацию в базу.

Но если мы хотим в дальнейшем анализировать длительные периоды, смотреть исторические тренды, например, чтобы понимать какие объекты больше подвержаны риску и могут быть заморожены, а какие надежные и в них стоит инвестировать?

В этом случае нужно будет несколько срезов данных — текущий и исторические срезы за разные периоды. Для того, чтобы учесть такие сложности, к проектированию хранилищ относятся системно. О подходах к построению хранилищ расскажем в следующей статье.
Ранее мы  уже поговорили о том, что данные перегружаются из системы-источника и сохраняются в хранилище. Почему же хранение данных выделено в отдельную задачу?

Хранение данных большая и сложная задача, если мы планируем с этими данными работать. Давайте разберемся почему это так.

Допустим мы загрузили и сохранили первичный срез данных. Через месяц загрузили обновления данных. В этом обновлении могут появиться новые дома, их мы можем просто добавить в нашу базу. По части объектов могли произойти изменения, допустим изменилось количество этажей, которые планируется построить. По каким-то объектам строительство могло быть заморожено и новостройка исчезла из планов.
Шаг четвертый: Хранение
Шаг пятый: Поиск
Для решения этой задачи компании внедряют инструменты DataGovernance. Это инструменты, которые позволяют описывать и искать нужные данные, отчеты и инфосервисы.
DataGovernance
Когда в компании только одна система с одним видом данных — случай скорее уникальный, чем редкий. Обычно каждая компания работает со множеством систем-источников, сотрудники создают сотни BI-отчетов и найти нужные данные — задача не тривиальная.
Множество систем-источников
Мы можем подключиться к хранилищу через SQL-клиент и написать нужный нам запрос.
SQL-клиент
Или мы можем подключиться к хранилищу с помощью BI-инструмента и построить красивые графики, вывести нужную информацию в таблички, на дэшборды или тепловые карты.
BI инструменты
В нашем примере, таблицы хранилища по новостройкам, должны быть описаны в понятных терминах. Например, строящиеся многоквартирные дома в городе Москва с 2020 года с информацией о количестве квартир и сроках сдачи в эксплуатацию.

Будет хорошо, если метаданные также содержат документы — технические требования, пользовательскую документацию, регламент обновления, ссылки на доступы и BI-отчеты, контактную информацию владельца отчета и разработчика.

То есть, метаданные позволяют пользователям найти нужные данные и быстро получить к ним доступ.
Если у нас в компании есть только одно хранилище, и в нем содержится только информация о новостройках, то процесс поиска будет быстрым.
Одна система-источник
Мы работаем с данными для того, чтобы найти ответы на вопросы.

В нашем примере нас может интересовать, в каком районе города больше всего новостроек? Мы ответим на этот вопрос, если узнаем, где выгоднее строить сети интернета. Чтобы это узнать, мы можем обратиться к хранилищу и написать SQL-запрос, или открыть BI-дэшборд с нужной информацию в наглядном формате.

Чтобы мы ни выбрали, мы должны знать — куда идти, и что смотреть. Поэтому мы должны научиться искать данные.
Что значит качественные и не качественные данные?
Качество данных — условная категория.

Не бывает идеальных данных, которые не содержат никаких ошибок и неточностей. Даже в тех данных, которые приходят с датчиков, могут содержать ошибки. А данные, которые вносят в системы люди, содержат ошибки гарантировано.

Критерии качества данных определяются задачей.

Например, на какую дату информация должна быть актуальна? На сколько полной должна быть информация? Кто и как верифицирует полноту и качество данных?

Если мы готовим ужин, то подойдут кухонные весы с погрешностью измерений в 10 грамм. Но если, работаем над сложным химическим процессом, то погрешность в 10 грамм не устроит — нужны более точные данные. То есть, для одной задачи погрешность в 10 грамм — качественные данные, а для другой некачественные.

Также и с бизнес-задачами. Например, геокодированная адресная база с ошибками распознавания координат в 20% может быть качественной для задачи анализа присутствия компании в регионе и планирования развития бизнеса. Но такая погрешность не подойдет для решения задачи оптимизации доставки товаров по городу.
DataScience, Big Data и управление данными это одно и тоже?
Это связанные понятия, но не одно и тоже.

Управление данными — комплексная стратегия по работе с данными на уровне компании. Она может включать в себя и технологии BigData, и технологии DataScience, если это требуется для решения бизнес-задач компании. Но цели управления данными могут быть гораздо проще — внедрить хранилище, BI-инструмент и каталоги данных и отчетности.

BigData — технологии для работы с большими данными. Нет однозначного определения, сколько данных считать большими данными. Но, например, данные о интернет-трафике, логи цифрового телевидения и другие потоковые данные, можно считать большими, потому что их крайне сложно, не эффективно хранить и обрабатывать в классических БД. Для этого используют специальные инструменты и технологии, которые называют общим термином — BigData.

DataScience — технологии работы с данными, которые позволяют анализировать большие объемы данных и находить закономерности (их часто называют «инсайты»). Такие закономерности сложно выявить классическими методами — на графиках и в таблицах. DataScience модели анализируют большое количество параметров и находят зависимости. Например, зависимость покупок от погодных условий, курсов валют и политической ситуации. Если компания управляет данными, она не обязательно использует DataSceince. И если компания внедряет технологии DataScience, она не обязательно хорошо умеет управлять данными.
ДатаСаентисты самые главные в управлении данными?
ДатаСаентисты — одна из самых популярных профессий в управлении данными, но они не самые главные :)

За управление данными в компаниях отвечает CDO — Chief Data Officer. Это человек, которые отвечает за разработку и внедрение стратегии управления данными в компании.
С чего обычно начинается управление данными в компаниях?
Часто управление данными начинается с вопросов о бизнесе компании. Например, какие товары пользуются самым большим спросом? Какие услуги приносят больше прибыли? С какими проблемами чаще приходят наши клиенты?

Ответы на эти вопросы начинают искать в операционных системах, например, в CRM. Но когда CRM начинает анализировать все заказы — делать сложные вычисления с большими объемами данных, то система может зависнуть. Продавцы и клиенты в это время не могут завести в систему новые заказы, оформить покупки. И чем больше таких сложных запросов к операционной системе — тем больше сложностей у рядовых пользователей со стандартными операциями.

В этот момент в компании и возникает идея — создать хранилище данных. Это и есть первый шаг к профессиональному управлению данными.
Для того, чтобы любой человек мог понять смысл и значение этих данных, нужны метаданные.

Метаданные для этой таблицы могут выглядеть следующим образом:
Описание таблицы — коммунальные расходы.
Period — месяц платежа.
Type — назначение платежа (001 — газ, 002- вода, 003 — свет)
Costs — расходы, рубли

Так метаданные помогают лучше понять сами данные. В реальных базах данных таблицы более сложные, а метаданные и описания более подробные.
Метаданные — данные о данных.

Если приводить бытовые примеры, то метаданными о книге можно назвать аннотацию и содержание.

То есть метаданные помогают понять — что содержат в себе данные.

Обычно термин метаданные используют применительно к базам данных.

В базах данных хранятся таблицы с большим количеством столбцов. Таблицы и столбцы называют латинскими буквами и используют сокращения, а значения в ячейках часто закодированы. Кодировка используется для уменьшения объема, который занимает таблица на жестком диске.

Таблица в базе может выглядеть следующим образом:
Что такое метаданные?
Рубрика: 5 вопросов от джуна
Управление в ДатаОфисе
  • Видимые проблемы в офисах CDO
  • Выстраивание подхода по взаимодействию с подразделениями
  • Выстраивание эффективной работы с данными, которая помогает правильно разграничить ответственность между CDO и другими подразделениями.
Решения и процессы для управления корпоративными данными
  • Что такое управления корпоративными данными (Data Governance), почему это важно.
  • Управление метаданными: как создать бизнес глоссарий и каталог данных — корпоративный “Google” и “Wikipedia” по данным организации.
Как построить DataOffice с нуля
  • Где находится нулевая отметка для уровня развития данных в современной крупной компании?
  • Люди, процессы и технологии – что является первоочередным при создании дата-офиса
  • Школа аналитики и коммуникационная платформа как инструменты повышения уровня зрелости работы с данными
Рекомендуем следующие видео по теме:
Подборка ссылок для самых любознательных
This site was made on Tilda — a website builder that helps to create a website without any code
Create a website