Что значит качественные и не качественные данные?
Качество данных — условная категория.
Не бывает идеальных данных, которые не содержат никаких ошибок и неточностей. Даже в тех данных, которые приходят с датчиков, могут содержать ошибки. А данные, которые вносят в системы люди, содержат ошибки гарантировано.
Критерии качества данных определяются задачей.
Например, на какую дату информация должна быть актуальна? На сколько полной должна быть информация? Кто и как верифицирует полноту и качество данных?
Если мы готовим ужин, то подойдут кухонные весы с погрешностью измерений в 10 грамм. Но если, работаем над сложным химическим процессом, то погрешность в 10 грамм не устроит — нужны более точные данные. То есть, для одной задачи погрешность в 10 грамм — качественные данные, а для другой некачественные.
Также и с бизнес-задачами. Например, геокодированная адресная база с ошибками распознавания координат в 20% может быть качественной для задачи анализа присутствия компании в регионе и планирования развития бизнеса. Но такая погрешность не подойдет для решения задачи оптимизации доставки товаров по городу.
DataScience, Big Data и управление данными это одно и тоже?
Это связанные понятия, но не одно и тоже.
Управление данными — комплексная стратегия по работе с данными на уровне компании. Она может включать в себя и технологии BigData, и технологии DataScience, если это требуется для решения бизнес-задач компании. Но цели управления данными могут быть гораздо проще — внедрить хранилище, BI-инструмент и каталоги данных и отчетности.
BigData — технологии для работы с большими данными. Нет однозначного определения, сколько данных считать большими данными. Но, например, данные о интернет-трафике, логи цифрового телевидения и другие потоковые данные, можно считать большими, потому что их крайне сложно, не эффективно хранить и обрабатывать в классических БД. Для этого используют специальные инструменты и технологии, которые называют общим термином — BigData.
DataScience — технологии работы с данными, которые позволяют анализировать большие объемы данных и находить закономерности (их часто называют «инсайты»). Такие закономерности сложно выявить классическими методами — на графиках и в таблицах. DataScience модели анализируют большое количество параметров и находят зависимости. Например, зависимость покупок от погодных условий, курсов валют и политической ситуации. Если компания управляет данными, она не обязательно использует DataSceince. И если компания внедряет технологии DataScience, она не обязательно хорошо умеет управлять данными.
ДатаСаентисты самые главные в управлении данными?
ДатаСаентисты — одна из самых популярных профессий в управлении данными, но они не самые главные :)
За управление данными в компаниях отвечает CDO — Chief Data Officer. Это человек, которые отвечает за разработку и внедрение стратегии управления данными в компании.
С чего обычно начинается управление данными в компаниях?
Часто управление данными начинается с вопросов о бизнесе компании. Например, какие товары пользуются самым большим спросом? Какие услуги приносят больше прибыли? С какими проблемами чаще приходят наши клиенты?
Ответы на эти вопросы начинают искать в операционных системах, например, в CRM. Но когда CRM начинает анализировать все заказы — делать сложные вычисления с большими объемами данных, то система может зависнуть. Продавцы и клиенты в это время не могут завести в систему новые заказы, оформить покупки. И чем больше таких сложных запросов к операционной системе — тем больше сложностей у рядовых пользователей со стандартными операциями.
В этот момент в компании и возникает идея — создать хранилище данных. Это и есть первый шаг к профессиональному управлению данными.
Для того, чтобы любой человек мог понять смысл и значение этих данных, нужны метаданные.
Метаданные для этой таблицы могут выглядеть следующим образом:
Описание таблицы — коммунальные расходы.
Period — месяц платежа.
Type — назначение платежа (001 — газ, 002- вода, 003 — свет)
Costs — расходы, рубли
Так метаданные помогают лучше понять сами данные. В реальных базах данных таблицы более сложные, а метаданные и описания более подробные.
Метаданные — данные о данных.
Если приводить бытовые примеры, то метаданными о книге можно назвать аннотацию и содержание.
То есть метаданные помогают понять — что содержат в себе данные.
Обычно термин метаданные используют применительно к базам данных.
В базах данных хранятся таблицы с большим количеством столбцов. Таблицы и столбцы называют латинскими буквами и используют сокращения, а значения в ячейках часто закодированы. Кодировка используется для уменьшения объема, который занимает таблица на жестком диске.
Таблица в базе может выглядеть следующим образом:
Рубрика: 5 вопросов от джуна