Далее мы определяем ошибки — где модель «угадала» целевой показатель, а где ошиблась. Информация об ошибках на тестовом наборе данных также передается на вход DataScience модели — это позволяет улучшить результат обучения. Главное вовремя остановить обучение модели, когда ошибка в тестовом наборе перестанет уменьшаться или начнет увеличиваться. Это предотвратит переобучение модели и повысит качество предсказаний на целевом датасете.
И получаем результаты работы модели:
Далее мы прогоняем обученную модель на тестовом наборе данных.
Мы выбрали для обучения модель «Дерево решений» и на нашей обучающей выборке модель могла бы создать такой алгоритм для определения вероятности покупки.
Конечно, это упрощенный пример — в реальных обучающих наборах таких параметров тысячи, так как мы не знаем, что именно влияет на решение людей о покупке, и хотим выяснить это с помощью DataScience модели.
Обучение модели
Для обучения модели используют 2 набора данных — обучающий и тестовый.
В обучающем наборе у модели известен целевой параметр, а тестовый набор используется для проверки качества обучения модели — точности предсказания результата.
Рассмотрим процесс обучения на простом примере.
Наша задача — сформировать список клиентов, которые с высокой вероятностью подключат подписку «Матч Премьер». У нас есть набор параметров по клиентам: пол, возраст, среднее потребление интернет трафика, среднее время просмотра спортивных каналов, наличие услуги у соседей.
Линейная регрессия: эта модель используется для непрерывных зависимых переменных и лучше всего подходит для задач, связанных с предсказанием будущих значений на основе прошлых значений.
Этот тип моделей хорошо подойдет, например, для задач прогнозирования продаж, сегментации клиентов, контроля качества продукции.
Например, производственная компания может использовать линейную регрессию для прогнозирования дефектов продукта на основе производственных параметров и измерений контроля качества.
Деревья решений: эта модель используется как для непрерывных, так и для категориальных зависимых переменных и лучше всего подходит для задач, связанных с прогнозированием будущих значений на основе нескольких условий.
Этот тип моделей хорошо подойдет, например, для задач оценки кредитного риска, оптимизации маркетинговых кампаний, управления запасами.
Например, деревья решений можно использовать для оптимизации управления запасами, прогнозируя будущий спрос и определяя оптимальные уровни запасов.
Нейронные сети: эта модель используется как для непрерывных, так и для категориальных зависимых переменных и лучше всего подходит для задач, связанных со сложными нелинейными отношениями между входными и зависимыми переменными.
Этот тип моделей хорошо подойдет, например, для задач классификации и распознавания изображений, рекомендательных систем на сайтах, прогнозирования временных рядов.
Например, прогнозирование цен на акции, потребления энергии или погодных условий — задачи по прогнозированию временных рядов, с которыми хорошо справятся нейронные сети.
Выбор data science модели
Можно сказать, что data science модель — это алгоритм, или математическое/ статистическое представление процесса. Задача data science модели — найти закономерности в данных, и использовать эти сведения для принятия решений.
Data science модели обучаются на наборах данных с известным результатом целевого параметра, и их задача — точно спрогнозировать этот параметр для новой выборки.
Например, у нас есть набор данных по клиентам за предыдущий период. В этом наборе есть некоторые характеристики клиентов, которые могут влиять на решение о покупке, и целевой параметр — купил клиент нашу услугу, или нет. Задача модели — обучиться так, чтобы, получив на вход базу данных клиентов, которые услугу еще не купили, предсказать вероятность — кто более склонен к покупке.
DataScience моделей огромное множество, например, линейная регрессия, деревья решений, случайные леса и другие. Каждый тип модели подходит для решения одних задач лучше, чем другие. В нашем марафоне мы не сможем рассказать про все модели и критерии их выбора — этому датасаентисты учатся годами — но мы расскажем про 3 самых популярных, чтобы стало понятнее, что это за зверь.
Три предыдущих шага — определение проблемы, подготовка и анализ данных — выполняются при разработке любого аналитического инструмента.
А на этом шаге начинается та самая «магия» DataScience.
На этом шаге датасаентисты подбирают нужный тип модели для данных и обучают их на подготовленном датасете.
4. Моделирование и анализ