Источник данных
Для анализа я использовала набор данных «Netflix Movies and TV Shows», который находится в открытом доступе на платформе Kaggle
Почему именно эти данные?
Анализ этого набора представляет особую ценность по нескольким причинам:
- Стратегия контента Netflix: Данные позволяют раскрыть, как Netflix балансирует между фильмами и сериалами, в каких странах производится больше всего контента, и как менялась его библиотека с течением времени. Это даёт понимание бизнес-модели и глобальной стратегии платформы.
- Тренды в индустрии развлечений: Анализ жанров, рейтингов и динамики выпуска контента по годам показывает, на что делает ставку крупнейший стриминговый сервис, и отражает общие зрительские предпочтения в мире.
- Доступность и наглядность: Датасет достаточно чистый и структурированный, что позволяет сосредоточиться на анализе, а не только на подготовке данных.
Визуализация данных
Палитра для граффиков
Исходный размер 736x736
Круговая диаграмма: Распределение контента
Исходный размер 592x474
Столбчатая диаграмма: Топ 10 стран по выпуску контента
Исходный размер 1174x827
Столбчатая диаграмма: Распределение рейтингов
Исходный размер 1280x628
Горизонтальная диаграмма: Количество сериалов по годам выпуска
Исходный размер 1208x649
Используемые статистические методы
Описательная статистика Цель: Подсчет частоты уникальных значений в категориальных переменных. Применение:
- Анализ распределения типов контента (Movie/TV Show).
- Определение топ-10 стран по производству контента.
- Анализ распределения рейтингов.
Визуализация распределений Круговая диаграмма:
- Визуализирует пропорции типов контента (фильмы vs. сериалы).
- Использует проценты для количественной интерпретации. Столбчатые диаграммы:
- Отображение абсолютных частот для:
- Топ-10 стран по выпуску контента с разделением по типам.
- Распределения рейтингов.
- Количества релизов по годам.
Сортировка данных
- df.sort_values('release_year'): Упорядочивание данных по году выпуска для корректного отображения трендов на графике.




