Выбор базы данных
Для анализа был выбран датасет, посвященный сериалу Friends («Друзья»). Датасет был найден на платформе Kaggle и представлен в формате CSV (https://www.kaggle.com/datasets/rezaghari/friends-series-dataset). Датасет представляет собой таблицу с информацией об эпизодах сериала, собранной на основе пользовательских оценок IMDb.
Датасет состоит из 235 строк, каждая из которых соответствует одному эпизоду сериала, и нескольких столбцов, описывающих характеристики эпизодов. Среди них — номер сезона, название эпизода, год выхода, рейтинг IMDb и количество пользовательских голосов.
Я выбрала данный датасет, так как являюсь фанатом сериала, а также он является одним из самых популярных телевизионных шоу в истории, а данные о зрительских оценках позволяют проанализировать, как менялось восприятие сериала аудиторией на протяжении времени.
Визуализация
Для визуализации данных о сериале «Друзья» были выбраны следующие типы графиков:
Линейный график для отображения изменения среднего рейтинга эпизодов по сезонам. Данный тип визуализации позволяет наглядно проследить динамику восприятия сериала зрителями на протяжении всего периода его выхода.
Столбчатая диаграмма для представления десяти эпизодов с наивысшим рейтингом IMDb. Этот график помогает выделить наиболее высоко оцененные серии и перейти от общего анализа к рассмотрению конкретных эпизодов.
Гистограмма для анализа распределения рейтингов всех эпизодов сериала. Использование гистограммы позволяет оценить стабильность качества сериала и определить, в каком диапазоне сосредоточено большинство оценок.
Точечная диаграмма для демонстрации зависимости рейтинга эпизодов от года их выхода. Такой формат визуализации помогает выявить возможные временные тренды и изменения зрительского восприятия сериала с течением времени.
Стилистика
Для визуализации выбрана светлая тема, белый фон и данные оттенки:
HEX 048104 HEX 8B4513 HEX FC4949 HEX 1515FD
такое сочетание придает контрастность визуализации, а также указывает на разнохарактерность главных персонажей сериала.
Подготовка
Сначала я загрузила файл с данными о сериале «Друзья» в формате csv, а затем импортировала библиотеку pandas.
Затем я задала единый стиль графикам.
График № 1
- df.groupby("Season") — группируем все эпизоды по сезонам
- ["Stars"].mean() — для каждого сезона вычисляем средний рейтинг
- season_rating.index — номера сезонов (ось X) season_rating.values — средние рейтинги (ось Y)
- plt.plot() — строим линейный график
- marker="o" — выделяет каждую точку сезона
- plt.title, plt.xlabel, plt.ylabel — добавляем подписи
График № 2
- sort_values("Stars", ascending=False) — сортируем эпизоды по рейтингу от большего к меньшему
- head(10) — выбираем 10 эпизодов с наивысшими оценками
- plt.barh() — строим горизонтальную столбчатую диаграмму
- invert_yaxis() — разворачивает порядок, чтобы лучший эпизод был сверху
График № 3
- df["Stars"] — используем рейтинги всех эпизодов
- bins=15 — делим диапазон рейтингов на 15 интервалов
- plt.hist() — строим гистограмму распределения
- alpha=0.7 — делает точки полупрозрачными, чтобы они не перекрывали друг друга
График № 4
- df["Year_of_prod"] — годы выхода эпизодов (ось X)
- df["Stars"] — рейтинги эпизодов (ось Y)
- plt.scatter() — строим точечный график
- alpha=0.6 — делает точки полупрозрачными, чтобы они не перекрывали друг друга
Выводы




