Описание проекта
Дорамы — неотъемлемая часть моей культуры, корейской, поэтому я решила провести анализ именно в этой сфере. Они отражают не только современные тенденции в кинематографе, но и передают культурные ценности, традиции и особенности общества.
К тому же, я огромный любитель корейских дорам, и мне было любопытно исследовать их глубже.

Данные я искала на сайте Kaggle, вбила в поисковик ключевое слово "kdrama" и выбрала "Top 250 Korean Dramas (KDrama) Dataset". Датасет содержит в себе данные из 250 корейских драм, занимающих лидирующие позиции на сайте MyDramaList.
Для визуализации данных я выбрала следующие графики: Гистограмма (определяет количество по определенному показателю); Круговая диаграмма (позволяет сравнить количественные данные в процентном соотношении); Облако слов (визуально показывает частоту употребления слов, в моем случае жанров); Матрица (демонстрирует корреляцию данных); Линейная диаграмма (позволяет проследить тенденцию и динамику данных).
Визуальное решение

Мудборд
Дорамы у меня ассоциируются с домашним уютом, цветущей сакурой и любовью, поэтому хотелось передать такую атмосферу для визуального оформления своего проекта.
Для этого я обратилась к сайту Pinterest и выбрала несколько картинок. После чего в Photoshop вручную подобрала цвета, глядя на референсы, и получились следующие оттенки:
На основе найденных референсов и подобранных цветов я построила графики, чтобы придать проекту визуальную целостность и гармоничность.
Дополнительное редактирование: в Photoshop были составлены коллажи и проведена цветокоррекция изображений.
Обработка данных
Для начала я импортировала необходимые мне библиотеки: kagglehub (библиотека для работы с наборами данных и моделями из Kaggle для загрузки данных), os (для работы с файловой системой и переменными окружения), pandas (для обработки и анализа структурированных табличных данных). Впоследствии я загружала дополнительные библиотеки для анализа данных и формирования графиков. Например, Matplotlib (для визуализации графиков).
После чего считала скачанный csv-файл датасета.
Также в ходе анализа я искала методы в Stackoverflow.
Импорт библиотек и выгрузка данных
Далее почистила дату от нулевых значений и удалила колонки, которые посчитала неактуальными и нерелевантными для анализа.
Чистка данных
График 1
С помощью гистограммы я выявила зависимость количества дорам из топа в определенный год. Оказалось, что более современные дорамы наиболее интересны зрителям.
Так, в 2021 году было снято аж 39 дорам, вошедших в топ 250 самых лучших дорам за 2003-20022 год.
К списку, а также моим персональным рекомендациям относятся "Happiness" и "Mouse".
Гистограмма, показывающая количество дорам из топа, снятых в определенный год
Код к гистограмме о количестве снятых дорам в определенный год
График 2
Круговая диаграмма наглядно показывает распределение дорам из топа по возрастному ограничению.
Большая часть дорам имеет возрастную отметку 15+, то есть сериалы для подростков пользуются наибольшим спросом.
Дополнительное редактирование: в Photoshop фон был отформатирован до прямоугольной формы.
Код к круговой диаграмме о распределении возрастного ограничения
График 3
Благодаря матрице корреляций мне удалось выявить степень влияния рейтинга, количества эпизодов и года выпуска друг от друга.
Отрицательные значения показывает обратную взаимосвязь количества эпизодов с годом выпуска, то есть со временем зрители перестали интересоваться многосерийными дорамами, предпочитая более короткий формат историй.
Остальные значения корреляций незначительны.
Код матрицы
График 4
Большинство дорам совмещают в себе несколько жанров, поэтому я разделила названия жанров и узнала количество уникальных значений каждого. Впоследствии они понадобились мне для построения облака слов и круговой диаграммы.
Расчет уникальных значений жанров










