Концепция
Для своего проекта я решила изучить тенденции и закономерности в мире кино, из-за чего на просторах сайта Kaggle. com мною был выбран датасет о 1000 фильмах с высоким рейтингом IMDb. Internet Movie Database является крупнейшей онлайн-платформой, где собираются данные о фильмах, сериалах, актёрах, режиссёрах, рейтингах и отзывах зрителей со всего мира. На основе этих данных формируются рейтинги фильмов, которые часто используют для оценки популярности и качества картин.
Целью моего проекта является выявление факторов, влияющих на успешность фильма, а также анализ распределения рейтингов и динамики их выпуска.
Для визуализации данных в своём проекте я выбрала следующие типы диаграмм:
- Гистограмма — для отображения распределения рейтингов IMDb.
- Линейный график — для отображения динамики выхода фильмов по годам.
- Круговая диаграмма — для отображения топ-6 жанров по количеству фильмов.
- Столбчатая диаграмма — для отображения среднего рейтинга по жанрам.
Данные типы диаграмм выбраны для обеспечения наглядности и быстрого восприятия информации.
Подготовка к проекту
Цвета: #FOEEE9, #DDD576, #BB3CA9, #35BCD2
Для визуализации данных топ-100 фильмов IMDb мною была выбрана гармоничная палитра, сочетание цветов которой делает графики информативными, визуально привлекательными и лёгкими для восприятия.
Шрифт: Sans-Serif
Для графиков использован шрифт без засечек (Sans-serif), который обеспечивает чистую и современную визуализацию данных. Поскольку такой шрифт лишён декоративных элементов и является широко распространённым, он повышает читаемость подписей, заголовков и числовых значений, особенно при большом объёме информации на графике.
Обработка данных
Сначала я подключила библиотеку pandas и загрузила CSV-файл с информацией о 1000 лучших фильмах IMDb, который загрузила с сайта Kaggle. com, в DataFrame. Эти действия позволили работать с данными в удобной табличной форме для последующего анализа.
После этого я проверила первые строки таблицы, названия столбцов и типы данных, чтобы понять структуру датасета и выявить возможные пропуски или некорректные значения.
Далее, были удалены лишние пробелы в названиях столбцов, чтобы избежать возможных ошибок при обращении к данным.
Я очистила и преобразовала ключевые числовые столбцы: оставила только числовые значения в столбце Released_Year и преобразовала их в целочисленный формат, привела столбцы IMDB_Rating и No_of_Votes к типам float и int соответственно, а также очистила столбец Gross от запятых, преобразовала его в float и заполнила пропуски средним значением. Эта работа позволила подготовить данные для анализа по годам выпуска, рейтингам и доходам фильмов.
Проверив первые строки, типы столбцов и основные статистические показатели числовых данных после очистки, я убедилась, что данные готовы для построения графиков.
Визуализация графиков
Мудборд
Для визуализации графиков я выбрала яркие, но при этом мягкие цвета, которые ассоциируются с конфетами. Мне кажется, что конфеты — отличная ассоциация для кино, поскольку это лёгкий и ненавязчивый снек. Именно это умозаключение и определило мой выбор цветовой палитры.
Так же, как и в фильмах, сюжет должен подаваться лаконично и понятно. Поэтому я постаралась сделать шрифт без засечек и достаточно жирным, а графики — крупными и сразу привлекающими внимание.
Поэтому в коде, отвечающем за визуальный стиль графиков, я прописала и настроила параметры цвета текста, сетки и шрифтов в соответствии со своей задумкой. Это сделало графики читаемыми и стильными, а также позволило убрать лишние рамки и стандартные стили Seaborn.
Распределения рейтингов IMDb
На данном этапе я выбрала из таблицы только столбец с рейтингами IMDb и создала для удобства отдельную таблицу ratings_table.
Далее я построила гистограмму с 18 интервалами (bins=18) для визуализации распределения рейтингов. Столбцам гистограммы был задан соответствующий цвет и уровень прозрачности. Заголовок и подписи осей были оформлены в соответствии с моей цветовой палитрой.
Распределения рейтингов IMDb. Гистограмма




