О проекте
Пирожные перестали быть просто десертом. Сегодня это самостоятельное искусство, культурный феномен и социальный маркер. Их изысканная подача стала символом утонченного вкуса, праздника в повседневности и визуальной эстетики соцсетей.
На этом фоне возникает важный исследовательский вопрос: что определяет успех современного пирожного?
Проект «Анализ пирожных: Мировые тенденции кондитерского искусства» исследует пирожное как культурный код. Через анализ популярности техник, географии происхождения и экспертных оценок я раскрываю формулу современного кондитерского успеха и показываю, как в маленьком десерте отражаются большие культурные тренды нашего времени.
Цель и задачи проекта
Цель проекта - выявить основные вкусовые тенденции в пирожных на основе анализа открытых данных.
Для достижения цели были поставлены следующие задачи:
- изучить структуру выбранного датасета
- выделить пирожные из общего массива рецептов
- проанализировать популярность вкусов
- исследовать связь вкусов с рейтингами и успешностью
- визуализировать результаты в изучающем формате
Источник данных:
В качестве источника данных был выбран датасет Dessert Flavor Combinations, размещённый на платформе Kaggle. Данный датасет является открытым и предназначен для анализа вкусовых сочетаний в десертах.
Использование данных с Kaggle позволяет обеспечить прозрачность исследования и возможность воспроизведения результатов.
Датасет представлен в формате CSV и содержит информацию о рецептах и их вкусовых характеристиках.
Основные признаки:
- recipe_name — название рецепта
- flavors — перечень вкусов и вкусовых сочетаний
- rating — пользовательская оценка рецепта
- success — числовой показатель успешности рецепта
Такая структура данных позволяет проводить как количественный, так и качественный анализ.
Инструменты и среда работы
Анализ данных выполнялся в среде Google Colab с использованием языка программирования Python.
Выбор этих инструментов обусловлен их популярностью и удобством для анализа табличных данных.
Пошаговый план работы
На первом практическом этапе данные были загружены в среду Google Colab с использованием библиотеки Pandas. Данные представлены в формате CSV, что удобно для табличного анализа.
Для загрузки данных был использован стандартный метод read_csv(). После загрузки была выполнена первичная проверка, чтобы убедиться, что данные считались корректно.
import pandas as pd
df = pd.read_csv («recipes.csv») df.head ()
После загрузки данных был проведён первичный анализ структуры датасета. Целью этого этапа было понять, какие столбцы присутствуют в таблице и с какими типами данных предстоит работать.
Это необходимо для корректного выбора методов очистки и анализа данных на следующих этапах.
df.columns
На следующем этапе была изучена общая информация о датасете, включая количество строк, типы данных и наличие пропущенных значений.
Это позволяет оценить качество данных и определить необходимость их очистки.
df.info ()
Далее была выполнена проверка датасета на наличие пропущенных значений в каждом столбце.
Пропущенные значения могут искажать результаты анализа, поэтому их выявление является важным этапом работы с данными.
df.isna ().sum ()
На этапе очистки данных были удалены строки с пропущенными значениями в ключевых столбцах, а также устранены возможные дубликаты. Это позволило повысить надёжность дальнейшего анализа.
df = df.dropna () df = df.drop_duplicates ()
После очистки данных было подтверждено, что в датасете используются следующие ключевые признаки:
- название рецепта
- вкусовые характеристики
- пользовательский рейтинг
- показатель успешности
Далее анализ будет сосредоточен на этих признаках.
df.columns
Поскольку исходный датасет содержит различные виды десертов, следующим шагом стала фильтрация данных для выделения именно пирожных. Для этого использовался поиск по ключевым словам в названии рецепта.
keywords = «cake|pastry|macaron|tart|eclair|dessert|cupcake|pie»
df_pastry = df[ df[«recipe_name»].str.contains (keywords, case=False, na=False) ]
df_pastry.head ()
После фильтрации данных была выполнена проверка результата, чтобы убедиться, что выборка содержит только пирожные. Также была оценена размерность полученного поднабора данных.
df_pastry.head () df_pastry.shape
На данном этапе данные были подготовлены к анализу вкусовых характеристик. Текстовые данные в столбце flavors будут использоваться для частотного анализа и группировки вкусов.
Этот этап является переходом от подготовки данных к аналитической части проекта.
Визуализация данных
Перед построением графиков была выполнена настройка визуального стиля. Цель — создать единый, узнаваемый и тематически подходящий дизайн, связанный с кондитерской эстетикой.
Цвета и параметры оформления задаются программно, без постобработки в графических редакторах.




