Исходный размер 3289x4268

Сказки Нарисованного Мира

Концепция

Моя давняя любовь к творчеству младшей сестры, к её уникальному, искреннему, чуть наивному, но невероятно выразительному стилю детских рисунков, вдохновила меня на следующий проект. Я захотела обучить генеративную нейросеть Stable Diffusion создавать персонажей именно в этом неповторимом стиле.
Мне всегда было интересно, как бы выглядели иллюстрации к популярным детским сказкам, если бы их автором была именно она, с её особой оптикой и нетронутым взрослым миром видением. Этот проект призван ответить на вопрос: какими бы вышли эти иллюстрации, наполненные её искренним почерком, и как нейросеть сможет перенести эту детскую непосредственность в новые, волшебные образы для знакомых историй. Это будет попытка увидеть мир сказок через призму чистого, неподдельного искусства.

Список использованных в проекте инструментов:

Stable Diffusion — обучение генеративной нейросети под свой стиль; Google Colab — выполнение кода и генераций; Hugging Face — получение токена для обучения нейросети, загрузка полученной модели на сайт; Adobe Photoshop — для обработки фото (улучшение, кадрирование)

Примеры рисунков

0

Описание процесса обучения

Начнем с настройки технической среды: проверяем доступность GPU, инсталлируем необходимые библиотеки, обновляем фреймворк diffusers до последней версии и загружаем обучающий скрипт для DreamBooth под SDXL. Данный этап формирует инфраструктурный фундамент для реализации проекта.

0
Исходный размер 864x401

Переходим к подготовке обучающего набора данных, состоящего из 23 рисунков. Для ускорения обработки все изображения заранее приведены к компактному формату 512×512 пикселей. В процессе создаётся целевая директория «cher», предназначенная для загрузки снимков, на основе которых нейросеть будет обучаться распознаванию заданного образа.

0

Проверим установки, выведя 5 случайных изображений.

Исходный размер 1186x416

Приступаем к созданию текстовых описаний для каждой фотографии в датасете с использованием модели BLIP. К полученным описаниям добавляем единый префикс — «a photo of TOK girl», — который впоследствии будет служить ключевым запросом для генерации новых изображений. После завершения процесса генерации подписей освобождаем оперативную память, чтобы снизить нагрузку на вычислительную среду и обеспечить стабильность дальнейших операций.

Исходный размер 1185x349
0

Переходим к установке требуемых зависимостей и авторизации в системе Hugging Face. Этот шаг служит страховкой на случай сбоя выполнения кода в Google Colab — после обучения модель можно будет загрузить на платформу и продолжить генерацию изображений непосредственно через веб-интерфейс.

0

Приступаем к процессу обучения модели. Для оптимизации вычислений и снижения нагрузки на GPU устанавливаем количество шагов обучения: 500 и 250. В параметры также обязательно включаем тот же префикс для текстовых запросов, который использовался при подготовке обучающего датасета. После завершения обучения сохраняем итоговую модель на платформе Hugging Face и получаем прямую ссылку на её страницу.

Исходный размер 1718x35
Исходный размер 1717x434
Исходный размер 1719x37
Исходный размер 1716x186
Исходный размер 1721x560
Исходный размер 1714x91

Генерация иллюстраций

Все иллюстрации сгенерированы в Goggle Colab

Исходный размер 856x264
Сказки Нарисованного Мира
Проект создан 11.02.2026
Мы используем файлы cookies для улучшения работы сайта НИУ ВШЭ и большего удобства его использования. Более подробную...
Показать больше