Исходный размер 1024x1536

Обучение LoRA-модели для генерации изображений в стиле советских диафильмов

Проект принимает участие в конкурсе

Обучение LoRA-модели для генерации изображений в стиле советских диафильмов

Описание датасета

Для обучения была использована серия изображений, вдохновлённых советскими диафильмами — особым видом изобразительного искусства, популярным в СССР с 1930-х по 1990-е годы. Диафильмы представляли собой плёнки с последовательностью кадров, которые проецировались на экран и сопровождались текстом, образуя самостоятельный жанр визуального повествования.Для диафильмов характерны узнаваемая рисованная манера, мягкая линия, ограниченная цветовая палитра и особая композиционная логика. Кадры выстраиваются вокруг персонажа, помещённого в пейзаж или интерьер, а фон и второй план часто выполнены более условно, чем главный объект. Важную роль играет плоскостность изображения: пространство строится через цветовые пятна и контур, а не через перспективу. Особую атмосферу создают приглушённые тёплые оттенки, характерная зернистость и ощущение ручной работы — следы акварели, гуаши или туши.

В работе применяется метод LoRA-дообучения на базе модели Stable Diffusion XL. Исходный набор данных включает 32 изображения (с сайтов «Национальная электронная библиотека» (НЭДБ) и «Диафильмы.рф»), отражающих характерные черты стиля: рисованную линию, сюжетность, ограниченную палитру, условный фон и литературную основу.

Описание обучения модели

Для обучения модели был подготовлен датасет из 32 изображений. Перед загрузкой все картинки были приведены к квадратному формату 1024×1024 и сохранены локально. В качестве стилевого токена использовался единый instance_prompt, описывающий жанр в целом: «a frame from a soviet diafilm, vintage hand-drawn illustration». Дополнительно задавался валидационный промпт для отслеживания прогресса обучения.Обучение проводилось методом DreamBooth LoRA на базе модели Stable Diffusion XL (stabilityai/stable-diffusion-xl-base-1.0) с использованием VAE-фикса для fp16 (madebyollin/sdxl-vae-fp16-fix). Процесс выполнялся в Google Colab на GPU Tesla T4. Для экономии видеопамяти применялись gradient checkpointing, 8-битный оптимизатор AdamW и аккумуляция градиентов с эффективным размером батча, равным 4. Итоговый LoRA-адаптер имел ранг 8, что обеспечивает компактный размер файла при сохранении выразительности стиля.

В процессе обучения модель усваивала связь между стилевым токеном и визуальными особенностями датасета: рисованной линией, сюжетной композицией, ограниченной тёплой палитрой, условным фоном и характерной повествовательной манерой. Всего было выполнено 1500 шагов оптимизации с косинусным расписанием learning rate.После завершения обучения полученная LoRA-модель использовалась для генерации новой серии изображений по текстовым промптам, в которых обязательно сохранялась стилевая фраза-токен.

Серия изображений

Исходный размер 441x441
Исходный размер 466x466
Исходный размер 437x437
Исходный размер 417x417
Исходный размер 374x374
Исходный размер 454x454
Исходный размер 479x479
Исходный размер 427x427
Исходный размер 448x448

Во всех сгенерированных работах прослеживаются ключевые признаки стиля диафильмов: рисованная манера, приглушённая тёплая палитра, условный фон и ощущение ручной работы. Изображения объединены общей эстетикой, но при этом различаются по сюжету — от зимних пейзажей и лесных сцен до бытовых зарисовок.Модели удалось хорошо передать декоративность, линейный ритм и связь персонажа с окружением. Наиболее устойчивыми элементами стали характерная штриховая линия, ограниченная цветовая гамма и общая «плёночная» атмосфера кадра.

Обучение LoRA-модели для генерации изображений в стиле советских диафильмов
Проект создан 26.09.2026
Мы используем файлы cookies для улучшения работы сайта НИУ ВШЭ и большего удобства его использования. Более подробную...
Показать больше