Концепция
Проект направлен на обучение нейросети, обладающей способностью понимать и воспроизводить визуальные стили, характерные для признанных мастеров иллюстрации и живописи.
Нейросеть обучается на репрезентативной базе данных картин знаменитого художника, изучая композицию, цветовую палитру, технику мазка, особенности освещения и другие ключевые элементы, формирующие его уникальный художественный почерк.
Художником, чьи работы стали основой данного проекта, является Густав Климт — великий австрийский живописец, основоположник модерна в австрийской живописи и автор культового «Поцелуя». Искусство Климта — это гипнотический сплав чувственности и монументальной декоративности. Его героини погружены в эротический, почти мистический транс, а их тела окутаны сложнейшими мозаичными узорами, сияющими сусальным золотом.
Исходные изображения для обучения
Ниже представлены некоторые работы Густава Климта, вошедшие в базу данных для обучения искусственного интеллекта.
Процесс обучения нейросети для генерации изображений
Для обучения нейросети под стиль Густава Климта использовалась модель Stable Diffusion XL (SDXL) в сочетании с методами DreamBooth и LoRA.
В рамках проекта обучение проводилось в облачной среде Google Colab. Ниже представлены ключевые фрагменты кода, использованные для настройки и запуска процесса, а также их краткое описание.
Генерация и обучение нейросетей требуют мощных видеокарт. Первым делом мы проверяем, какой именно GPU выделил нам Google Colab — для этого используем команду nvidia-smi. Она показывает модель видеокарты, объем видеопамяти и текущую загрузку.
Проверка видеокарты
В этом блоке происходит установка всех необходимых библиотек для работы со Stable Diffusion и обучения LoRA. Также скачивается официальный скрипт DreamBooth от Hugging Face и инициализируется ускоритель accelerate для оптимального использования видеокарты.
Настройка окружения
В этом блоке создается папка для изображений, куда загружаются файлы через интерфейс Colab. Затем с помощью модели BLIP автоматически генерируются текстовые описания для каждого изображения, которые сохраняются в файл metadata.jsonl вместе с уникальным токеном-идентификатором стиля.
Подготовка датасета
В этом блоке выполняется вход в аккаунт Hugging Face с использованием токена доступа, который пользователь предварительно создает в настройках своего профиля.
Вход в Hugging Face
После успешной аутентификации задаются основные параметры обучения: название папки для сохранения модели (output_dir) и триггерная фраза (instance_prompt), которая будет использоваться для активации обученного стиля при генерации.
На этом этапе запускается процесс обучения с использованием метода DreamBooth и технологии LoRA на базе модели Stable Diffusion XL, что позволяет эффективно дообучить нейросеть даже на ограниченных вычислительных ресурсах. Обучение длится около 40-50 минут на видеокарте T4, в ходе которого создается 500 шагов и сохраняются промежуточные чекпоинты в формате safetensors.
Настройка параметров




