Исходный размер 1012x1432

Кем угодно

Концепция

Каждый человек в детстве думал, кем он станет, фантазировал на эту тему, примерял на себя разные образы. В проекте я решила воплотить эти детские представления с помощью нейросети: взять свои детские фотографии и показать, какими мы могли бы быть в своих мечтах.

Мне интересно, как технология может соединить детское воображение и взрослое восприятие — вернуть то чувство игры, где можно быть любым.

Подготовка окружения

Для начала проверяем подключение к GPU, устанавливаем нужные библиотеки, обновляем diffusers до актуальной версии и скачиваем скрипт обучения DreamBooth SDXL. Это шаг, который создаёт техническую основу для всего проекта.

0

Подготовка датасета

Теперь подготавливаем датасет из 21 детской фотографии: размер фотографий небольшой 512x512 для оптимизации процесса. На этом этапе задаётся папка "cher", куда будут загружаться фотографии, на которых нейросеть обучится распознавать образ.

Также выводим 5 случайных снимков, чтобы убедиться, что всё установилось как нужно.

0
big
Исходный размер 1920x384

Подготовка окружения к обучению

Далее с помощью BLIP к каждой фотографии из датасета генерируем подписи, к которым добавляем префикс (a photo of TOK girl), который в дальнейшем используем для генерации изображений. Обязательно освобождаем немного памяти, чтобы не нагружать среду.

0

Теперь устанавливаем необходимые библиотеки и авторизуемся на Hugging Face. Это обезопасит в случае слёта кода в Google Colab, так как можно будет продолжить генерировать изображения на сайте (туда перенесётся обученная модель).

Исходный размер 1920x385

Обучение модели

Теперь переходим к обучению самой модели. В параметрах задаем 500 и 250 шагов, для ускорения процесса обучения и меньшей задействованности GPU. Также обязательно передаем префикс к промтам, который присутствовал в обучающей выборке. Сохраняем модель на Hugging Face и получаем ссылку на страницу.

Исходный размер 1920x607
Исходный размер 1920x236
Исходный размер 1920x662
Исходный размер 1920x282

Генерация изображений

Изначально я начала генерировать изображения в Goggle Colab c помощью простых промптов. Результат выходил плохим: кривая анатомия, пугающие изображения. Было принято решение увеличить количество шагов до 1000, однако системе не хватило мощности GPU и генерации в Colab перестали работать. Хорошо, что мы перенесли обученную модель на Hugging Face.

0

Было принято решение продолжить генерировать изображения там, но с использованием нейросети Midjourney для написания подробных промтов. Результат получился намного лучше.

a photo of TOK girl, realistic portrait of a child as a princess, preserving original facial features and proportions, natural expression, correct anatomy, soft lighting, detailed realistic textures, high-quality photography, cinematic look, subtle background, gentle color grading, 8k detailed, depth of field

Исходный размер 1024x1024

a photo of TOK girl, realistic portrait of a child as an astronaut, wearing a detailed space suit, stars reflecting in the helmet glass, preserving original facial features, natural expression, cinematic lighting, 8k detailed, depth of field, gentle cosmic glow

Исходный размер 1024x1024

a photo of TOK girl, realistic portrait of a child as a forest fairy, glowing wings, soft light through leaves, natural facial features, serene expression, dreamy atmosphere, cinematic photography, detailed textures, bokeh background

Исходный размер 1024x1024

a photo of TOK girl, realistic portrait of a child as a singer on stage, holding a vintage microphone, soft spotlight on face, natural smile and expressive eyes, detailed realistic textures, cinematic lighting, bokeh background, warm stage colors, lifelike skin and proportions, 8k photography

Кем угодно
Проект создан 11.02.2026
Мы используем файлы cookies для улучшения работы сайта НИУ ВШЭ и большего удобства его использования. Более подробную...
Показать больше