Исходный размер 425x563

Хито Штейерль. Средние образы

Финалист конкурса

Предисловие

В этой статье Хито Штейерль продолжает политэкономический и эстетический анализ визуального порядка, начатый исследованием бедных образов. Теперь в фокусе внимания изображения, производимые нейросетями, и сеть трудовых, политических, эстетических и семиотических отношений, продуктом которой они являются.

Это «средние образы» — призрачные результаты корреляции усредненных значений, которые лишены референции. Они — инструменты разнообразных дискриминаций, которые делают устранение байасов неоднозначной процедурой и в которые замешаны все пользователи, чьи изображения были взяты без спроса для тренировки сетей. Изображения, производимые нейросетями, якобы магически возникают прямо из самих данных, но на уровне производства, доказывает Штейерль, опосредованы эксплуататорскими трудовыми отношениями в индустрии, наживающейся на геополитических конфликтах и уязвимости беженцев и мигрантов.

В связи с этим художница показывает неоднозначность обещаний и реальности автоматизации. Штейерль обращает внимание, что в этой сфере прекарного и спекулятивного труда вложенные усилия не окупаются линейно вознаграждением: причинно-следственные связи подменяются корреляциями, и повседневная реальность становится похожа на казино. В конечном счете тренируются не только нейросети — принудительно тренируются и пользователи, и работники, будучи встраиваемы в производственные конвейеры и иерархические структуры генерации прибыли цифровых корпораций. Надежда на выход, по Штейерль, — «растренировать» себя, освободившись от системы вымогательства и экстракции.

Подход Штейерль иллюстрирует тезис исследований науки и техники (STS):

У любой реальной техники не только техническое, но и социальное, экономическое, политическое, культурное и инженерное устройства, и эти устройства переплетены в гетерогенной сети, которой и является техника (а вовсе не просто девайсом).

Подробнее о технике как гетерогенной сети см. этот лонгрид, о технике как продукте гетерогенной инженерии см. здесь.

(Также подробнее о байасах нейросетей см. этот лонгрид , о захламляющей силе визуальности нейросетей  см. здесь, о желании, стоящем за этой визуальностью в контексте капиталистических потоков см. здесь, о границах делегирования художественных задач ИИ см. этот лонгрид.)

Исходный размер 501x499

Paul Winstanley. Walkway 3 (1989)

Средние образы

Писатель-фантаст Тед Чан недавно описал текстовую продукцию ChatGPT как «размытый JPEG всего текста в сети» [1] — или: как семантический вариант «бедного образа» (poor image). Но у размытого результата, генерируемого сетями машинного обучения (ML, machine learning), есть дополнительное историческое измерение: статистика.

Визуальные образы, создаваемые ML-инструментами, — это статистические визуализации (renderings), а не картинки реально существующих объектов. Они переносят нас от фотографической индексальности к стохастическому различению. Эти образы больше не отсылают к фактичности, не говоря уж об истине: они указывают на вероятность. На смену шоку внезапного фотографического озарения приходят следы кривых нормального распределения, функций потерь и «длинных хвостов», которые запускаются безжалостным бюрократизмом.

Эти визуализации представляют собой усредненные версии гигантского множества образов, украденных из сети ботами-неводами. Они выполнены в стиле расплывчатых евгенических композитных фото Фрэнсиса Гальтона, 8k, Unreal engine. Как визуализациям данных им не нужна никакая индексальная отсылка к своему объекту. Они не зависят от реального воздействия фотонов на датчик или эмульсию. Они сходятся вокруг среднего, медианного; галлюцинируемая усредненность. Они репрезентируют норму, передавая среднее (mean). Они заменяют похожесть (likeness) на вероятностность (likeliness). С точки зрения разрешения они могут быть «бедными образами», но по своему стилю и по сути они — средние образы.

Вот пример того, как корпус более традиционных фотографий конвертируется в статистическую визуализацию: поисковый движок Have I been trained? — очень полезный инструмент, разработанный художниками Матом Драйхёрстом и Холли Хёрндон, — позволяет пользователю просматривать огромный датасет LAION-5B, на котором тренировался Stable Diffusion, один из самых популярных генераторов text-to-image на основе глубокого обучения. В этом тренировочном корпусе данных есть и изображения со мной (Рис. 1). Что делает из них Stable Diffusion? Попросите модель визуализировать «an image of hito steyerl», и вот результат (Рис. 2).

Исходный размер 1438x1179

Рис. 1. «Images of Hito Steyerl» в датасете LAION-5B

Исходный размер 1437x1246

Рис. 2. «image of hito steyerl», сгенерированный Stable Diffusion

Как Stable Diffusion добрался из точки А в точку Б, от реального образа к такому? Конечно, это не самое лестное «до и после»; будь это лечение, я бы его не советовала. Выглядит довольно средне или даже унизительно (demeaning); но в том и дело. Вопрос: какое средство? Чье средство? Которое? Stable Diffusion создал этот портрет меня в определенном возрастном диапазоне, он порожден неизвестными внутренними процессами, туманно связанными с тренировочными данными. Дело не в спрятанном в «черный ящик» алгоритме, поскольку код Stable Diffusion известен. Мы бы могли, наоборот, назвать это алгоритмом в прозрачном ящике (white box), или социальным фильтром.

Это приблизительно то, как общество видит меня через фильтр усредненного интернет-мусора. Нужно только убрать из моих фото шум реальности и взамен выделить социальный сигнал; в результате и получится «средний образ», отображение скоррелированных средних значений — или: разных оттенков среднего.

У английского «mean» много значений, и все они тут применимы. «Mean» может указывать на низкое или жалкое происхождение, на норму, скупое или отвратительное. Оно связано со значением (meaning) как означающее, с идеями общего достояния, но также с финансовыми или инструментальными средствами (means). Сам термин [mean images] составной, композит, он размывает и накладывает друг на друга по видимости несовместимые слои смысла. Он сплавляет моральные, статистические, финансовые и эстетические ценности, а также общее (common) и низшие позиции в одну сжатую до трудноразличимости установку.

Исходный размер 476x472

Paul Winstanley. Underpass (1989)

Средние образы далеки от случайных галлюцинаций. Они — предсказуемые продукты дата-популизма. Они улавливают непроявленные социальные паттерны, в которых конфликтующие смыслы закодированы в виде векторных координат. Они визуализируют реально существующие социальные оценки, которые увязывают общее со статусом низших классов, посредственностью и отвратительным поведением. Они — остаточные изображения (after-images), выжженные на экранах и сетчатках еще долго после того, как их источник стерт. Они осуществляют психоанализ без психики или без анализа для эпохи автоматизации, в которую производство усилено массовой фальсификацией.

Средние образы — социальные сны без сна, приводящие иррациональные функции общества к их логическим следствиям. Они — документальные выражения собственных взглядов общества на само себя, которые улавливаются посредством хаотического захвата и масштабного воровства данных. Они полагаются на обширные инфраструктуры загрязняющего «железа» и неквалифицированного и лишенного прав труда, используя политический конфликт в качестве своего ресурса.

Проблема Януса

Когда осенью 2022 года в тестовом режиме был запущен text-to-3d инструмент Dreamfusion, пользователи начали замечать интересный глюк. 3d-модели, сгенерированные этим ML-инструментом, часто имели несколько лиц, направленных в разные стороны (Рис. 3). Этот глитч назвали проблемой Януса [2]. Что было ее причиной? Один из возможных ответов состоит в том, что при машинном обучении распознаванию и анализу образов чересчур сильный акцент делается на лицах; в корпусе тренировочных данных лиц больше, чем других частей тела. Два лика Януса, римского бога начал и концов, направлены в прошлое и будущее; это также бог войны и мира, перехода из одного социального состояния в другое.

Исходный размер 1444x1624

Рис. 3. 3d-модель белки с тремя лицами, сгенерированная ML-сетью

Проблема Януса, связанная с машинным обучением, затрагивает важную тему — отношение между индивидом и множеством. Как изобразить толпу в качестве чего-то одного? Или, наоборот, одно — как толпу, коллектив, группу, класс или Левиафан? Каково отношение между индивидом и группой, между частным и общим интересами (и собственностью), особенно в эпоху, когда статистические визуализации — это усредненные композиции групп?

Вероятностности

Вот другой статистический композит, в который впутано мое лицо (Рис 4).

Исходный размер 1432x990

Рис. 4. Примеры [изображений лиц] и композитные образы [лиц] из Racial Faces in the Wild Database

«Расовые» пятна с призрачным гендером справа можно назвать вертикальными групповыми фотографиями, на которых люди расположены не рядом друг с другом, а поверх друг друга. Как такие образы появились?

В 2016 году мое имя всплыло в компендиуме под названием MS-Celeb-1M — базе данных Microsoft, содержащей 10 млн найденных в интернете изображений 100 000 людей. Информацию об этом обнародовали Адам Харви и Джулс Лаплас в рамках своего расследовательского проекта Megapixels [3], посвященного базам данных. Если ваше имя оказывалось в списке, Microsoft поощряло исследователей загружать из интернета фотографии вашего лица, чтобы построить биометрический профиль. Я стала частью раннего тренировочного датасета, предназначенного для алгоритмов распознавания лиц. Но для чего и кем он использовался?

Исходный размер 512x512

Paul Winstanley. Walkway (1989)

Как оказалось, MS-Celeb-1M заинтересовала ряд групп и институций. К примеру, эту базу использовали для оптимизации расовой классификации разработчики другого датасета, Racial Faces in the Wild. Они жаловались на то, что технология распознавания лиц плохо работает с не-белыми людьми. Так что они задались целью «исправить» эту проблему. Разработчики выгрузили картинки из датасета MS-Celeb-1M в интерфейс распознавания Face++ и использовали полученные расовые метки, чтобы разделить людей на четыре группы: европейцы, азиаты, индийцы и африканцы. При этом декларируемой целью было сокращение байасов в программе распознания лиц и повышение разнообразия тренировочных данных [4].

Мы используем файлы cookies для улучшения работы сайта НИУ ВШЭ и большего удобства его использования. Более подробную...
Показать больше