Потенциал нейросетей в генерации фотореалистичного контента для медиа

Скачать статью
Мухина О.С.

кандидат филологических наук, доцент кафедры периодической печати и сетевых изданий, департамент «Факультет журналистики», Уральский федеральный университет, г. Екатеринбург, Россия; ORCID 0000-0001-8791-6086

e-mail: olga.mukhina@urfu.ru
Олешко В.Ф.

доктор философских наук, профессор, заведующий кафедрой периодической печати и сетевых изданий, департамент «Факультет журналистики», Уральский федеральный университет, г. Екатеринбург, Россия; ORCID 0000-0003-3001-7391

e-mail: vladimir.oleshko@urfu.ru

Раздел: Новые медиа

Цифровизация трансформирует медиасферу и работу журналистов. Одним из наиболее актуальных вызовов стало появление искусственного интеллекта. Самым развитым его направлением пока является генерация текстов и иллюстраций, хотя уже имеются значимые достижения и в других форматах. В настоящей статье сделано предположение, что нейросети уже в состоянии стать субститутом фотографических изображений. Для подтверждения этой гипотезы в качестве примера проанализированы пять популярных нейросетей, генерирующих иллюстрации: Midjourney, Leonardo, Kandinsky, Stable Diffusion и «Шедеврум». В качестве метода исследования выбран опрос, в котором приняли участие 293 респондента. Им были представлены иллюстрации, сгенерированные в указанных нейросетях, и реальные фотографии и было предложено определить, где настоящее фото, а где – сгенерированное искусственным интеллектом. По итогам выяснилось, что каждая представленная нейросеть уже способна создать изображение, неотличимое от фото. Однако некоторые нейросети пока делают это качественнее и быстрее других.

Ключевые слова: искусственный интеллект, нейросеть, Midjourney, Leonardo, Kandinsky, Stable Diffusion, «Шедеврум»
DOI: 10.55959/msu.vestnik.journ.4.2025.7895

Введение

Цифровизация как новейший этап развития мирового сообщества не только видоизменила каналы распространения информации, но и предельно динамизировала технологический прогресс, что приводит к кардинальным изменениям в различных сферах человеческой деятельности. Глобальные процессы обусловили также кардинальную перестройку стратегий и тактик медиакоммуникаций и журналистской деятельности (Вартанова, 2022). 

Изменения затронули прежде всего форматы творческой работы журналистов, особенно в ситуации конкуренции с индивидаминепрофессионалами, такими как инфлюенсеры, блогеры и гражданские журналисты (Макеенко, Вырковский, 2021). Однако настоящим вызовом современности стал искусственный интеллект (ИИ). Цифровизация, включая развитие социальных сетей, новых медиаформатов и ИИ, трансформирует медиаиндустрию, создавая новые возможности и предлагая новые вызовы, требующие постоянного освоения актуальных навыков и адаптации к стремительно меняющимся технологическим реалиям (Дугин, 2024).

На момент написания настоящей статьи (январь 2025 г.) нейросети уже способны генерировать простые тексты и создавать иллюстрации, неотличимые от реальных фотографий. Возможности аудио и видео еще находятся в начальной точке своего развития, однако журналисты уже могут генерировать простые видео и Reels и даже создавать собственные цифровые аватары для проведения трансляций. Это становится триггером и огромных возможностей, и экзистенциальных рисков для специалистов, чью работу уже сейчас может взять на себя искусственный интеллект. Появляются вопросы о способности искусственного интеллекта стать конкурентом человека в ракурсе творчества (Распопова, 2024; Гончарова, 2023; Носова, 2023).

Визуальный контент в современных медиа играет ключевую роль. Младшее, цифровое поколение ориентировано преимущественно на визуальную составляющую (Каштанова, 2024). В связи с этим развитие нейросетей, способных генерировать фотореалистичные иллюстрации, открывает новые перспективы. Ведущие СМИ в России и за рубежом уже активно используют нейросети в своей деятельности (Давыдов, Замков, Крашенинникова, Лукина, 2023). Специалисты используют ИИ не только собственно в журналистике, но и в таких смежных сферах, как реклама, PR, маркетинг, работа с социальными сетями (Яблонских, 2024).

Необходимо сразу оговориться, что «искусственные», сгенерированные иллюстрации, разумеется, не должны использоваться в общественно-политических изданиях, призванных объективно отражать актуальные, наиболее значимые события. Применение технологий генерации контента сопряжено с целым рядом этических проблем (Быльева, 2023; Волкова, 2023; Алексеев, Алексеева, 2024), в частности с недопустимостью создания фейков, проблемой правомерного использования чужих изображений, обеспечения объективности и достоверности публикуемой информации (Меджанова, Атаева, 2024). Возникают и юридические дилеммы (Чумичева, 2024), поскольку неясно, кто является автором сгенерированной иллюстрации. 

Вместе с тем существует огромное количество нишевых, узкоспециализированных изданий, в которых изображения выполняют сугубо иллюстративную функцию. Ранее такие средства массовой информации использовали фотобанки: крупные СМИ – собственный фотобанк, остальные чаще использовали специализированные сайты, платные и бесплатные. Однако поиск нужного изображения в фотобанке, особенно бесплатном, может занять часы. С развитием нейросетей логично будет использовать генерацию иллюстраций при помощи искусственного интеллекта. Как показало наше предыдущее исследование (Мухина, Олешко, 2024), пока что этим в основном пользуются медиафрилансеры, которые становятся все более значимой социальной группой с развитием цифровых технологий и особенно после локдауна, объявленного в период пандемии COVID-19 (Norbäck, 2022; Josephi, O’Donnell, 2022; Himma-Kadakas, Mõttus, 2021). Многие издания все больше привлекают к своей деятельности удаленных внештатных журналистов (Hayes, 2021; Hagar, Wachs, Horvát, 2021). 

В числе основных преимуществ выбора в пользу генерации иллюстраций – значительная экономия ресурсов (финансов, времени) и возможность визуализации сложных и даже нереалистичных тем, а также сценариев, которые при реальной фотосъемке были бы опасны или требовали слишком больших затрат. 

В рамках настоящего исследования мы задались вопросом, насколько нейросети уже могут служить субститутом фотографических изображений в средствах массовой информации. Важно отметить, что нейросети постоянно развиваются, качество сгенерированных иллюстраций стремительно растет. Регулярно появляются и новые конкуренты на этом рынке. Рискнем предположить, что в 2026 г. проблема фотореализма при генерации в любой нейросети перестанет существовать в принципе. Однако тем интереснее зафиксировать настоящий, переходный этап, когда первые, наиболее качественные нейросети только начинают успешно справляться с задачей генерации фотореалистичного контента. 

Мы также предположили, что генерация фотореалистичного изображения является наиболее сложной задачей для ИИ. Сгенерировать аниме или другую «нарисованную» иллюстрацию сможет сегодня любая популярная нейросеть. Фотореализм же – это на сегодняшний день вызов на пределе возможностей для многих нейросетей, особенно при изображении сложных сюжетов – с участием людей и с множеством деталей.

По итогам предыдущего исследования (Мухина, Олешко, 2024) мы выбрали пять нейросетей для генерации изображений: 

Kandinsky, Leonardo, Midjourney, Stable Diffusion и «Шедеврум». Эти нейросети оказались наиболее популярными у российских журналистов. Вместе с тем подчеркнем, что в рамках настоящего исследования важны не столько конкретные нейросети (поскольку ситуация на рынке стремительно трансформируется), сколько в принципе способность искусственного интеллекта заменить фотографию.

Мы также выдвинули гипотезу, что нейросети условно можно разделить на «сильные» (к ним мы отнесли Midjourney и Leonardo), способные справиться с наиболее сложными задачами, и «слабые» (к ним мы отнеслиKandinsky и Stable Diffusion), возможности которых пока с трудом удовлетворяют минимальным требованиям. Мы предположили, что «Шедеврум» занимает промежуточное положение. 

Методика исследования

Мы провели опрос, использовав в качестве площадки гуглформы1, в которые были загружены 60 иллюстраций: по 10, сгенерированных в пяти вышеуказанных нейросетях (Kandinsky, Leonardo, Midjourney, Stable Diffusion и «Шедеврум»), а также 10 реальных фотографий. Все сгенерированные иллюстрации были максимально приближены к фотореализму. 

Каждые 10 иллюстраций отражали следующие темы:

–     условный натюрморт (например, чашка кофе, круассан и цветы на столе); 

–     животное (мы ограничились собаками и кошками);

–     помещение внутри (комната); 

–     здание снаружи (улица); 

–     человек в действии (это иллюстрация, в которой присутству-ет человек, а у самой картины есть сюжет: например, танцующая балерина или пожилой африканец, с болью смотрящий вдаль, на фоне мусорных баков); 

–     человек (погрудный портрет);

–     рука, демонстрирующая какой-либо жест или протягиваю-щая предмет (например, цветы, яблоко или бутылку воды); 

–     природа;

–     статуэтка/фигурка;

–     техника (ноутбуки, планшеты, смартфоны, видеокамеры, фотоаппараты и пр.). 

Из собственного практического опыта в генерации иллюстраций мы предположили, что сложнее всего генерировать людей в действии, также могут возникнуть проблемы с руками, а вот натюрморты и статуэтки/фигурки – самые простые для исполнения задачи.

Иллюстрации, созданные в Kandinsky, Leonardo и Stable Diffusion, мы сгенерировали сами. Иллюстрации в «Шедеврум» частично сгенерировали сами, частично взяли из ленты других пользователей. Иллюстрации вMidjourney мы вынуждены были полностью взять из ленты других пользователей, поскольку эта нейросеть в данный момент является платной. Однако подчеркнем, что мы пользовались официальным каналом Midjourney, что является гарантией того, что выбранные иллюстрации сгенерированы именно в этой нейросети.

Что касается представленных в опросе реальных фотографий, то в каждом случае мы либо лично знали автора, либо убедились, что фотография была сделана до 2022 г. (когда начали появляться нейросети) и, таким образом, гарантированно не является сгенерированной. 

В качестве респондентов мы привлекли бакалавров и магистрантов департамента «Факультет журналистики» Уральского федерального университета. Всего в опросе приняли участие 293 респондента. В каждом вопросе была только иллюстрация – участники должны были определить: она сгенерирована или это реальное фото?

Чтобы респонденты были максимально объективными, мы давали им следующие установки:

–            Тратить не более 10 секунд на одну иллюстрацию (поскольку в реальной действительности читатель не разглядывает их, а пролистывает, бессознательно определяя объект и качество изображения). Мы не включали секундомер для каждой иллюстрации, но использовали общий тайминг – 10 минут на весь опрос, включавший 60 иллюстраций.

–            Если респондент считает, что конкретная иллюстрация сге-нерирована при помощи искусственного интеллекта, то должен объяснить причину (какие признаки позволяют идентифицировать работу нейросети). Для этого после проведения опроса мы провели устную дискуссию в группе, совместно пролистывая каждую иллюстрацию. Респонденты, ответившие, что это сгенерированная иллюстрация, объясняли, по каким признакам сделали данный вывод.

Вместе с тем подчеркнем, что результаты, представленные ниже, являются итогом подсчета статистики из гугл-форм, где были только закрытые вопросы (респондент выбирал, является иллюстрация сгенерированной или реальной фотографией). Информацию, полученную нами от респондентов во время устных обсуждений, мы используем исключительно как дополнение, для объяснения полученных данных. 

Результаты исследования

Первое, что необходимо отметить по итогам нашего опроса: нет такой сгенерированной иллюстрации, которую хоть один респондент не счел бы реальной фотографией, и, к сожалению, в нашем перечне не было ни одного фото, которое хоть один участник не назвал бы сгенерированным. Таким образом, это достаточно субъективный процесс. Однако средства массовой информации ориентируются на массового читателя, и если большинство респондентов сочли сгенерированную иллюстрацию реальной фотографией, то напрашивается вывод, что данная нейросеть качественно работает в режиме фотореализма. 

Основные результаты нашего опроса представлены в таблице 1. В каждой ячейке указан процент респондентов, которые идентифицировали представленную иллюстрацию как реальную фотографию. 

Мухина, табл. 1.png

Сделаем некоторые выводы. Во-первых, реальные фотографии большинством респондентов были распознаны как фотографии. В большинстве случаев этот показатель держится на уровне около 80%. Это свидетельствует о том, что большинство респондентов адекватно оценивали иллюстрации и не искали недостатки там, где их объективно нет. Более низкий показатель у фотографии статуэтки. Однако статуэтки хорошо генерируются в любой нейросети, при этом участники знали, что одна из этих иллюстраций, вероятно, должна быть реальной фотографией, и это могло дезориентировать их. Фотография техники была сделана из позиции «вид сверху на стол», что, как мы выяснили по итогам устных обсуждений, тоже навело многих на мысль, что иллюстрация искусственная. 

Выводы относительно качества работы каждой представленной нейросети в режиме фотореализма были сделаны на основе следующих показателей:

–            процент респондентов, которые идентифицировали пред-ставленную иллюстрацию как реальную фотографию. Если большинство респондентов сочли иллюстрацию фотографией, то мы делали вывод о том, что данная нейросеть качественно генерирует данную тему; 

–            количество тем, с которыми нейросеть успешно справляется (т. е. большинство респондентов называют иллюстрацию фотографией). Чем больше таких тем, тем качественнее работает нейросеть;

–            фактор уникальных навыков. Если нейросеть успешно справ-ляется с темой, с которой работают все нейросети (например, генерация статуэток), то это мало говорит о ее качестве. А вот если нейросеть справляется с темой, в которой у нее мало конкурентов (например, изображение человека в действии), то это повышает ее рейтинг. 

Руководствуясь данными, представленными в таблице 1, мы сделали следующие выводы:

Kandinsky – одна из самых слабых нейросетей. Ею легко воспользоваться: она не требует дополнительных регистраций (кроме Telegram) и установки приложений, а также понимает русский язык. Однако пока она качественно работает в режиме фотореализма только при генерации статуэток или интерьеров.

Leonardo – лучшая из представленных. Большинство респондентов посчитали реальной фотографией почти все иллюстрации, кроме (к удивлению авторов настоящей статьи) портрета человека. Однако портрет человека – это одна из наиболее простых задач, и, возможно, конкретная иллюстрация была неудачной. 

Midjourney – результаты этой нейросети сильно удивили авторов. Она известна как одна из наиболее сильных и качественных. И при устном обсуждении итогов большинство респондентов сходились во мнении, что это сильная нейросеть, которая успешнее других справляется с задачей генерации фотореалистичных иллюстраций. Кроме того, если проанализировать количество раз, когда респонденты принимали искусственное изображение за фотографию (данные, собранные нами по результатам о