Большой практический тест нейросетей для генерации изображений: фото, русский текст, инфографика, реклама, референсы и редактирование. Сравниваю самые популярные ИИ в 2026 году.

Нейросети для генерации изображений давно научились делать красивую картинку по описанию, поэтому очередной промпт в духе «девушка в кафе, cinematic light» уже мало что показывает. Гораздо интереснее реальные рабочие задачи: написать русский текст без ошибок, собрать инфографику, сохранить лицо по референсу, аккуратно изменить исходное фото или сделать рекламный кадр, который не придётся заново собирать в Photoshop.
За два дня я прогнал модели через большой набор одинаковых и сопоставимых сценариев. В итоге накопилось около 150 изображений и промежуточных правок. Показывать весь массив здесь было бы тяжело и для статьи, и для читателя, поэтому подробно разбираю 25 наиболее показательных тестов GPT Image 2.5, а остальные модели сравниваю на одинаковых контрольных заданиях, где различия особенно хорошо видны.
Красивые изображения получились почти у всех. Но как только в задаче появились точный текст, референсы, локальные правки и жёсткое следование промпту, разница между моделями стала намного заметнее.
Какие нейросети участвовали и что получилось
Нейросеть |
Коротко по моим тестам |
Лучше всего подходит для |
|---|---|---|
Хорошо держит сложные инструкции, текст, референсы и локальные правки |
Универсальных задач, редактирования, текста и рекламы |
|
Очень стабильный универсал |
Быстрой генерации качественных изображений |
|
Сильный фотореализм и хороший рекламный тест |
Реалистичных людей и коммерческих визуалов |
|
Красиво и детально, но бывают ошибки в тексте |
Атмосферных и визуально насыщенных сцен |
|
Хорошая генерация фото, слабее с типографикой |
Фотореалистичных сцен и предметки |
|
Эффектно, но хуже с точным ТЗ |
Арта, стилизации и выразительных концептов |
Сразу оговорюсь: это не лабораторный benchmark и не попытка вывести рейтинг с точностью до сотых. Я смотрел на то, насколько результат пригоден в реальной работе: выполнен ли промпт, нет ли ошибок в тексте, не поплыли ли руки, сохранился ли человек по референсу и не решила ли нейросеть заодно изменить половину кадра.
Как проходил тест
Для GPT Image 2.5 я собрал 25 разных сценариев, от фотореалистичных людей до последовательных правок одного интерьера. Один отдельный тест на добавление объекта позже объединил с многошаговым редактированием — смысла дважды проверять один навык не было.
В сравнении с другими ИИ оставил два задания:
сложное фотореалистичное фото человека;
рекламный кадр продукта с русским текстом.
Первое хорошо показывает качество самой генерации. Второе сразу проверяет продукт, материалы, композицию, кириллицу, типографику и следование техническому заданию.
Генерация изображений по тексту: от портрета до сложной сцены
Тест 1. Фотореалистичный портрет
Первым был довольно сложный editorial-кадр: девушка с прозрачным зонтом в оранжерее на крыше небоскрёба, дождь, стекло, растения и вечерний город.

GPT Image 2.5 собрал сцену почти без слабых мест. Хорошо получились кожа, волосы, мокрые поверхности, капли на зонте и баланс между холодным городом за окном и тёплым светом внутри. Картинка довольно постановочная, но в данном случае это работает — выглядит скорее как кадр из кампании модного журнала, чем как типичная «AI-девушка».
Тест 2. Два человека и взаимодействие
Задача была сложнее: мужчина и женщина в вагоне-ресторане ночного поезда, карта на столе, фотоаппарат, чай в подстаканниках, одна героиня показывает пальцем на маршрут.

Здесь я в первую очередь смотрел не на красоту, а на логику взаимодействия. Руки выглядят нормально, оба персонажа смотрят туда, куда нужно, предметы не материализовались в странных местах. Сам вагон тоже получился цельным.
Для генерации двух людей в одной сцене результат очень уверенный.
Тест 3. Мастерская с большим количеством объектов
Дальше я специально перегрузил промпт: скетчбук, колба, компас, катушка медной проволоки, лампа, механические часы, ноутбук, книги по ботанике, кактус, засушенные травы.

Обычно именно на таких запросах начинают исчезать или мутировать второстепенные предметы. Здесь модель удержала почти весь набор и при этом не превратила стол в хаотичную свалку.
Особенно понравилось, что пространство воспринимается как настоящая рабочая мастерская, а не как витрина из случайных красивых объектов.
Тест 4. Архитектура и сложное пространство
Последний тест в этой группе — читальный зал, встроенный в скалу над холодным северным морем.

Здесь уже проверял скорее пространственное мышление. GPT Image 2.5 хорошо совместил бетон, каменную стену, огромные окна, мебель и пейзаж. Получилось убедительное пространство, а не просто «библиотека плюс море».
Человек у окна немного теряется на фоне масштаба — но композиционно это даже подходит сцене.
Русский текст, постеры и инфографика
Вот здесь стало интереснее. Фотореалистичные портреты сейчас умеют делать почти все крупные модели, а вот нормальный русский текст всё ещё хорошо разделяет генераторы.
Тест 5. Постер на русском
Я попросил сделать афишу фестиваля науки с точными строками:
ФЕСТИВАЛЬ НАУКИ
12 ОКТЯБРЯ
МОСКВА
ЛЕКЦИИ • ВЫСТАВКИ • ИНТЕРАКТИВ
ВХОД СВОБОДНЫЙ

Основной текст GPT Image 2.5 написал правильно. Причём модель не просто расставила буквы, а собрала нормальный макет: иерархия, крупный заголовок, дата, свободное пространство, стеклянная колба с городом.
Для меня это один из показательных моментов всего теста: текст уже можно воспринимать как элемент дизайна, а не как лотерею.
Тест 6. Обложка статьи
Следующая задача была ближе к моей реальной работе — обложка для материала о нейросетях для генерации изображений.

На столе модель разложила разные типы визуалов: портрет, инфографику, художественный кадр, товар и пример редактирования. Заголовок и подзаголовок читаются, композиция не рассыпалась.
Получился вполне рабочий hero image, который я бы мог использовать почти без ручной верстки.
Тест 7. Инфографика
Задание: показать шесть элементов хорошего промпта:
объект;
действие;
среда;
свет;
стиль;
ограничения.

Здесь модель особенно приятно удивила. Получилась настоящая инфографика, а не просто шесть карточек вокруг картинки. Иконки соответствуют смыслу, порядок понятен, подписи читаются, внизу есть пример готового промпта.
Тест 8. Схема процесса
Похожая задача, но уже не список, а последовательность:
Идея → Промпт → Референсы → Генерация → Правки → Финальный результат.

GPT Image 2.5 правильно понял логику процесса и визуально связал этапы. Это важный момент: модель умеет не только оформлять информацию, но и изображать последовательность действий.
Как я сейчас пишу промпты для генерации изображений
После этих тестов формула у меня довольно простая:
объект → действие → среда → композиция → свет → стиль → ограничения
Например, вместо:
Нарисуй девушку в мастерской.
лучше написать:
Молодая керамистка стоит у длинного рабочего стола и двумя руками рассматривает только что обожжённую чашу. Небольшая мастерская, деревянные полки, печь на заднем плане, холодный утренний свет из большого окна и несколько тёплых локальных источников. Фотореалистичная editorial-фотография, естественная кожа, правильные руки, реалистичные материалы. Не добавлять текст и лишние предметы.
Чем важнее конкретная деталь, тем лучше назвать её явно. Особенно это касается текста, количества объектов и того, что нельзя менять при редактировании. Стоит заметить, что у GPT Image 2.5 все отлично с фантазией, не бойтесь ей предоставлять возможность додумать изображение, если это позволяет ваша задача.
Рекламные изображения и фото товара
Тест 9. Студийная предметка
Я придумал условный премиальный чай NORDLEAF и попросил сделать рекламную съёмку в тёмной эстетике.

Получилась очень сильная предметка: матовая зелёная банка, золотые детали, керамика, чайные листья, пар, камень. Упаковка выглядит физически убедительно, а не как пластиковый 3D-объект.
Особенно хорошо сработал свет. Банка остаётся главным объектом, но фон и реквизит делают сцену живой.
Тест 10. Тот же товар в lifestyle-сцене
Дальше тот же продукт перенёс на светлую кухню.

И вот здесь важнее красоты было сохранить идентичность товара. Банка осталась той же формы, цвета и стилистики, но окружающий мир полностью поменялся.
Для ecommerce и рекламы это куда полезнее, чем ещё один красивый packshot: один продукт можно довольно быстро переносить между разными рекламными сценами.
Работа с референсами
Тест 11. Один человек в новой сцене
Загрузил портрет и попросил перенести человека в вечерний книжный магазин.

Лицо сохранилось очень хорошо. Возраст, волосы, основные черты — всё узнаваемо. Новая одежда и интерьер не выглядят приклеенными поверх исходника.
Но здесь же поймал одну из немногих явных ошибок: на фоновой табличке модель написала:
«Борошие книги делают людей ярче»
Хороший пример ограничения: крупный текст, который я задаю явно, модель воспроизводит отлично, а мелкие надписи, которые она придумывает сама, всё ещё стоит проверять.
Тест 12. Один персонаж в трёх сценах
Кафе, городской переход и офис — одна и та же девушка.

Для character consistency результат сильный. Меняются позы, освещение и масштаб персонажа, но лицо остаётся узнаваемым. В средней сцене героиня показана почти в полный рост, и даже там identity не развалился.
Если придираться, укладка и мелкие пропорции немного гуляют, но это скорее естественная вариативность, чем три разных человека.
Тест 13. Перенос визуального стиля
Вместо буквального копирования изображения попросил перенести его художественную логику на новую сцену с лодочной станцией.

Получилось атмосферно: дерево, вода, туман, рассветный свет и девушка на пирсе хорошо собираются в один кадр. Это уже не «фильтр по референсу», а довольно содержательная интерпретация.
Тест 14. Несколько референсов одновременно
Здесь загрузил четыре исходника: человека, куртку, интерьер и кружку.

Именно этот тест хорошо показывает, насколько далеко ушла генерация по референсам. Модель собрала все элементы в одну сцену без ощущения фотоколлажа. Лицо сохранилось, одежда правильно легла по фигуре, кружка получила нормальный масштаб и перспективу.
Multi-reference у GPT Image 2.5 в моих тестах оказался одной из сильнейших функций.
Редактирование фото нейросетью
Тест 15. Удаление объекта
Из сцены на озере я удалил лодки.

GPT Image 2.5 не просто затёр область, а восстановил воду, камыши и причал. Остальная сцена практически не изменилась: девушка, пирс, здание, свет и линия горизонта остались на месте.
Именно такое редактирование мне и нужно от нейросети: поменять одно, не перегенерировать всё остальное.
Тест 16. Замена одежды
Исходный человек сидит у кафе в худи и джинсах. Я попросил заменить образ на пальто, водолазку, тёмные брюки и ботинки.

Лицо, поза и фон почти не изменились, а новая одежда нормально подстроилась под положение тела. Это уже довольно близко к виртуальной примерке, а не к полной перегенерации фотографии.
Тест 17. Объединение двух фотографий
Человек из одного фото и локация из другого.

Здесь главное — свет и перспектива. В финальном изображении человек не выглядит вырезанным: вечерний свет ложится на волосы и лицо, кресло и стол находятся в правильном масштабе.
Задача «перенести человека на другое фото» выполнена очень чисто.
Тест 18. Эскиз в готовое изображение
Простой интерьерный sketch превратил в реалистичный чайный бар.

Модель сохранила исходную композицию: длинную стойку, ряд высоких стульев, подвесные лампы, узкое пространство и полки. При этом добавила нормальные материалы, свет и атмосферу.
Мне особенно понравилось, что ИИ не решил ради красоты перестроить весь проект.
Шесть последовательных правок одного изображения
Этот тест GPT Image 2.5 оказался, пожалуй, самым полезным.
Стартовал с обычного домашнего кабинета и по очереди просил:
изменить дневной свет на вечерний;
добавить чашку и записную книжку;
поставить высокое растение;
сделать интерьер более редакционным;
изменить постеры;
удалить настольную лампу.

Первые пять шагов прошли удивительно стабильно. Геометрия комнаты, стол, кресло, окно, ноутбук и полки оставались почти на своих местах. Особенно удачно получилась смена освещения: это не просто оранжевый фильтр, а действительно новый свет со своими тенями и отражениями.
Проблема появилась на последнем шаге. Я попросил только удалить лампу, а GPT Image 2.5 заодно поменял внешний вид постеров на стене.
Это хороший показатель текущей границы: многошаговое редактирование стало заметно стабильнее, но после длинной цепочки мелкие независимые детали всё ещё могут начать дрейфовать.
Что показал большой тест GPT Image 2.5
После всех этих генераций сильнее всего я бы выделил четыре вещи:
очень ровный фотореализм;
хороший русский текст и layout;
сильную работу с несколькими референсами;
действительно полезное локальное редактирование.
При этом идеальной модель не стала. Мелкий самостоятельно придуманный текст всё ещё может ломаться, а после длинной серии правок появляются незапрошенные изменения
После этой серии тестов стало понятнее, где у GPT Image 2.5 действительно есть преимущество именно в моих сценариях: русский текст, инфографика, работа с несколькими референсами и локальные правки. При этом отдельные задачи не дают основания объявлять одну модель универсально лучшей — дальше я специально сравнил несколько генераторов на одинаковых контрольных промптах.
Как другие нейросети справились с теми же заданиями
После двадцати сценариев на GPT Image повторять их ещё пять раз мне уже не хотелось — да и читателю вряд ли нужны ещё сто почти одинаковых изображений.
Поэтому я оставил два контрольных теста.
Тест A. Фотореалистичная керамистка
Одинаковая задача для всех моделей: молодая женщина в мастерской держит необычную керамическую чашу, естественный утренний свет, много фактур, руки должны быть хорошо видны.
GPT Image 2.5

Очень сильный результат. Много мелких деталей мастерской, естественная кожа, хорошие руки и правильный свет. При генерации фото в GPT Image 2.5 особенно чувствуется глубина сцены: передний план, человек и фон хорошо разделены.
Grok Image 2.0

Grok Image 2.0 пожалуй, главный сюрприз всего сравнения. Очень реалистично, сдержанно и без характерного пластикового блеска.
Окружение чуть более стерильное, чем у GPT Image, но сам человек выглядит очень убедительно. После этого теста Grok я точно буду использовать чаще.
Nano Banana 2

У Nano Banana 2 ожидаемо тоже сильный результат: много деталей, хороший свет, нормальная анатомия.
Возможно, после десятков генераций у меня уже просто замылился глаз, но я начал узнавать характерный Nano Banana look ещё до того, как смотрел подпись: очень чисто, мягко и чуть рекламно. Это не минус, просто у модели есть заметный визуальный почерк.
FLUX 2

Технически всё хорошо: руки нормальные, материалы читаются, свет естественный.
Но сцена чуть более плоская. Flux 2 по сравнению с GPT Image и Grok меньше ощущения глубины и живой editorial-фотографии.
Seedream 5.0

Seedream 5.0 Pro - красиво и качественно, но именно здесь чуть сильнее чувствуется «нейросетевость». Лицо, свет и поза слишком аккуратные, сцена выглядит немного вылизанной, но кинематографично.
Не явная ошибка, скорее ощущение.
Midjourney

А здесь поймал небольшой флешбек из времён старых генераторов.
Картинка у Midjourney эффектная, свет красивый, но лицо слегка уходит в зловещую долину, а пальцы правой руки заставили приблизить изображение. И не зря: кисть действительно выглядит неестественно.
Несколько лет назад именно такие руки были почти визитной карточкой генеративной графики. Не ожидал снова увидеть это здесь.
Сравнение фотореализма
Модель |
Мои впечатления |
|---|---|
GPT Image 2.5 |
Очень естественно, много деталей, хорошая глубина |
Grok Image 2.0 |
Отличный реализм, почти без AI-look |
Nano Banana 2 |
Очень качественно, чуть узнаваемый фирменный стиль |
FLUX 2 |
Хорошо, но немного плоско |
Seedream 5.0 |
Красиво, но слегка выдаёт генерацию |
Midjourney |
Эффектно, но лицо и пальцы подвели |
Тест B. Премиальная реклама VERDANT
Второй тест оказался намного жёстче.
Нужно было сделать бутылку botanical tonic, стекло, конденсат, бергамот, розмарин, ягоды можжевельника, атмосферный фон и точный русский рекламный текст:
VERDANT
BOTANICAL TONIC
МОЖЖЕВЕЛЬНИК • БЕРГАМОТ • РОЗМАРИН
БЕЗ АЛКОГОЛЯ
330 МЛ
И отдельно:
СЛОЖНЫЙ ВКУС
ПРОСТОЙ СОСТАВ
GPT Image 2.5

Практически готовая реклама. Стекло, конденсат, фон, свободное место под текст — всё очень аккуратно. Надписи тоже без заметных ошибок.
Из всех вариантов этот выглядит наиболее близко к финальному коммерческому макету.
Nano Banana 2

Тоже отлично. Текст читается, бутылка выглядит убедительно, ингредиенты разложены нормально.
Просто визуально кадр чуть менее атмосферный, чем у GPT Image 2.5. Скорее качественная product shot-реклама, чем большой premium key visual.
Grok Image 2.0

Очень достойно — и снова неожиданно.
Текст получился хорошо, композиция чистая, бутылка выглядит дорого. Если искать мелкий недостаток, ягоды больше похожи на чернику, чем на можжевельник, а половинка бергамота визуально довольно близка к лайму.
Но это уже придирки к реквизиту, а не к самому макету.
FLUX 2

По фотографии всё нормально: хороший тёмный фон, стекло, капли, мокрый камень.
А вот текстовая часть просела. В слове «можжевельник» потерялась буква, часть копирайта изменилась, а структура слогана выполнилась не полностью.
Как картинка — хорошо. Как готовая реклама по ТЗ — уже хуже.
Seedream 5.0

Жаль, потому что визуально получилось очень неплохо.
Но в крупном слогане модель написала «ПРОСТОЙ СОСТАД» вместо «состав», а заодно проигнорировала запрошенный формат и сделала вертикальный кадр.
Раньше Seedream у меня с форматом так не чудил, поэтому этот результат был неожиданным.
Midjourney

Здесь начинается веселье.
Часть промпта модель просто проигнорировала. Кириллица исчезла, английский текст тоже оказался неправильным, а часть символов напоминает какую-то авторскую систему письма.
Я долго смотрел на эти надписи и пришёл к выводу, что Midjourney решил не выбирать между русским и английским и изобрёл руны.
При этом сама бутылка и свет вполне красивые. Но красивый mockup и рекламный макет по техническому заданию — всё-таки разные вещи.
Сравнение рекламного теста
Модель |
Текст |
Следование ТЗ |
Итог |
|---|---|---|---|
GPT Image 2.5 |
Без заметных ошибок |
Очень точное |
Практически готовый макет |
Nano Banana 2 |
Хорошо |
Точное |
Отлично, чуть менее атмосферно |
Grok Image 2.0 |
Хорошо |
Точное |
Сильный результат, мелкие вопросы к реквизиту |
FLUX 2 |
Есть ошибка |
Частичное |
Фото хорошее, текст требует правки |
Seedream 5.0 |
Ошибка «СОСТАД» |
Нарушил формат |
Визуально хорошо, но не готово к использованию |
Midjourney |
Серьёзные ошибки |
Значительная часть ТЗ потеряна |
Красиво, но для точного макета слабо |
Какая нейросеть лучше справилась с разными типами задач
После всех тестов у меня не получилось свести результат к одной модели «на все случаи».
Для русского текста, инфографики и локальных правок наиболее стабильным в этой выборке был GPT Image 2.5: он лучше удерживал структуру макета и реже менял элементы, которые я не просил трогать.
В фотореализме людей очень сильными оказались сразу несколько моделей. GPT Image 2.5 дал детализированную сцену с хорошей глубиной, Grok Image 2.0 — один из самых естественных кадров без заметного пластикового эффекта, а Nano Banana 2 сохранил привычно стабильное качество.
Для художественной подачи и стилизации Midjourney по-прежнему выглядит интересно, но в моих тестах хуже справился с точным текстом и жёстким техническим заданием.
Seedream 5.0 и FLUX 2 дали хорошие визуальные результаты, однако в рекламном тесте именно текст и точное следование структуре промпта оказались слабее.
Поэтому выбирать генератор я бы стал не по общему рейтингу, а по типу задачи: одна модель лучше подходит для точного редактирования, другая — для фотореализма, третья — для выразительного арта.
На что смотреть при выборе генератора изображений
По этим тестам я бы вообще перестал оценивать нейросеть по одному красивому портрету.
Если нужен ИИ для генерации изображений в работе, лучше проверить четыре вещи:
насколько точно он выполняет промпт;
умеет ли нормально писать нужный вам текст;
сохраняет ли исходное изображение при image-to-image редактировании;
насколько стабильно работает с несколькими референсами и последовательными правками.
Красивую картинку сегодня можно получить почти везде. Настоящая разница начинается тогда, когда нейросеть должна сделать именно то, что вы попросили, а не просто что-то похожее и эстетичное.
Кто тестировал и зачем. Я работаю с ИИ-инструментами в самых разных задачах, включая редакционные: регулярно делаю иллюстрации, обложки, инфографику, рекламные визуалы и редактирую исходные изображения. Поэтому в этом тесте меня интересовала не абстрактная «красота картинки», а практическая пригодность результата: насколько точно модель выполняет промпт, работает с русским текстом, сохраняет человека и референсы, делает локальные правки и выдерживает несколько последовательных изменений. Все выводы ниже основаны на собственных генерациях в рамках этого теста.
Реклама. ООО "Диджитал Гениус". ИНН 7813681158
Комментарии (3)

dobrobobrrobot
23.09.2026 07:02А какая именно версия Midjourney использовалась? Что-то все печально у нее с генерацией, стойкое дежавю 2023-24 года
У GPT Image конечно прорыв, я сам пробовал - закидываешь криво-косо снятое фото своей вещи, 10 слов промпта и готов рекламный постер за который раньше надо было отваливать много денег дизайнеру или день самому рисовать в фотошопе
Tomasina
Под каждым изображением не хватает текстового промпта, которым они были получены.
И да, промпты были на русском или английском?
FindAI Автор
Все промпты на русском, кроме Midjourney. В первой версии статьи я вставил промпты, но ее объем увеличился до неприличного размера + 20к символов.