
Google выпустила Nano Banana 2.1 и обещает улучшения «по всем фронтам»: качество, текст в кадре, консистентность персонажей при многократном редактировании, инфографика. Я прогнал три одинаковых промпта через Nano Banana 2 и 2.1 и посчитал результаты по чек‑листу. Новая версия выиграла не там, где обещали.
Сразу оговорюсь про масштаб: это не бенчмарк. Три задачи, по одному прогону на модель, один оценщик. Такой прогон показывает, где искать разницу, а не измеряет её. Числа Google я привожу отдельно, и отдельно отмечаю: независимых замеров на 8 октября 2026 года нет, все издания о релизе ссылаются на одну таблицу разработчика.
Короткий ответ
Текст в кадре: обе отрисовали кириллицу и цифры чисто, но двойка выполнила задание точнее — 10 пунктов из 10 против 9. Единственный пункт, который потеряла 2.1, — лишнее слово, которого в промпте не было.
Инфографика: ничья по фактам. Восемь подписей из восьми, восемь попаданий выносок из восьми у обеих. Вёрстка аккуратнее у 2.1, зато заголовок, которого я не просил, появился только у неё.
Сцена из трёх персонажей: чище здесь 2.1 — ни одной лишней детали, приметы розданы верно.
Самое интересное: главный пункт релиза, рост точности инфографики с 0,179 до 0,521, на одной схеме не виден. Обе версии сделали её без фактических ошибок.
Что за модель и что в ней заявлено
Nano Banana 2.1 — обновление Nano Banana 2, о котором Google сообщила 6 октября 2026 года. Обе модели из линейки Flash: 2.1 работает на Gemini 3.6 Flash, двойка — на Gemini 3.1 Flash Image. Флагманская Nano Banana Pro осталась на Gemini 3 Pro Image. Дальше только о первых двух: 2.1 вышла как замена двойки, а не как отдельная линейка.
Что заявлено в карточке модели и материалах Google:
улучшение качества изображения и реализма на всех поддерживаемых разрешениях;
улучшение отрисовки текста и вёрстки инфографики;
консистентность персонажей и объектов при многократном редактировании, то есть в нескольких шагах подряд;
широкие панорамы и соотношения сторон до 8:1;
до 14 референсных изображений в одном запросе, с сохранением до четырёх персонажей и десяти объектов;
обращение к поиску Google, когда модель изображает реально существующие объекты;
уровни рассуждения minimal, medium и high, где medium стоит по умолчанию;
редактирование по маске: пользователь выделяет область, и меняется только она.
Из всего списка практичнее прочего выглядит маска. В интерфейсе Gemini она мелькала ещё в марте, но рабочей функцией стала только сейчас, и у двойки её в таком виде нет. В моём тесте маска не проверялась: все три задачи были про генерацию с нуля.
Сравнить версии напрямую по параметрам можно так:
Параметр |
Nano Banana 2 |
Nano Banana 2.1 |
|---|---|---|
Базовая модель |
Gemini 3.1 Flash Image |
Gemini 3.6 Flash |
Разрешения |
1K, 2K, 4K |
1K, 2K, 4K |
Соотношения сторон |
в релизе 2.1 не сопоставлены |
до 8:1 |
Референсные изображения |
в релизе 2.1 не сопоставлены |
до 14 изображений; до 4 персонажей, до 10 объектов |
Обращение к поиску |
веб‑поиск |
поиск Google |
Уровни рассуждения |
minimal и high |
minimal, medium (по умолчанию), high |
Редактирование по маске |
есть |
заявлено как ключевое улучшение |
Числа, которые привёл сам Google
Это тесты разработчика: сравнение пар изображений живыми оценщиками, результат в баллах Elo, плюс отдельная автооценка фактической точности инфографики. С Elo её сравнивать нельзя, шкала другая, от 0 до 1.
Тест |
2.1 (с рассуждением) |
2.1 (без) |
Nano Banana 2 |
Nano Banana Pro |
|---|---|---|---|---|
Текст → изображение, общее предпочтение |
1050 |
1015 |
990 |
935 |
Дизайн инфографики |
1048 |
1001 |
961 |
912 |
Фактическая точность инфографики (0–1) |
0,521 |
0,328 |
0,179 |
0,265 |
Общее редактирование |
1026 |
980 |
938 |
939 |
Консистентность одного персонажа |
1028 |
1021 |
981 |
991 |
Консистентность нескольких персонажей |
1106 |
1068 |
978 |
1011 |
Редактирование по маске |
1049 |
1042 |
965 |
927 |
Консистентность продукта |
1024 |
981 |
955 |
965 |
Редактирование по нескольким референсам |
1066 |
1041 |
988 |
989 |
Из таблицы видно две вещи, и вторая важнее первой. Flash‑модель обошла собственную Pro‑версию по всем строкам, а это против привычного порядка: обычно младшая линейка догоняет флагман, а не обгоняет. И самые крупные отрывы там, где речь не про красоту, а про дисциплину, — консистентность нескольких персонажей и точность инфографики.
Тут нужна остановка. Независимых прогонов этих чисел на 8 октября 2026 года нет. The Decoder, Notebookcheck и Unite.AI пересказывают одну и ту же таблицу Google, а Notebookcheck пишет прямым текстом: «Independent tests are not yet available». Всё, что попадалось у сторонних авторов, — сравнения на нескольких промптах без методологии и без счёта. Поэтому дальше я проверяю не числа, а три вещи, которые из них следуют.
Как я сравнивал
Промпты одинаковые дословно, по одному прогону на задачу для каждой модели. Генерации — в SYNTX, где обе модели лежат в одном интерфейсе: так один и тот же текст задания уходит двум версиям без переключения между сервисами и без правок по памяти.
Оценка — чек‑лист «да/нет», без шкал. Пункты двоичные: подпись совпадает посимвольно или нет, выноска попадает в деталь или нет.
Оценщик один — я. Сравнение не было слепым, я знал, где какая модель, поэтому в отчёте нет «нравится больше», только то, что можно перепроверить по картинкам.
Разрешение и уровень рассуждения я не выставлял и не сверял, отдаёт ли их интерфейс. По этим двум параметрам условия неизвестны. Это пункт для проверки, а не факт.
Время генерации не замерял. О скорости здесь не будет ничего.
Тест 1. Текст в кадре: кириллица и цифры
Проверял то, что ломается чаще всего и при этом легко считается: точное воспроизведение надписей. Задача — панель мониторинга сервера с русскими подписями, десятичными дробями и логом моноширинным шрифтом.
Сгенерируй изображение: скриншот панели мониторинга сервера, тёмная тема, 16:9. Заголовок страницы, точный текст: «Кластер: prod-moscow-1» Три плитки с метриками, подпись и значение в каждой: 1) «Загрузка CPU» — 78,4 % 2) «Свободно на диске» — 1,2 ТБ 3) «Задержка p95» — 247 мс Под плитками лог из четырёх строк, моноширинный шрифт: [12:04:11] INFO workers=16 queue=0 ok [12:04:19] WARN retry=2 node=eu-3 [12:04:26] ERROR timeout=30s shard=7 [12:04:31] INFO recovered Других надписей нет. Кириллица и латиница — ровно так, без искажений.

Пункт |
Nano Banana 2 |
Nano Banana 2.1 |
|---|---|---|
Заголовок «Кластер: prod‑moscow-1» |
да |
да |
«Загрузка CPU» и 78,4% |
да |
да |
«Свободно на диске» и 1,2 ТБ |
да |
да |
«Задержка p95» и 247 мс |
да |
да |
Четыре строки лога целиком |
4 из 4 |
4 из 4 |
Лишних надписей нет |
да |
нет: добавила «онлайн» |
Символы не искажены, латиница читается как латиница |
да |
да |
Итого |
10 из 10 |
9 из 10 |
Разница в одну строку, не критично, но не в пользу новой версии. Двойка сделала ровно то, что просили, простыми средствами. Зато у 2.1 аккуратнее собрана сама имитация интерфейса: уровни INFO, WARN и ERROR различаются по цвету, колонки выровнены, в плитках появились иконки и мини‑графики. Вместе с ними пришло лишнее слово «онлайн» и пустое поле внизу кадра, примерно треть высоты.
Из‑за этой строки я и не пишу, что 2.1 лучше работает с текстом. По инструкции «других надписей нет» двойка прошла, а 2.1 — нет.
Тест 2. Инфографика с проверяемым фактом
Здесь заявлен самый большой отрыв: фактическая точность инфографики выросла почти втрое. Проверять такое нужно там, где у картинки есть правильный и неправильный ответ. Я взял схему материнской платы: у ATX стандартное расположение элементов, и выноска либо попадает в деталь, либо нет.
Сгенерируй учебную схему-инфографику: материнская плата формата ATX, вид сверху, светлый фон, подписи на русском. Восемь выносок ровно на эти элементы: 1) сокет процессора 2) слоты DIMM 3) 24-контактный разъём питания 4) чипсет 5) порты SATA 6) слот PCIe x16 7) разъём M.2 8) батарейка CR2032 Каждая выноска указывает на нужную деталь и на её правильное место на плате. Слоты DIMM — справа от сокета, 24-контактный разъём питания — справа по кромке. Стиль: аккуратный технический рисунок, без фотографизма. Других подписей нет.

Пункт |
Nano Banana 2 |
Nano Banana 2.1 |
|---|---|---|
Подписи 1–8 дословно |
8 из 8, но все с заглавной буквы |
8 из 8, регистр как в промпте |
Выноски указывают на нужный элемент |
7 из 8 |
8 из 8 |
Лишних подписей нет |
да |
нет: добавила заголовок «Материнская плата формата ATX» |
Выноски не пересекают друг друга и соседние детали |
нет: одна тянется через соседний слот |
да |
Стороны не перепутаны: DIMM справа от сокета, питание у правой кромки |
да |
да |
По фактам здесь ничья: все восемь элементов на местах, все восемь подписей корректны, включая «24-контактный разъём питания» с дефисом. Путаницы лево‑право, которой обычно грешат генеративные модели, не было ни разу ни у одной.
Разошлось оформление. У 2.1 связи не наезжают друг на друга и регистр сохранён. У двойки одна выноска идёт через соседний элемент, одна ошибочно указывает на неверный элемент, а все восемь подписей она начала с заглавной буквы. Зато 2.1 второй раз подряд дописала то, чего не просили: заголовок, притом что в промпте стояло «других подписей нет».
Что это значит для заявленных 0,521 против 0,179. На одной схеме такой разрыв не воспроизводится: обе версии фактически корректны. Может быть, дело в сложности, и на схемах с длинными подписями и десятками элементов разница проявилась бы. Проверить это можно только отдельным тестом, и одного кадра для вывода о трёхкратном росте мало. Ни подтверждать, ни опровергать числа Google я по этому кадру не стану.
Тест 3. Три персонажа в одном кадре
Самый большой отрыв в таблице Google — консистентность нескольких персонажей, 1106 против 978. В чистом виде это про редактирование, где одна сцена меняется шаг за шагом. У меня один кадр, так что я взял ближайшее доступное: три персонажа с разными приметами в четырёх панелях одной картинки. У каждого ровно одна яркая деталь, и если модель её теряет или меняет местами, это видно сразу.
Сгенерируй одно изображение: сетка 2×2 из четырёх панелей одинакового размера. В каждой панели одни и те же три персонажа, все трое видны: — Марк: короткая стрижка, чёрная борода, шеврон на левом рукаве с текстом «СЛУЖБА 412» — Ирина: длинные светлые волосы, тонкий шрам над левой бровью — Лена: рыжие волосы, круглые очки, механические часы на левом запястье Позы по панелям: 1) все стоят у стола; 2) все сидят за ноутбуками; 3) Марк и Лена смотрят на экран, Ирина пишет на доске; 4) все пьют кофе. Фон — одна и та же лаборатория во всех четырёх панелях, ракурс немного разный. Никаких других надписей, кроме текста на шевроне.

Что смотрел |
Nano Banana 2 |
Nano Banana 2.1 |
|---|---|---|
Стиль по умолчанию |
рисованный, ближе к комиксу |
фотографический |
Лена: рыжие волосы, очки, часы на левом запястье |
4 панели из 4 |
4 из 4 |
Марк: шеврон на левом рукаве |
4 из 4 |
4 из 4 |
Ирина: длинные светлые волосы в одинаковом виде |
да |
да |
Ирина: шрам над левой бровью |
3 из 4, положение смещается, пропал на последнем кадре |
4 из 4, положение слегка смещается, не виден на кадре со спины |
Текст на шевроне читается |
нет |
нет |
Лишние детали, которых не было в промпте |
одна (деталь у Марка во второй панели) |
нет |
Один и тот же фон во всех панелях |
да |
да |
Здесь 2.1 выглядит сильнее. Лишнего она не добавила: ни посторонних предметов, ни деталей одежды, а вот во второй панели двойки такой элемент появляется. Приметы розданы верно: никто из персонажей не обменялся очками или бородой, а шрам у Ирины держится в трёх панелях из четырёх, где лицо вообще видно. По положению он слегка смещается, но не исчезает.
Дальше оговорка, без которой вывод будет неверным. В промпте не задан стиль, и модели взяли свои настройки по умолчанию: двойка ушла в рисованную манеру, 2.1 — в фотографическую. Реализм в этом тесте сравнивать нельзя, сравнились настройки, а не способности. В итоговую таблицу фотореализм не идёт.
И второе: надпись «СЛУЖБА 412» на шевроне не читается до конца ни у одной модели. В третьей панели, где рука крупнее, она ближе к нужному, но буквы всё равно плывут. Ту самую слабость с мелким текстом, которую Google признаёт в карточке, обе версии показывают одинаково охотно.
Что получилось в сумме
Что проверял |
Nano Banana 2 |
Nano Banana 2.1 |
|---|---|---|
Текст в кадре (10 пунктов) |
10 из 10 |
9 из 10 |
Инфографика: подписи |
8 из 8 |
8 из 8 |
Инфографика: попадание выносок |
7 из 8 |
8 из 8 |
Инфографика: лишние подписи |
нет |
есть |
Инфографика: пересечения выносок |
есть |
нет |
Сцена: лишние детали |
одна |
нет |
Сцена: сохранение примет персонажей |
без грубых ошибок |
без грубых ошибок |
Вывод получился не тот, что подсказывает релизная таблица. По трём задачам 2.1 ни разу не проиграла в аккуратности внутри кадра и ни разу не выиграла там, где решает точное следование заданию. Обе её особенности, чистая вёрстка и реалистичная подача по умолчанию, идут в одной упряжке с привычкой добавлять от себя. В тесте 1 это лишнее слово, в тесте 2 — лишний заголовок. Двойка оба раза просто сделала, что просили.
Есть и другое объяснение, и я не могу его отбросить. То, что я записал в лишнее, может быть работой уровня рассуждения medium, которого у двойки нет. Модель, которая больше думает о вёрстке, охотнее достраивает интерфейс до правдоподобного. Проверить это можно прогонами на minimal и high, чего я не делал.
Где ломается: что Google называет сама
Самое полезное в карточке модели — список ограничений, который разработчик приводит сам. Границы лучше официального признания не покажет никакой тест. Google готова признать следующее:
мелкий текст размывается, особенно на разрешении 1K;
длинные абзацы и текст во всю страницу даются нестабильно;
облик персонажа не всегда совпадает с референсом;
редактирование по маске иногда выполняет только часть инструкции и сохраняет исходную позу;
модель путает лево и право;
ограничены знания о мире, трёхмерные рассуждения и распознавание фактов;
возможны галлюцинации, а также периодические замедления и таймауты.
Первые три пункта совпали с тем, что я видел своими глазами: нечитаемый шеврон — это мелкий текст, а «онлайн» и заголовок — та же область, где модель достраивает контекст вместо того, чтобы следовать заданию. Четвёртый, про маску, стоит держать в голове: это самая интересная функция 2.1 и единственная, до которой у меня не дошли руки.
Что этот тест не показывает
Скорость. Время генерации не замерял, поэтому ничего о ней не утверждаю.
Трёхкратный рост точности инфографики. Одна схема из восьми элементов — слишком простой случай, чтобы разрыв 0,179 против 0,521 проявился.
Редактирование по маске и многократные правки. А это как раз то, что 2.1 заявляет главным улучшением.
Работу с референсными изображениями и лимит в 14 картинок. Не проверял вообще.
Воспроизводимость. Один прогон на задачу не отделяет свойство модели от случайности. Текст в кадре у генеративных моделей ломается как повезёт: три прогона одной задачи могли бы дать другую картину.
Уровни рассуждения. Разницу между minimal, medium и high я не измерял, хотя именно medium теперь стоит по умолчанию и мог повлиять на результат.
Попробовать на одной задаче
Все три промпта выше можно прогнать самому. Обе версии, Nano Banana 2 и Nano Banana 2.1, есть в SYNTX.AI наравне с остальной линейкой, и одно и то же задание уходит им подряд, без переписывания под каждую. Для читателей Хабра работает промокод CTRLAI: скидка 20% на любой тариф.
Комментарии (20)

Revertis
08.10.2026 11:09Коротко: скорее всего, основной текст написан ИИ, а человек сгенерировал картинки и поправил отдельные места. Доказать это на 100% нельзя, надёжных детекторов не существует. Но признаков много, и самые сильные из них логические, а не стилистические.
Текст противоречит сам себе. Это главный аргумент:
В «Коротком ответе» сказано, что по инфографике у обеих моделей 8 попаданий выносок из 8. В таблице теста и в итоговой таблице у Nano Banana 2 стоит 7 из 8. В разборе теста одновременно написано «все восемь элементов на местах» и «одна ошибочно указывает на неверный элемент».
В выводе сказано, что двойка «оба раза просто сделала, что просили». Но во втором тесте она же изменила регистр всех подписей и промахнулась одной выноской.
Шрам Ирины у 2.1: в таблице «4 из 4» и тут же «не виден на кадре со спины». В тексте: «держится в трёх панелях из четырёх».
Редактирование по маске: в таблице параметров у двойки «есть», а в тексте «у двойки её в таком виде нет».
Автор пишет, что первые три ограничения из карточки Google совпали с его наблюдениями. Но второе и третье (длинные абзацы и сходство с референсом) в его тестах вообще не проверялись.
Так обычно выглядит процесс «модель пишет черновик, человек смотрит на картинки и правит отдельные ячейки, а остальной текст не трогает». Автор, который сам считал выноски, вряд ли поставил бы в резюме цифру, которая расходится с его же таблицей.
Стиль. Конструкция «не X, а Y» повторяется очень часто: «показывает, где искать разницу, а не измеряет её», «не про красоту, а про дисциплину», «сравнились настройки, а не способности», «пункт для проверки, а не факт». Есть типичные риторические заходы: «Из таблицы видно две вещи, и вторая важнее первой», «Тут нужна остановка», «Дальше оговорка, без которой вывод будет неверным». Много подчёркнуто аккуратных оговорок, есть отдельный раздел «Что этот тест не показывает», шаблонный «Короткий ответ» в начале. Так пишут современные языковые модели, честно говоря, в том числе и я. Дата «на 8 октября 2026 года» повторяется дважды, как будто её проставил агент, который собирал источники.
Тире. В основном тексте везде стоит дефис с пробелами, а внутри промптов нормальное длинное тире «—». Похоже, что тире в теле статьи заменили массово. Это частый приём, чтобы текст меньше походил на ИИ. Признак косвенный, не доказательство.
Что похоже на работу человека. Картинки действительно сгенерированы. Подписи под ними явно добавлены вручную: в них опечатка «NANA Banana» и пометка «1:1 1K». При этом первый промпт просил 16:9, а в тексте сказано, что разрешение автор не выставлял. И контекст: это корпоративный блог агрегатора нейросетей с промокодом в конце, то есть контент-маркетинг, где тексты обычно пишут на потоке.
Итог: вероятнее всего, это ИИ-генерация с человеческой доработкой тестов и таблиц, а не авторский текст. Сами прогоны выглядят настоящими, но выводы в тексте местами не сходятся с собственными данными статьи. Поэтому таблицам я бы верил больше, чем прозе.

Acuna
08.10.2026 11:09Но ведь ваше "расследование" тоже скопированный текст нейронки, поэтому кто действительно пользовался нейронкой вопрос открытый. Так что как говорится грехи других судить вы так усердно рветесь, начните со своих, и до чужих не доберетесь. Шекспир.

qyix7z
08.10.2026 11:09модель путает лево и право
В этой статье все модели путают лево и право. Как генераторы картинок, так и генератор текста. Шеврон в 3 случаях из 4 на правом рукаве.

Xo4y_3uMy
08.10.2026 11:09Там не только шеврон.
И шрам тоже скачет лево/право у обоих моделей, а часы скачут у двойки.

Wesha
08.10.2026 11:09

ZamirHa
08.10.2026 11:09С кофепитием интересно - у 2 у всех по бумажному стаканчику плюс непонятно чья дымящаяся кружка за спиной мужика, у 2.1. два пустых бумажных стаканчика на столе, непонятно чьи.
И такое впечатление, что в лаборатории у 2 аж две кофеварки (при том, что у всех стаканчики из автомата)))))

Tdaa1
08.10.2026 11:09Гонять генеративку по 1 разу... Ну это даже не сравнение. На втором прогоне они могут полностью поменяться местами. На третьем снова переобуться.
"Других подписей нет" обе модели выполнили требование. Не добавлять "НАДписи" и заголовок условия не было...

Realauto23
08.10.2026 11:09ChatGpt 6


Wesha
08.10.2026 11:09А почему стрелочка "разъём М.2" указывает на карту М.2 (хотя должна — на разъём)?

ifap
08.10.2026 11:09Т.е. 5 слотов DIMM Вас не смутили?

edogs
08.10.2026 11:09Ради интереса погуглили:)
Во-первых, были платы с dimm.2 - м.2 слот в размерности/формате димм. Вот как тут pd.png (890×1016) или тут https://c.dns-shop.ru/thumb/st4/fit/wm/0/0/82368eab63a0b35dd50835a5035fdafc/318cf5f6b58874d06bb9002520fa2b35329b83b91f58424710928dad7dfb606d.jpg.webp (1 слот димм.2 справа от 4 диммов под память). Или как тут c1.neweggimages.com/productimage/nb1280/ADDZS25012104IWSQ77.jpg (2 димм и 1 димм.2 чуть справа).
Во-вторых, в переходный период были платы с 4dimm+1sdr или 2dimm+3sdr, вот как тут asus_a7a266-e_gal4.jpg (1600×1200) , 3 sdr и 2 dimm.
В общем чисто теоретически нечетное количество слотов "димм" может объяснятся тем, что они не все димм. Правда не удалось найти ни одного варианта где их ставили так же плотно, но все же.

Wesha
08.10.2026 11:09Меня там овердофига чего смутило. Например, то, что вообще-то
у 24-контактного разъёма питания отверстия ни разу не все квадратные.

(и у этого есть глубокий смысл)
Но это ж [теперь] объяснять надо.
dronperminov
Но на левом рукаве нет шеврона, но почему-то есть на правом...
grandkarabas
Есть еще куда расти...
Wesha
А у Лены часы прыгают с одной руки на другую...