Перейти к содержимому

Nano Banana Pro и Gemini картинки в 2026: разрешение 4K, рендер текста, SynthID

Автор: Silvana · Дата: 31.07.2026 · Verified: 01.09.2026 · Reading time: 12 минут · Prerequisite: 009

Nano Banana Pro — флагманская image-модель Google на базе Gemini 3 Pro, часть общей мультимодальной модели, а не отдельный визуальный проект вроде DALL-E или Imagen. В линейке — Nano Banana Pro (gemini-3-pro-image), Nano Banana 2 (gemini-3.1-flash-image), Nano Banana 2 Lite и legacy Nano Banana. Разрешение до 4K, набор соотношений сторон от 1:1 до 21:9, аккуратный рендер текста в изображении (несколько языков и шрифтов) и невидимый SynthID-водяной знак. Цена API — от $0.0336 за 1K-картинку у Lite до $0.24 за 4K у Pro; Batch API даёт минус 50%.

  • В 2026 Google собрал image-generation под общий бренд Nano Banana. Актуальная линейка: Nano Banana Pro (gemini-3-pro-image), Nano Banana 2 (gemini-3.1-flash-image), Nano Banana 2 Lite (gemini-3.1-flash-lite-image) и legacy Nano Banana (gemini-2.5-flash-image).
  • Nano Banana Pro анонсирован 20 ноября 2025 года. Построен на Gemini 3 Pro — та же reasoning-модель, что и в текстовом Gemini. Отсюда сильная сторона: аккуратный рендер текста в изображении (несколько языков, шрифты, каллиграфия) и генерация infographics с фактами из мира.
  • Разрешение до 4K (у Pro и Flash), у Lite — только 1K. Соотношения сторон: 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9.
  • SynthID watermark встраивается во все изображения Gemini. Невидимый маркер выдерживает кроп, фильтры, компрессию. Проверить можно через сам Gemini или SynthID Detector (пока в early testing).
  • Цена API за одну картинку (verified 31.07.2026, ai.google.dev/pricing): Nano Banana Pro — $0.134 за 1K/2K и $0.24 за 4K. Nano Banana 2 — $0.067 за 1K, $0.101 за 2K, $0.151 за 4K. Nano Banana 2 Lite — $0.0336 за 1K. Batch API — минус 50%. Free tier по API нет.
  • Из РФ: в Gemini App картинки работают у большинства пользователей, детальнее — в разделе «RU-специфика» и в статье «[015] LLM без обхода блокировок из РФ».

Nano Banana — это внутренний кодовый бренд Google DeepMind для image-generation в семействе Gemini. То же, что для OpenAI линейка gpt-image-1 — способ делать картинку прямо внутри мультимодальной модели, а не через отдельный визуальный проект вроде DALL-E или Imagen.

Разница с классическими text-to-image моделями (Midjourney V7, Flux от Black Forest Labs, Stable Diffusion, DALL-E и GPT-image) в подходе. У них image-generation — самостоятельная задача: prompt → диффузионная модель → картинка. У Gemini image-generation — часть общей мультимодальной модели, которая уже умеет читать картинки, рассуждать текстом и понимать реальный мир. Отсюда две сильные стороны:

  1. Рендер текста внутри изображения. Плакат с надписью, инфографика с цифрами, слайд с формулой — модель ставит буквы аккуратнее, чем чисто диффузионные проекты, и в нескольких языках сразу.
  2. Real-world reasoning. Модель знает, что у стула четыре ножки, а у человека две руки. Знает, что если prompt говорит «капитал Франции», нужно нарисовать Париж, а не абстрактный город.

Nano Banana Pro (gemini-3-pro-image), анонсированный 20 ноября 2025, — топовый tier линейки. Строится на Gemini 3 Pro и использует thinking mode: сложные prompts модель сначала «продумывает», делает промежуточные изображения (они видны в бэкенде, но не тарифицируются), потом отдаёт финал. Отсюда лучшее качество композиции и текста, но и более высокая цена и латентность.

По данным ai.google.dev/gemini-api/docs/image-generation и deepmind.google/models:

Продуктовое имяModel IDРазрешениеПозиционирование
Nano Banana Progemini-3-pro-image1K, 2K, 4KStudio-quality, сложные композиции, лучший рендер текста и инфографики
Nano Banana 2gemini-3.1-flash-image1K, 2K, 4KБалансный вариант, «Pro-level generation at Flash speed»
Nano Banana 2 Litegemini-3.1-flash-lite-image512px, 1KСамый быстрый и дешёвый, для массовых сценариев
Nano Banana (legacy)gemini-2.5-flash-imageдо 1024×1024Пионерская модель, Google рекомендует миграцию на 3.1 Lite

Легенда: 0.5K ≈ 512×512, 1K ≈ 1024×1024, 2K ≈ 2048×2048, 4K ≈ 3840×2160 или близко (точные пиксели зависят от aspect ratio).

Названия «Nano Banana» — маркетинговое обёртывание. Разработчики в API работают с model ID через официальные документы, а конечные пользователи в Gemini App просто выбирают уровень «качество / скорость».

Общее для всех:

  • Text-to-image (генерация из prompt).
  • Image editing (правка загруженной картинки через текст: «замени фон на закат», «убери человека справа»).
  • Inpainting / semantic masking (правка отдельного элемента, обсуждаемая в диалоге).
  • Style transfer (перенос стиля).
  • Aspect ratios: 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9.
  • SynthID watermark во всех сгенерированных изображениях.

Специфика по моделям:

  • Multi-image composition. Nano Banana 2 (Flash) поддерживает до 14 reference images в одном запросе. Nano Banana Pro тоже blend до 14 картинок и держит consistency до 5 людей в композиции.
  • Video-to-image. Nano Banana 2 (Flash) — единственная модель линейки, которая принимает видео на вход.
  • Google Search grounding. Flash-модель может привязывать генерацию к результатам поиска Google (актуальная погода, спортивные счёты, свежие данные). Lite этого не умеет.
  • Thinking level control. Flash имеет два уровня: minimal (default, быстрее) и high (медленнее, качественнее). У Pro reasoning всегда включён.

Что важно про Nano Banana Pro отдельно (анонс 20.11.2025)

Заголовок раздела «Что важно про Nano Banana Pro отдельно (анонс 20.11.2025)»

Google выделил четыре фичи Pro как отличие от предыдущей generation:

  1. Enhanced text rendering. «Generate better visuals with more accurate, legible text directly in the image in multiple languages» — цитата из анонса. Модель умеет варьировать шрифты, текстуры, каллиграфию.
  2. Advanced reasoning с фактами. Pro «leverages sophisticated reasoning to create context-rich infographics and diagrams based on the content you provide or facts from the real world».
  3. Consistency controls. Blend до 14 reference images с consistency до 5 людей в композиции.
  4. Creative editing. Localized editing (правка конкретной части), смена aspect ratio, трансформация освещения, регулировка глубины резкости, выход до 4K.

Плюс интеграция с Google Search: можно попросить визуализацию актуальных данных — сегодняшняя погода в конкретном городе, рецепт из свежего источника, результаты спорт-матча.

По данным deepmind.google/technologies/synthid: SynthID — это система невидимых маркеров, встраиваемых в AI-контент от Google. Для изображений маркер закладывается в момент генерации, не влияет на видимое качество и выдерживает базовые модификации (кроп, фильтры, компрессия).

Что важно знать:

  • SynthID добавляется во все изображения Gemini automatically. Отказаться нельзя.
  • Проверить можно двумя путями. Первый: загрузить картинку в Gemini и спросить «Is this generated or altered by Google AI?». Второй: SynthID Detector — отдельный портал, пока в early testing с журналистами и media-профессионалами.
  • Watermark также работает в аудио (Lyria, Notebook LM) и в тексте (через probability scoring).

Практический смысл: если публикуете изображение как «фото» или используете в чувствительном контексте (новости, медицина, юр-документы), понимайте, что оно детектируется как AI-generated. Это плюс для честности и минус, если пытаться выдавать за не-AI.

По ai.google.dev/pricing:

МодельStandardBatch (−50%)
Nano Banana Pro (gemini-3-pro-image) — 1K/2K$0.134$0.067
Nano Banana Pro — 4K$0.24$0.12
Nano Banana 2 (gemini-3.1-flash-image) — 0.5K$0.045$0.0225
Nano Banana 2 — 1K$0.067$0.0335
Nano Banana 2 — 2K$0.101$0.0505
Nano Banana 2 — 4K$0.151$0.0755
Nano Banana 2 Lite (gemini-3.1-flash-lite-image) — 1K$0.0336$0.0168
Nano Banana (legacy) (gemini-2.5-flash-image) — до 1024×1024$0.039$0.0195

Free tier по API image-generation нет. Текст-input тарифицируется отдельно по обычным ставкам соответствующей текстовой модели.

Практическая арифметика: 100 картинок в 4K через Nano Banana Pro — $24. Через Batch — $12. То же количество в 2K — $13.4 standard или $6.7 Batch. Массовая генерация для контента (сотни превьюшек 1K) через Nano Banana 2 Lite — $0.0336 × 500 = $16.8.

Google даёт три способа обращаться к Nano Banana / Gemini image:

  1. Gemini App (gemini.google.com или мобильные приложения) — для конечных пользователей. Free-tier получает ограниченный квот на Nano Banana Pro, платные подписчики — больше. Никаких API-ключей, просто пишешь «нарисуй мне X».
  2. Gemini API (ai.google.dev) — для разработчиков. Endpoint https://generativelanguage.googleapis.com/v1beta/interactions, authentication через header x-goog-api-key. Формат response указывается через type: "image", mime_type, aspect_ratio, image_size.
  3. Google AI Studio (aistudio.google.com) — визуальная песочница для разработчиков. Можно тестировать prompts без кода, потом забрать готовый snippet.

Отдельно: Nano Banana Pro интегрирован в Google Ads глобально (для рекламных креативов), Workspace (Slides и Vids), Flow (проект для фильммейкеров) и Vertex AI / Antigravity для enterprise.

Сравнение с OpenAI (см. «[026] GPT-image и другие визуальные модели OpenAI 2026» для деталей другой стороны):

ПараметрNano Banana ProGPT-image-1 / DALL-E-класс
Разрешениедо 4Kдо 1024×1024 (для gpt-image-1 базовый)
Рендер текстасильная сторона, несколько языковобычно слабее, длинный текст ломается
Reasoning в генерацииthinking mode, real-world facts, интеграция с Google Searchreasoning есть, но без grounding в search
Watermarkобязательный SynthID (invisible)C2PA metadata (можно strip)
Blend refsдо 14 картинок, до 5 лиц consistencyзависит от режима, обычно меньше
Aspect ratios10 стандартных3 основных (1024×1024, 1792×1024, 1024×1792)
Цена за 4K$0.24 standard4K нативно нет

Итог: Nano Banana Pro сильнее для сценариев с текстом в кадре (плакаты, инфографика, слайды), для высокого разрешения и для интеграции с фактами реального мира. GPT-image комфортнее для быстрой генерации без специфических требований и когда важна экосистема ChatGPT.

Когда выбирать Nano Banana Pro:

  • Инфографика с точным текстом.
  • Плакаты, слайды, обложки с надписями.
  • Композиция с несколькими людьми и требованием сохранить их узнаваемость.
  • Требуется 4K на выход.
  • Нужна привязка к real-world фактам через Google Search.
  • Работа в экосистеме Google (Ads, Slides, Vids, Workspace).

Когда выбирать GPT-image / DALL-E-класс:

  • Уже работаешь в ChatGPT и не хочешь мигрировать.
  • Задача — иллюстрация без текста в кадре.
  • Быстрые итерации в chat-режиме без API.
  • Нужна интеграция с DALL-E API из существующего проекта на OpenAI SDK.

Когда выбирать Midjourney или Flux вместо любого из них:

  • Художественный стиль важнее, чем reasoning.
  • Нужна максимальная художественная свобода и эстетика.
  • Работа в узкой стилистической нише (fine-art, эстетика конкретной школы).
  • Готов к более крутой кривой обучения prompt-инжиниринга (специальные параметры, weights).

Модель обучена на «естественный язык». Работает conversational: можно писать длинный prompt с контекстом, потом уточнять reply-командами в диалоге. Это принципиально отличает опыт от Midjourney или Flux, где prompt — короткий набор ключевых слов, разделённых запятыми. Gemini понимает связный текст с предложениями, а короткий keyword-стиль часто дает менее предсказуемый результат.

Что работает лучше:

  • Композиция и позиции. «На переднем плане слева — X, справа сзади — Y, фон — Z». Модель хорошо парсит пространственные отношения, если их описать словами.
  • Стиль явно. «В стиле watercolor», «flat vector illustration», «cinematic 35 mm photo», «isometric 3D render». Указание стиля в первом предложении задаёт весь дальнейший результат.
  • Свет и настроение. «Мягкий утренний свет», «harsh noon shadow», «neon night», «overcast Nordic ambiance». Освещение — один из сильных рычагов для тона.
  • Aspect ratio указан в API. Через параметр aspect_ratio, не только в prompt (хотя prompt тоже читается). При API-вызове параметр приоритетнее текстовой подсказки.
  • Референсы прикреплять. До 14 картинок как reference — модель возьмёт из них стиль, композицию, лица. Reference-based generation обычно даёт более controllable результат, чем чистый text-to-image.
  • Iterative editing. Не всё описывать в одном prompt. Сгенерировать → написать «замени фон на закат» → «добавь птицу справа» → «убери человека сзади». Conversational-режим позволяет пошагово доводить картинку до нужного.
  • Указывать негатив. «Без градиентов», «без людей в кадре», «избегай неоновых цветов» — модель уважает negative-constraints, если они сформулированы явно.
  • Материалы и текстуры. «Матовая керамика», «brushed metal», «old paper texture» — модель хорошо рендерит материалы, если их прописать.

Что часто ломается:

  • Длинные надписи на русском — Pro справляется лучше Flash, но всё равно перепроверяй буквы. Особенно уязвимы редкие сочетания (ъ, ы) и заглавные лигатуры.
  • Очень мелкие детали в композиции (микро-текст на этикетках, часы с точным временем, номерные знаки).
  • Стилизации редких художественных школ — модель обычно подставляет что-то ближайшее. Условная «поздняя ленинградская графика» без референса даст просто графику без школы.
  • Точные пропорции реальных объектов (архитектурные элементы, инженерные схемы) — модель может дать эстетически красивый, но технически неверный результат.
  • Множественные лица в одной сцене с сохранением индивидуальных черт — Pro держит до 5 людей consistency, но чем больше, тем выше риск размытия.

Пример prompt для Nano Banana Pro:

Инфографика в flat vector стиле, соотношение 4:5.
Заголовок сверху: "AI в маркетинге 2026" (крупный жирный шрифт).
Три блока горизонтально:
1. Иконка мозга + подпись "Стратегия"
2. Иконка кисти + подпись "Креатив"
3. Иконка графика + подпись "Аналитика"
Палитра: синий, белый, coral accent.
Внизу мелкая надпись: "Источник: DeepMind, 2026".
Без градиентов, чистая типографика.

Пример editing-prompt поверх готовой картинки:

Возьми это изображение и:
1. Замени фон на пастельный градиент от синего к розовому.
2. Убери всех людей на заднем плане.
3. Смени соотношение сторон на 9:16 (для Stories и Reels).
4. Добавь мягкое утреннее освещение, чуть тёплый оттенок.
Сохрани центральную фигуру и цвет её одежды.

Пример multi-reference prompt (blend 3-5 картинок):

Собери композицию по референсам:
- Из reference 1 — общая цветовая палитра.
- Из reference 2 — тип освещения (боковой мягкий свет).
- Из reference 3 — стиль иллюстрации (flat vector).
Сюжет: рабочий стол с ноутбуком, чашка кофе, растение в горшке.
Соотношение 3:2, 2K.

Google применяет свои safety policies. Модель откажется генерить:

  • Реалистичный контент с реальными публичными людьми в компрометирующих ситуациях.
  • Насилие, hate speech, explicit sexual content.
  • CSAM (никогда, ни в каком виде).
  • Медицинские рецепты и procedures как «инструкцию».
  • Copyrighted characters в некоторых случаях (Disney, крупные бренды).

Отказ обычно приходит как ответ модели с объяснением. При работе через API можно получить error с safety-категорией. Стратегия обхода: переформулировать prompt в более общих терминах, использовать generic описания вместо конкретных имён.

  • Работает из РФ. Gemini App (gemini.google.com) в базовой форме открывается из РФ, генерация Nano Banana работает у большинства пользователей на free-tier. Иногда бывают ограничения по региону — тогда доступ через зарубежный account без обхода. Полная карта — «[015] LLM без обхода блокировок из РФ».
  • Google AI Studio и Gemini API. aistudio.google.com и API работают из РФ. Регистрация account требует зарубежного номера или Google account с зарубежной привязкой. Для production API нужен billing account.
  • Оплата. Google Cloud (через который биллинг API) не принимает российские карты. Пути: зарубежная карта (казахстанская, армянская, узбекская, грузинская, турецкая), корпоративный аккаунт через посредника. Детали — «[016] Как оплачивать AI-подписки из РФ».
  • Российские альтернативы для image-generation. YandexART (yandex.cloud/services/yandexart) — единственная сопоставимая русская text-to-image модель. Отдельная статья — «[013] YandexGPT vs GigaChat» покрывает текстовую часть, image-часть у Яндекса отдельно на портале AI Studio Yandex Cloud. Kandinsky от Sber тоже жив (kandinsky.ai) с бесплатным доступом, но качество и рендер текста хуже, чем у Nano Banana Pro.
  • SynthID и российский контекст. SynthID работает независимо от геолокации. Если сгенерированное изображение публикуется в РФ и вопрос «AI это или нет» имеет юр-значение (реклама, медиа), помни: watermark detectится через сам Gemini или SynthID Detector (пока early testing). Российские сервисы своих детекторов SynthID не имеют.
  • Просить точный текст на латинице И кириллице в одном изображении. Иногда путается. Лучше разбить на два прохода: сначала латиница, потом добавить кириллицу через editing.
  • Забывать про SynthID. Watermark всегда есть. Не пытаться выдать изображение за не-AI в контекстах, где это критично.
  • Использовать Nano Banana 2 Lite для инфографики с текстом. Lite экономный, но текст рендерит хуже. Для инфографики — Nano Banana Pro.
  • Генерить 4K, когда достаточно 1K. Разница в цене в 3-4 раза. Если картинка идёт в соцсети или на веб — 1K или 2K обычно хватает.
  • Игнорировать Batch API. Если генеришь пачками (50+ картинок), Batch даёт минус 50% к цене. Задержка отдачи — до 24 часов.
  • Не указывать aspect ratio в API. Модель сгенерит default (обычно 1:1). Если нужен 9:16 для Reels — указать явно.

В чём разница между Nano Banana Pro и Nano Banana 2? Pro (gemini-3-pro-image) — топовый tier с thinking mode всегда включённым, лучший рендер текста, лучшая композиция для сложных сцен. Дороже: $0.134 за 1K/2K вместо $0.067. Nano Banana 2 (gemini-3.1-flash-image) — балансный, быстрее, дешевле, но качество композиции и текста ниже. Для массовой генерации и типовых задач — Nano Banana 2. Для сложных финалов, инфографики, плакатов — Pro.

Что значит «Nano Banana» в названии? Внутренний кодовый бренд Google DeepMind, под которым собраны все image-модели в семействе Gemini. Формальные model ID — это gemini-3-pro-image, gemini-3.1-flash-image и так далее. «Nano Banana Pro» — маркетинговое имя для gemini-3-pro-image.

Можно ли отключить SynthID watermark? Нет. Все изображения, сгенерированные через Gemini (App, API, AI Studio, Vertex AI), автоматически получают SynthID watermark. Отказаться от него нельзя.

Как обнаружить SynthID watermark в изображении? Два способа. Первый — загрузить картинку в Gemini и спросить, было ли изображение сгенерировано или отредактировано Google AI. Второй — SynthID Detector, отдельный портал от Google DeepMind, пока в early testing (доступен ограниченному кругу журналистов и media-профессионалов).

Работает ли Nano Banana Pro из РФ? Gemini App (gemini.google.com) в базовой форме работает у большинства пользователей из РФ. Иногда доступ ограничен по региону — тогда нужно решать через зарубежный account. Gemini API и AI Studio работают, но регистрация account требует зарубежного Google account и биллинга — российские карты не принимаются. Детали в статье «[015] LLM без обхода блокировок из РФ».

Сколько стоит одна картинка в 4K через Nano Banana Pro? $0.24 через Standard API, $0.12 через Batch API (задержка до 24 часов). За 100 картинок в 4K — $24 или $12 соответственно.

Есть ли free tier у Gemini API для image-generation? Нет. Все три модели (Pro, Flash, Flash Lite) тарифицируются от первой картинки. Free-tier доступен в Gemini App для конечных пользователей — с ограниченным квотом на Nano Banana Pro.

Умеет ли Nano Banana Pro генерить видео? Nano Banana Pro генерит изображения, не видео. Nano Banana 2 (Flash) может принимать видео на вход как reference, но выдаёт всё равно картинку. Для видео у Google отдельная линейка — Veo (в статье про мультимодал «[009]» покрыто отдельно).

Как выбрать между Pro, Flash и Lite? Правило: Lite — черновики и thumbnails 1K. Flash — балансное большинство задач, включая 4K, editing и multi-image blend. Pro — финалы, где важен текст в кадре, инфографика, композиция с несколькими людьми consistency, 4K premium-качества.

Есть ли ограничения на копирайтные персонажи и стили? Да. Модель откажется от реалистичных изображений публичных людей в компрометирующих ситуациях, от контента с CSAM, насилием, hate speech. Copyrighted characters (Disney и подобные) usually блокируются. Стратегия при отказе — переформулировать prompt в более общих терминах.

Что делать, если Nano Banana неправильно рендерит русский текст? Первый шаг — попробовать Nano Banana Pro, а не Flash или Lite: Pro существенно лучше держит кириллицу и мелкий текст. Второй — уменьшить количество текста в кадре: одно ключевое слово надёжнее, чем длинная фраза. Третий — использовать editing pass: сгенерировать без текста, потом отдельным prompt попросить добавить конкретную надпись.

Актуально на 31.07.2026. Модели, цены, доступ и функциональность в Gemini App и API меняются часто. Nano Banana Pro (gemini-3-pro-image) анонсирован 20 ноября 2025. Перед бизнес-решением сверяйся с первоисточниками — все ссылки в разделе Sources ниже.