DALL-E и GPT-image в 2026: как генерировать картинки в ChatGPT (промпты, стили, лимиты)
Автор: Silvana · Дата: 31.07.2026 · Verified: 01.09.2026 · Reading time: 18 минут · Prerequisite: Базовое понимание что такое OpenAI и API
DALL-E и GPT-image 2026: как генерировать картинки в ChatGPT — гид
Заголовок раздела «DALL-E и GPT-image 2026: как генерировать картинки в ChatGPT — гид»Картинки в ChatGPT в 2026 генерирует уже не DALL-E, а мультимодальная модель gpt-image-2 — флагман OpenAI по изображениям. «DALL-E» осталось как бренд для конечного пользователя, но в API работает семейство gpt-image (1, 1.5, 2). Ниже — как устроена генерация, чем gpt-image-2 отличается от Nano Banana Pro и Midjourney V7, как писать промпт под задачу, что доступно на тарифах ChatGPT и как получить доступ из РФ.
Ты слышал про DALL-E — модель OpenAI, которая делала картинки по тексту. За 2023–2025 годы вся линейка перестроилась: сначала DALL-E 3 встроили в ChatGPT, потом появился нативный мультимодальный gpt-image-1, а на 2026 год флагман — gpt-image-2. Название «DALL-E» ушло из API, но осталось как бренд внутри ChatGPT для обычного пользователя.
Разберём что реально работает сейчас, сколько стоит, что умеет и как этим пользоваться из РФ.
Что такое DALL-E и откуда взялось название
Заголовок раздела «Что такое DALL-E и откуда взялось название»DALL-E — линейка text-to-image моделей OpenAI, названная в честь мультипликационного робота WALL-E и художника Сальвадора Дали. Первый релиз был в январе 2021 года как research-модель. Публичного API у неё не было.
DALL-E 2 вышел в апреле 2022 и стал первой массовой моделью OpenAI для картинок с API-доступом. Умел генерировать 256×256, 512×512, 1024×1024. Поддерживал редактирование через маску (inpainting) и генерацию вариаций от исходной картинки. Endpoint /v1/images/variations до сих пор доступен только для dall-e-2 — новые модели вариации не делают.
DALL-E 3 вышел в октябре 2023. Ключевое отличие — резкий скачок в понимании prompt’а и способность рендерить читаемый текст в кадре. Именно DALL-E 3 первым интегрировали прямо в ChatGPT: подписчики Plus и Enterprise получили возможность просить картинки текстом внутри обычного диалога. Модель под капотом переписывала твой prompt на более развёрнутый (revised_prompt), и по этой развёрнутой версии рисовала.
В марте 2025 OpenAI выпустил принципиально новую архитектуру — gpt-image-1. Это уже не отдельная image-модель, а нативно-мультимодальная: она входит в семейство GPT и понимает и текст, и картинки на входе, и картинки на выходе. Именно с этого момента редактирование через диалог стало реально работать: попросил «сделай реалистичнее» — модель поняла контекст предыдущей картинки и переделала.
В 2026 году актуален gpt-image-2 (снапшот gpt-image-2-2026-04-21) — то, что стоит использовать по умолчанию. Помимо него в API остались gpt-image-1.5, gpt-image-1, gpt-image-1-mini и старые dall-e-3 / dall-e-2 для обратной совместимости.
Актуальные модели на 2026
Заголовок раздела «Актуальные модели на 2026»gpt-image-2 — флагман
Заголовок раздела «gpt-image-2 — флагман»Официальное описание из docs: «state-of-the-art image generation model for fast, high-quality image generation and editing». Модель принимает и текст, и картинки на входе, отдаёт картинки на выходе. Работает через endpoints:
POST /v1/images/generations— генерация с нуля по текстуPOST /v1/images/edits— редактирование существующей картинки или композиция из несколькихPOST /v1/batch— batch-обработка (в 2 раза дешевле)- Плюс через Responses API как tool:
{"type": "image_generation"}
Rate limits на дефолтном тире — 5-250 картинок в минуту в зависимости от tier аккаунта.
gpt-image-1.5 и gpt-image-1
Заголовок раздела «gpt-image-1.5 и gpt-image-1»Предыдущие поколения. gpt-image-1 описан в docs как «our previous image generation model». Функционально похожи на gpt-image-2, но с более скромным качеством и без некоторых новых параметров. Используются если нужна совместимость со старым кодом или если конкретный use-case стабильнее работает на старой модели.
gpt-image-1-mini
Заголовок раздела «gpt-image-1-mini»Уменьшенная версия. Быстрее, дешевле, качество ниже. Хороший выбор для превью, thumbnails, черновиков, batch-обработки большого объёма.
dall-e-3 и dall-e-2
Заголовок раздела «dall-e-3 и dall-e-2»В API остались, но новые проекты на них строить нет смысла. У dall-e-3 есть параметр quality: hd для повышенного качества и style: vivid | natural (более контрастный vs более естественный). У dall-e-2 работает /v1/images/variations — единственная модель, которая умеет генерировать вариации по исходной картинке без prompt’а.
Что умеет gpt-image-2: разрешения, форматы, параметры
Заголовок раздела «Что умеет gpt-image-2: разрешения, форматы, параметры»Разрешения
Заголовок раздела «Разрешения»Модель работает с гибкими размерами. Ограничения из docs:
- максимальная сторона ≤ 3840 px
- каждая сторона кратна 16 px
- соотношение длинной стороны к короткой ≤ 3:1
- общее количество пикселей от 655 360 до 8 294 400
Практически это даёт следующие популярные размеры:
- 1024×1024 — квадрат, базовый
- 1536×1024 — горизонтальный (для обложек, шапок)
- 1024×1536 — вертикальный (для сторис, Reels-обложек)
- 2048×2048 — 2K квадрат
- 3840×2160 — 4K горизонтальный
Плюс есть режим size: "auto" — модель сама выберет подходящий размер под задачу.
Качество
Заголовок раздела «Качество»Три уровня плюс auto:
low— быстро, для драфтов и thumbnail’овmedium— компромиссhigh— максимум деталейauto— модель решает сама
Разница между low и high огромная не только по деталям, но и по цене — увидишь в разделе про pricing.
Форматы вывода
Заголовок раздела «Форматы вывода»png(по умолчанию, без потерь)jpeg(с параметромoutput_compression: 0-100)webp(с параметромoutput_compression: 0-100)
Для веба обычно webp — лучший компромисс размера и качества. Для дизайна и печати — png.
Параметр background:
opaque— обычный непрозрачный фонauto— модель решает
у gpt-image-2 прозрачный фон не поддерживается. Если нужен PNG с alpha-каналом (для наложения продукта на другой фон, например для карточки товара) — используй gpt-image-1 или gpt-image-1.5, там background: transparent работает.
Модерация
Заголовок раздела «Модерация»Параметр moderation:
auto— стандартная фильтрация (по умолчанию)low— более мягкая фильтрация
Категории, по которым может прийти отказ: harassment, self-harm, sexual, violence. Ошибка возвращается с error.code = "moderation_blocked" и полем moderation_stage со значением input, output или unknown — по какому этапу сработала блокировка.
Стриминг
Заголовок раздела «Стриминг»Оба API (Image API и Responses API) поддерживают прогрессивный рендер:
stream: true— включает стримингpartial_images: 0-3— сколько промежуточных превью показывать
Каждая промежуточная картинка стоит дополнительные 100 output-токенов. Полезно для UX — пользователь видит как картинка «проявляется», а не ждёт молча 30-90 секунд.
Редактирование: inpaint, outpaint, композиция
Заголовок раздела «Редактирование: inpaint, outpaint, композиция»Через endpoint /v1/images/edits
Заголовок раздела «Через endpoint /v1/images/edits»Классический подход. Загружаешь исходную картинку, prompt что изменить, опционально маску для точечного редактирования.
Пример базовой композиции из нескольких картинок:
curl https://api.openai.com/v1/images/edits \ -H "Authorization: Bearer $OPENAI_API_KEY" \ -F "model=gpt-image-2" \ -F "image[]=@body-lotion.png" \ -F "image[]=@bath-bomb.png" \ -F "image[]=@incense-kit.png" \ -F "image[]=@soap.png" \ -F 'prompt=Create a lovely gift basket with these four items in it'Параметр images принимает до 16 картинок для GPT-моделей. Каждая — либо file_id из File API, либо image_url (обычный URL или base64 data URL).
Маска для inpaint
Заголовок раздела «Маска для inpaint»Маска — картинка того же размера что исходник, с alpha-каналом. Прозрачные пиксели маски = зона для перерисовки, непрозрачные = зона которую не трогать. Формат маски должен совпадать с форматом исходника, размер файла ≤ 50 MB.
Outpaint (расширение картинки)
Заголовок раздела «Outpaint (расширение картинки)»Работает через ту же логику /v1/images/edits: даёшь исходную картинку меньшего размера, маску которая покрывает пустое пространство куда надо дорисовать, и prompt что там должно быть. Технически это тот же inpaint, только маска покрывает область за пределами исходной картинки.
Через Responses API — мультитерн
Заголовок раздела «Через Responses API — мультитерн»Более удобный способ для интерактивного редактирования. Ты работаешь с моделью как в обычном диалоге, а картинка — часть контекста:
const response = await openai.responses.create({ model: "gpt-5.6", input: "Generate an image of gray tabby cat hugging an otter", tools: [{ type: "image_generation" }],});
const response_fwup = await openai.responses.create({ model: "gpt-5.6", previous_response_id: response.id, input: "Now make it look realistic", tools: [{ type: "image_generation" }],});previous_response_id даёт модели весь контекст предыдущего шага. Ей не надо заново объяснять что за котик — она уже помнит.
Для маски через Responses API:
response = client.responses.create( model="gpt-5.6", input=[{ "role": "user", "content": [ {"type": "input_text", "text": "Add a flamingo to the pool"}, {"type": "input_image", "file_id": imageFileId}, ], }], tools=[{ "type": "image_generation", "input_image_mask": {"file_id": maskFileId}, }],)Параметр action внутри tool: auto (по умолчанию), generate (только новая картинка), edit (только редактирование).
Как использовать: ChatGPT app, API, Playground
Заголовок раздела «Как использовать: ChatGPT app, API, Playground»В ChatGPT app
Заголовок раздела «В ChatGPT app»Для обычного пользователя без кода. Открываешь диалог, пишешь «сделай картинку X», модель рисует. Работает для подписчиков ChatGPT Plus, Pro, Team, Enterprise. Модель под капотом — chatgpt-image-latest (это тот же gpt-image-2 но управляемый ChatGPT).
Дневные лимиты не фиксированы жёстко и меняются в зависимости от нагрузки, но общий принцип: Plus получает существенно меньше картинок в сутки, чем Pro. При достижении лимита можно продолжить генерацию через некоторое время либо переключиться на другой тип запросов.
Через API
Заголовок раздела «Через API»Прямой доступ для разработчиков. Endpoints:
# Генерация с нуляcurl https://api.openai.com/v1/images/generations \ -H "Content-Type: application/json" \ -H "Authorization: Bearer $OPENAI_API_KEY" \ -d '{ "model": "gpt-image-2", "prompt": "A cute baby sea otter", "n": 1, "size": "1024x1024", "quality": "medium" }'Ответ содержит массив data с картинками (base64 в поле b64_json), timestamp created, использованные настройки и usage с токенами.
Через Playground
Заголовок раздела «Через Playground»Веб-интерфейс на platform.openai.com/playground. Полезен чтобы поэкспериментировать с моделью без кода, подобрать prompt, посмотреть как отрабатывают разные параметры. То же самое что API, но с кнопкой.
API pricing на 2026
Заголовок раздела «API pricing на 2026»OpenAI перешёл на биллинг по токенам (не по картинкам). Для gpt-image-2:
- Text input: $8.00 за 1M токенов
- Image output: $30.00 за 1M токенов
- Batch tier (в 2 раза дешевле): $4.00 input, $15.00 output
Токены выхода зависят от размера и качества картинки. Ориентировочная стоимость одной картинки для gpt-image-2:
| Качество | 1024×1024 | 1024×1536 | 1536×1024 |
|---|---|---|---|
| Low | $0.006 | $0.005 | $0.005 |
| Medium | $0.053 | $0.041 | $0.041 |
| High | $0.211 | $0.165 | $0.165 |
Разница между low и high — почти 35×. Для черновиков и итераций держи low, финалку делай high.
Итоговая стоимость запроса:
total = input_text_tokens + input_image_tokens (если edit) + image_output_tokensBatch-обработка через /v1/batch — половина цены, но с задержкой (обычно в течение 24 часов). Хорошо для больших offline-объёмов: генерация 10 000 карточек товара, массовая обработка датасета.
Точный калькулятор стоимости живёт внутри image generation guide на developers.openai.com — есть форма где можно вбить размер, качество и увидеть итог.
Content policy: что запрещено
Заголовок раздела «Content policy: что запрещено»OpenAI фильтрует и prompt на входе, и результат на выходе. Основные категории блока:
Насилие и графика: явные сцены насилия, крови, увечий, оружия в опасном контексте.
Сексуальный контент: любой явный NSFW. Художественная nudity в стиле классической живописи фильтр может пропустить, но не всегда.
Публичные лица: генерация конкретных живых политиков, знаменитостей, публичных фигур ограничена. Модель может отказаться или сгенерировать «похожего, но не того». Для usage policy это отдельная зона риска — даже если модель сгенерировала, использование чужого лица без разрешения — юридический вопрос (право на изображение).
Дети: несовершеннолетние в любом контексте, отдалённо похожем на сексуальный или опасный, блокируются жёстко.
Копирайт-персонажи: Микки Маус, персонажи Disney, Марвел, конкретные бренды. Модель обычно отказывается или генерирует «в стиле», но не точную копию.
Дезинформация: явные попытки создать fake-фотографию политического события, поддельный документ, скриншот несуществующего чата с публичной фигурой.
Harassment / self-harm: контент, унижающий конкретного человека или продвигающий самоповреждение.
Модерация двухступенчатая: сначала проверяется prompt, потом сам результат. Если фильтр сработал — приходит ошибка moderation_blocked с полем moderation_stage (input / output / unknown) и списком categories.
Настройка moderation: "low" доступна для API и снижает строгость фильтрации, но полностью отключить нельзя. И low не снимает запрет на детей, публичных лиц и явную дезинформацию — эти категории всегда блокируются.
Как писать prompt: короткий гайд
Заголовок раздела «Как писать prompt: короткий гайд»gpt-image-2 понимает и однострочные prompt’ы, и развёрнутые описания на несколько абзацев. Общие принципы:
1. Опиши субъект конкретно. Не «женщина», а «женщина 30 лет с рыжими короткими волосами в белой льняной рубашке». Модель заполнит пробелы если не описал — но не обязательно так как ты хотел.
2. Опиши стиль. «photorealistic», «watercolor painting», «pencil sketch», «isometric 3D render», «flat vector illustration», «cinematic photo, shot on 35 mm film». Стиль определяет общий вид сильнее любых деталей.
3. Опиши свет и композицию. «soft window light from the left», «golden hour», «top-down flat lay», «shallow depth of field», «wide-angle shot». Свет — то что делает картинку живой, не забывай про него.
4. Опиши фон. «minimalist white studio background», «cozy scandinavian kitchen», «blurred forest background». Если не описал — модель поставит что-то нейтральное или неожиданное.
5. Отрицания работают хуже прямых описаний. Вместо «no text on the image» лучше просто не упоминать текст. Модель хуже понимает «не» чем «что должно быть».
Пример короткого prompt’а:
«Flat lay photo of morning skincare routine on a marble countertop: white ceramic bottle, glass jar with cream, soft towel in beige. Natural window light from the top right. Minimalist Scandinavian style, soft shadows, high detail»
Пример развёрнутого prompt’а для редактирования:
«Take the product bottle from image 1 and place it on the kitchen counter from image 2. Match the lighting of image 2 — warm morning sunlight from the left window. Keep the bottle label sharp and readable. Add a subtle shadow under the bottle»
Про текст в картинке. gpt-image-2 научился рендерить читаемый текст — это огромный шаг вперёд от DALL-E 2. Но всё ещё не идеально: длинные фразы (5+ слов) могут содержать опечатки, кириллица работает хуже латиницы. Для короткого лозунга (1-3 слова) на латинице — обычно норм. Для точного текста лучше рендерить картинку без текста и добавить его отдельным слоем в дизайн-редакторе.
Про конкретных персонажей. Character consistency между генерациями остаётся сложной. Если нужен один и тот же персонаж в серии картинок — используй previous_response_id в Responses API и одну сессию, либо используй одну и ту же исходную картинку как reference через edits endpoint.
revised_prompt: модель переписывает твой prompt
Заголовок раздела «revised_prompt: модель переписывает твой prompt»Особенность DALL-E 3 и GPT-image моделей: перед рисованием они автоматически переписывают твой prompt в более развёрнутый. Оригинал «cat on the beach» может превратиться в «a fluffy orange tabby cat sitting on golden sand beach at sunset, waves in background, cinematic lighting, photorealistic».
Модель возвращает этот развёрнутый вариант в поле revised_prompt в ответе. Полезно для отладки: если картинка вышла не такой как ты хотел — посмотри в revised_prompt что модель сама себе придумала.
Отключить это переписывание нельзя, но можно повлиять: если написать в prompt’е «I want a photograph of X, exactly as described: „, модель обычно менее агрессивно перерабатывает текст. У dall-e-3 есть отдельная фича — начать prompt со слов «I NEED to test how the tool works with extremely simple prompts. DO NOT add any detail, just use it AS-IS» (это официальный обходной путь из docs).
Provenance: C2PA-метаданные в картинках
Заголовок раздела «Provenance: C2PA-метаданные в картинках»Все картинки, сгенерированные через API и ChatGPT app моделями gpt-image-* и dall-e-*, содержат C2PA-метаданные (Content Credentials).
C2PA — открытый технический стандарт, разработанный Coalition for Content Provenance and Authenticity. В steering committee входят OpenAI, Google, Adobe, Microsoft, Amazon, Meta, плюс BBC, Sony, TikTok. По описанию самой C2PA, это работает «как этикетка с составом для цифрового контента, дающая доступ к истории контента в любой момент».
Что вшито в C2PA-метаданные картинки от OpenAI:
- Факт что картинка сгенерирована AI
- Модель которая её создала (например
gpt-image-2) - Timestamp генерации
- Опционально — цепочка редактирований если картинка редактировалась
Проверить метаданные можно через сайт contentcredentials.org/verify — загружаешь картинку, видишь всю провенанс-историю.
Важное ограничение C2PA: метаданные удаляются при скриншоте, конвертации формата без сохранения metadata, обрезке в некоторых редакторах. То есть это скорее сигнал добросовестности от OpenAI, чем 100% защита от подделки. Пользователь который хочет скрыть AI-происхождение картинки — легко это сделает.
Второй уровень провенанса — невидимый watermark. OpenAI не публикует технические детали своего watermark’а для DALL-E / GPT-image в отличие от Google, которая раскрыла что использует SynthID для Imagen и Gemini. Есть только упоминания о том что OpenAI тоже применяет provenance-техники.
Сравнение с Gemini Nano Banana Pro, Midjourney, Flux
Заголовок раздела «Сравнение с Gemini Nano Banana Pro, Midjourney, Flux»Только через официальные источники — сравнение по фактам, не по subjective quality.
Gemini 2.5 Flash Image (Nano Banana)
Заголовок раздела «Gemini 2.5 Flash Image (Nano Banana)»Модель Google, актуальная замена deprecated Imagen (Imagen 4 отключается 17 августа 2026). Model name в API: gemini-2.5-flash-image. Вызывается через client.models.generate_content, не через отдельный images endpoint. Подробный разбор — Nano Banana Pro в Gemini.
Особенности из docs Google:
- Все картинки содержат невидимый SynthID watermark (детектируется через специальный API Google)
- До 4 картинок за один запрос
- Разрешение до 2K для Ultra, до 1K для Standard/Fast
- Поддержка aspect ratios: 1:1, 3:4, 4:3, 9:16, 16:9
- Мультимодальный контекст: можно смешивать текст и картинки в prompt’е
Отличие от OpenAI: Google жёстче про watermark (SynthID вшит в сами пиксели, а не только в metadata), OpenAI гибче по разрешениям (до 3840 px против 2K).
Midjourney
Заголовок раздела «Midjourney»Работает только через Discord bot и веб-интерфейс на midjourney.com. Публичного API у Midjourney V7 нет. Это осознанное позиционирование от команды — они хотят творческую community, а не B2B-инструмент.
Модели актуальны V6.1 и V7. Никакой возможности программной генерации через официальный API — только через Discord slash-commands. Некоторые third-party сервисы делают неофициальные обёртки, но они регулярно ломаются и нарушают ToS Midjourney.
Flux (Black Forest Labs)
Заголовок раздела «Flux (Black Forest Labs)»Открытая семья моделей от Black Forest Labs (Flux) — создателей оригинального Stable Diffusion. Модели Flux.1 [pro], Flux.1 [dev], Flux.1 [schnell]. Доступны через:
- Официальный API Black Forest Labs (api.bfl.ai)
- Хостинг на Replicate, fal.ai, Together AI
- Локально (dev и schnell — открытые веса)
Отличие от OpenAI: Flux можно запустить локально на своём GPU (если модель dev или schnell), OpenAI — только через API. Flux не имеет встроенной модерации на уровне модели (модерация — на стороне провайдера хостинга).
Резюме сравнения: OpenAI выигрывает по интеграции с языковой моделью (мультитерн редактирование через Responses API), Google — по строгому watermarking, Midjourney — по эстетике и community, Flux — по возможности локального запуска. Для B2B-задач с API интеграция OpenAI и Google обычно проще, чем Flux через third-party.
RU-специфика: как использовать из РФ
Заголовок раздела «RU-специфика: как использовать из РФ»Прямого доступа к OpenAI из России нет — регистрация с российского номера не пройдёт, оплата российской картой отклоняется, доступ с российского IP к api.openai.com блокируется на стороне OpenAI.
Реальные пути (в рамках правил, без обхода блокировок):
1. Российские альтернативы. Работают из РФ напрямую, оплата рублёвой картой:
- Yandex ART — модель Yandex Cloud, доступна через API yandex.cloud
- Kandinsky (Sber) — открытая модель от Сбера, есть и API, и веб-интерфейс fusionbrain.ai
- GigaChat Image (Sber) — коммерческий API для генерации картинок
Качество ниже gpt-image-2 на 2026, но для базовых задач бизнеса — карточки товара, простые иллюстрации, baseline-контент — часто хватает.
2. Зарубежная регистрация через partner-hosting. Есть корпоративные хостинги, которые проксируют OpenAI API официально, с российской юрлицом и оплатой рублями. Работают через легальные соглашения с OpenAI. Проверяй по факту — рынок меняется.
3. Регистрация зарубежного юрлица. Долгий путь, но легальный. Компания в дружественной юрисдикции, зарубежный счёт, оплата OpenAI напрямую.
Для физлиц и мелкого бизнеса на 2026 — реалистичный путь это либо российские модели, либо доступ через хостинг-партнёров. Прямой OpenAI-API с российского юрлица без зарубежных структур пока не работает.
Практические use-cases для бизнеса
Заголовок раздела «Практические use-cases для бизнеса»Где gpt-image-2 реально полезен уже сейчас:
Карточки товара для маркетплейсов. Генерация фонов, композиция продукта в разных сценах, вариации lifestyle-фото. Через batch-обработку — сотни карточек за копейки. У gpt-image-1 / gpt-image-1.5 есть транспарентный фон — можно вырезать продукт для дальнейшего наложения.
Иллюстрации в блог и социальные сети. Обложки статей, картинки к постам, схемы «до-после». Средний размер 1536×1024 или 1024×1536, качество medium — стоимость ~$0.05 за штуку.
Прототипы дизайна. Мокапы приложений, черновики landing page, визуальные концепты для клиента. Быстро проверить идею перед тем как отдавать в production-дизайн.
Персонализация контента. Генерация индивидуальных картинок под user’а в email-рассылке, чат-ботах, CRM.
A/B-тестирование креативов. Быстрая генерация 10 вариантов одного баннера для теста в рекламе.
Где всё ещё лучше платить дизайнеру-человеку: точный fit в brand-guidelines с уникальным характером, финальные обложки книг и упаковка (нужна precision и лицензионная чистота), логотипы (AI пока не заменяет brand identity процесс).
Ограничения и когда что-то не работает
Заголовок раздела «Ограничения и когда что-то не работает»Complex prompts могут занимать до 2 минут. Особенно на quality: high и большом разрешении. Планируй UX с этим в голове — либо стриминг с partial_images, либо async обработка.
Текст в картинке несовершенен. Улучшилось сильно с DALL-E 3, но длинные тексты и кириллица всё ещё проблемные.
Character consistency ограничена. Один и тот же персонаж в 10 разных сценах — не гарантировано похож. Используй референс-картинку через edits endpoint или Responses API с previous_response_id.
Precise placement сложен. «Поставь объект X в правый нижний угол» — модель может понять расплывчато. Для точной композиции лучше маска и inpainting.
Rate limits на дефолтном tier. 5-250 картинок в минуту в зависимости от tier. Для массовой обработки — batch endpoint или запрос повышения лимитов через support.
Модерация может отказать на невинных prompt’ах. Иногда фильтр срабатывает false-positive. Попробуй перефразировать prompt, использовать moderation: "low" (не отключает полностью, но снижает строгость).
Q: DALL-E 3 всё ещё работает через API?
A: Да, dall-e-3 доступен через /v1/images/generations для обратной совместимости. Но для новых проектов имеет смысл начинать с gpt-image-2 — качество выше, редактирование через диалог удобнее, цена сравнима.
Q: Можно ли получить прозрачный фон на gpt-image-2?
A: Нет, у gpt-image-2 параметр background: transparent не поддерживается — только opaque или auto. Если нужен PNG с alpha-каналом — используй gpt-image-1 или gpt-image-1.5. Либо сгенерируй на белом фоне и обрежь в редакторе.
Q: Сколько стоит одна картинка 1024×1024 medium quality? A: Ориентировочно $0.053 (5-6 центов). Это включает image output tokens при стандартном тексте prompt’а. Batch-tier в 2 раза дешевле — ~$0.026 за ту же картинку.
Q: Можно ли сгенерировать картинку конкретного человека (например Илона Маска)? A: Публичные фигуры — зона фильтра. Модель может отказать или сгенерировать похожего, но не точного. Даже если получилось — использование образа конкретного человека без разрешения = юридический риск (право на изображение).
Q: Модель может сгенерировать логотип моей компании? A: Да, но это будет каждый раз разный логотип. Для стабильного логотипа нужен обычный дизайн-процесс. AI хорош для генерации идей и вариантов на этапе brainstorm’а.
Q: Как понять что картинка сгенерирована OpenAI?
A: Проверь C2PA-метаданные на contentcredentials.org/verify — увидишь модель, timestamp, историю редактирований. Если метаданные удалены (через скриншот или конвертацию) — надёжного способа определить AI-происхождение нет.
Q: Есть ли лимит на количество картинок в день через ChatGPT app? A: Есть, но точные цифры не публикуются и меняются. Plus получает меньше чем Pro. При достижении лимита ChatGPT показывает сообщение и предлагает попробовать позже или подписаться на более высокий тариф.
Q: Можно ли использовать сгенерированные картинки в коммерческих целях? A: Да, OpenAI Terms of Use разрешают коммерческое использование картинок, созданных через API и ChatGPT (при активной подписке). Но: содержимое картинки должно соответствовать местному законодательству о копирайте, товарных знаках и праве на изображение. Ответственность за конечное использование — на пользователе.
Q: Что быстрее — Image API или Responses API?
A: Image API /v1/images/generations быстрее для одиночной генерации. Responses API удобнее для мультитёрного редактирования (не надо каждый раз перезагружать контекст). Для веб-интеграций одиночной генерации — Image API. Для чат-ботов с итеративным редактированием — Responses API.
Q: Можно ли обучить gpt-image-2 на своих картинках (fine-tune)?
A: На 2026 fine-tuning gpt-image-2 через API OpenAI не поддерживается. Endpoint fine-tuning’а работает только для текстовых моделей. Для персонализации используй референс-картинки через edits endpoint или через prompt-описание стиля.
Актуальность
Заголовок раздела «Актуальность»Актуально на 31.07.2026. Модели, цены и условия доступа меняются часто. Перед бизнес-решением всегда сверяйся с первоисточником — все ссылки в разделе Sources ниже.
Sources
Заголовок раздела «Sources»- OpenAI Image Generation Guide: https://developers.openai.com/api/docs/guides/image-generation (verified 31.07.2026)
- OpenAI Images API Reference: https://developers.openai.com/api/docs/api-reference/images (verified 31.07.2026)
- OpenAI Model Card gpt-image-2: https://developers.openai.com/api/docs/models/gpt-image-2 (verified 31.07.2026)
- OpenAI Model Card gpt-image-1: https://developers.openai.com/api/docs/models/gpt-image-1 (verified 31.07.2026)
- OpenAI Pricing: https://developers.openai.com/api/docs/pricing (verified 31.07.2026)
- OpenAI Images & Vision Guide: https://developers.openai.com/api/docs/guides/images-vision (verified 31.07.2026)
- C2PA (Coalition for Content Provenance and Authenticity): https://c2pa.org/ (verified 31.07.2026)
- Content Credentials verify tool: https://contentcredentials.org/verify (verified 31.07.2026)
- Google Gemini Image Generation Docs: https://ai.google.dev/gemini-api/docs/imagen (verified 31.07.2026, для сравнения)