Перейти к содержимому

Gemini 3.5, 3.6 Flash и 3.1 Pro в 2026: какую модель Google выбрать

Автор: Silvana · Дата: 31.07.2026 · Verified: 01.09.2026 · Reading time: 11 минут · Prerequisite: 002, 009, 011

Gemini в 2026 — это шесть моделей поколения 3.x плюс живая ветка 2.5 Pro для миграции. Флагман Flash — gemini-3.6-flash ($1.50/$7.50 за 1M токенов, дефолт для агентов и мультимодальных задач), сильнейший reasoner — gemini-3.1-pro-preview ($2/$12 до 200K, дальше $4/$18), самый экономный — gemini-3.1-flash-lite ($0.25/$1.50 за текст). Единый контекст 1 000 000 токенов на всю линейку, нативная работа с текстом, изображениями, видео и аудио (до 9.5 часов на промпт). Отдельного gemini-ultra в API нет — «Ultra» это уровень подписки Google, дающий доступ к Gemini 3 Deep Think.

  • У Google в продакшне сейчас шесть моделей Gemini поколения 3.x и стабильные Gemini 2.5 Pro / 2.5 Flash / 2.5 Flash-Lite для тех, кто ещё не мигрировал.
  • Gemini 3.6 Flash (gemini-3.6-flash) — самая свежая GA-модель, $1.50 вход / $7.50 выход за 1M токенов. Дефолт для агентских и мультимодальных задач.
  • Gemini 3.5 Flash (gemini-3.5-flash) — предыдущий флагман линейки Flash, $1.50 / $9.00. Всё ещё сильнейший 3.5 для сложных агентов.
  • Gemini 3.5 Flash-Lite (gemini-3.5-flash-lite) — самый быстрый и дешёвый в 3.5-семье, $0.30 / $2.50. Для массовых операций.
  • Gemini 3.1 Flash-Lite (gemini-3.1-flash-lite) — $0.25 / $1.50 за текст. Ещё дешевле, всё ещё стабильна.
  • Gemini 3.1 Pro (gemini-3.1-pro-preview) — топ по интеллекту в 3.x, $2.00 / $12.00 до 200K токенов, $4.00 / $18.00 выше. Для reasoning, кода и агентов.
  • Ultra-тир как отдельного model ID не существует. «Ultra» — уровень подписки Google, дающий доступ к Gemini 3 Deep Think (расширенный reasoning-режим на базе Pro). Через API отдельной модели gemini-ultra нет.
  • Единое контекстное окно на всей 3.x-линейке: 1 000 000 токенов вход, 64 000 токенов выход.
  • Мультимодальность нативная: текст, изображение, видео, аудио (до 9.5 часов на промпт).
  • В РФ прямая оплата и Google AI Studio недоступны напрямую — см. раздел RU-специфика доступа.

Google построил линейку Gemini иначе, чем OpenAI и Anthropic. Вместо трёх «размеров одной модели» (Sol/Terra/Luna у GPT-5.6 или Haiku/Sonnet/Opus у Claude) — у Google две живые семьи: Flash (скорость + баланс) и Pro (максимум интеллекта). Внутри каждой семьи — несколько поколений (3.1, 3.5, 3.6), которые сосуществуют, пока идёт миграция.

Мысленный образ: если OpenAI даёт три машины одной марки под три бюджета, Google даёт две линии — «городская» (Flash: все Flash-модели быстрые, но с разным уровнем интеллекта) и «шоссейная» (Pro: сильнее в дальней дороге, но дороже за километр). Ultra — это не третья машина, а «выделенная полоса» для владельцев премиум-подписки, где Pro работает с расширенным reasoning.

Для маркетолога это значит: выбор идёт не через размер модели, а через задачу. Если задача про «объём быстро» — почти всегда Flash. Если про «глубокое рассуждение» — Pro. Если про «мультимодальность» (видео, аудио, длинный документ с изображениями) — любая Gemini обгоняет GPT и Claude из коробки, потому что мультимодальность здесь нативная, а не подключаемая через отдельную модель.

По состоянию на 31 июля 2026 в ai.google.dev в статусе Stable (готовы для продакшна) находятся:

МодельModel IDПозиция
Gemini 3.6 Flashgemini-3.6-flashСвежая GA, дефолт
Gemini 3.5 Flashgemini-3.5-flashПредыдущий Flash-флагман
Gemini 3.5 Flash-Litegemini-3.5-flash-liteБыстрый и дешёвый
Gemini 3.1 Flash-Litegemini-3.1-flash-liteЕщё дешевле, стабильна

В статусе Preview (доступны в AI Studio, но не рекомендованы для критичного продакшна):

МодельModel IDПозиция
Gemini 3.1 Pro Previewgemini-3.1-pro-previewТоп по интеллекту
Gemini 3 Flash Previewgemini-3-flash-previewFrontier-класс за долю цены
Gemini 3.5 Live Translategemini-3.5-live-translate-previewРечевая трансляция 70+ языков
Gemini 3.1 Flash Live Previewgemini-3.1-flash-live-previewАудио-в-аудио для голосовых агентов
Gemini 3.1 Flash TTS Previewgemini-3.1-flash-tts-previewСинтез речи
Gemini Omni Flash Previewgemini-omni-flash-previewГенерация видео

Отдельно живут генеративные модели медиа (Nano Banana, Nano Banana Pro, Nano Banana 2, Veo 3.1, Lyria 3, Imagen). Про Nano Banana Pro и генерацию картинок Gemini — отдельная статья [030].

Отдельно про Ultra. «Ultra» у Google — это не model ID, а название пользовательской подписки на Gemini App. Подписчики Ultra получают доступ к Gemini 3 Deep Think — режиму расширенного reasoning для Gemini 3 Pro, доступному через приложение и Vertex AI. Через прямой Gemini API отдельная модель gemini-ultra не публикуется. Если вы разработчик и вам нужен максимальный интеллект — используйте Gemini 3.1 Pro Preview.

Это модель, которую Google рекомендует брать первой, если вы начинаете новый проект в июле 2026. Она заменила Gemini 3.5 Flash на позиции дефолта в Antigravity и других агентских скиллах.

Verified specs из ai.google.dev/gemini-api/docs/models (проверено 31.07.2026):

ПараметрЗначение
Model IDgemini-3.6-flash
СтатусGA (Stable)
Контекст1 000 000 токенов
Максимум выхода64 000 токенов
Default thinking levelmedium
Цена input$1.50 за 1M токенов
Цена output$7.50 за 1M токенов (включая thinking-токены)
Context caching$0.15 за 1M + $1.00 хранение / 1M токенов в час
Модальности входТекст, изображение, видео, аудио
Модальности выходТекст
ИнструментыGoogle Search grounding, Google Maps, Computer Use, File Search, Code execution, URL context
Свободный тарифFree of charge

Что нового в 3.6 Flash по сравнению с 3.5 Flash (из ai.google.dev):

  • Сокращение токенов и тёрнов. Меньше шагов рассуждения и вызовов инструментов на одну и ту же многошаговую задачу.
  • Улучшенная генерация кода. Меньше «отладочных петель», выше качество production-ready кода.
  • Лучшее следование инструкциям. Меньше нежелательных правок файлов в диагностических задачах.
  • Сильнее мультимодальность и пространственное рассуждение. Диаграммы, blueprints, мультиэлементные веб-макеты.
  • Native Computer Use. UI-автоматизация как встроенный инструмент.
  • Ниже цена вывода. $7.50 против $9.00 у 3.5 Flash. Вход одинаковый ($1.50).

Когда брать 3.6 Flash: агенты, вибекодинг, интеграция с браузером и десктопом, работа с длинными мультимодальными документами (PDF с изображениями и аудиовставками), продуктовые чат-боты с рассуждением. Это «универсальный дефолт» — если нет причин брать что-то другое, начинайте с него.

3.5 Flash по-прежнему в GA. Google описывает его как «most intelligent model for sustained frontier performance on agentic and coding tasks». Формально по бенчмаркам 3.5 Flash даже сильнее 3.6 в reasoning-задачах — 3.6 Google выпустил как «более эффективную» модель: чуть слабее по потолку, зато дешевле по выходу и меньше токенов ест.

Verified specs из ai.google.dev/gemini-api/docs/models:

ПараметрЗначение
Model IDgemini-3.5-flash
СтатусGA (Stable)
Контекст1 000 000 токенов
Максимум выхода64 000 токенов
Default thinking levelmedium
Цена input$1.50 за 1M токенов
Цена output$9.00 за 1M токенов
Context caching$0.15 за 1M + $1.00 хранение / 1M токенов в час
Модальности входТекст, изображение, видео, аудио
Модальности выходТекст

Когда брать 3.5 Flash: если у вас уже был production на 3.5 и вы не хотите мигрировать; если ваши бенчмарки показывают, что 3.5 даёт лучше результат на конкретной задаче; или если вам нужна модель, у которой более длительная история стабильности в проде.

Разница в цене на выходе (9.00 против 7.50) — это 20% экономии в пользу 3.6, что при большом объёме токенов становится ощутимо. Прогоните обе модели на своём A/B, прежде чем делать выбор.

Это флагман категории «дёшево + быстро». Google описывает его как «fastest, most cost-effective 3.5 model for high-throughput execution».

Verified specs из ai.google.dev/gemini-api/docs/models:

ПараметрЗначение
Model IDgemini-3.5-flash-lite
СтатусGA (Stable)
Контекст1 000 000 токенов
Максимум выхода64 000 токенов
Default thinking levelminimal
Цена input$0.30 (text / image / video / audio) за 1M токенов
Цена output$2.50 за 1M токенов
Context caching$0.03 за 1M + $1.00 хранение / 1M токенов в час
МодальностиПолная мультимодальность на входе

Ключевое отличие Flash-Lite от старших братьев: default thinking level = minimal. Модель по умолчанию не тратит бюджет на «медленное размышление», а отвечает быстро. Для сложных задач можно поднять thinking-уровень руками в параметрах запроса, но пока держите его в минимуме — платите меньше.

Что улучшилось в 3.5 Flash-Lite по сравнению с 3.1 Flash-Lite (из ai.google.dev):

  • Сниженная latency. Максимальный throughput в семье 3.5 для парсинга и извлечения данных.
  • Улучшенное reasoning и мультимодал. HLE 18,0% против 11,0% у 2.5 Flash. CharXIV 74,5% против 63,7%.
  • Оркестрация субагентов. Лучше держит цепочки MCP-инструментов.
  • Понимание документов. Устойчивее извлекает структуру из PDF, таблиц.
  • Chatbot persona persistence. Лучше держит роль и стиль между репликами.
  • Native Computer Use. Как и у старших моделей.

Когда брать 3.5 Flash-Lite: массовые операции с текстом и мультимодалом, тегирование, классификация, извлечение полей из документов, first-line support-бот, батч-переводы, генерация коротких SEO-описаний, работа с длинными PDF-договорами (там где не нужен максимальный reasoning).

Gemini 3.1 Flash-Lite (самый бюджетный из стабильных)

Заголовок раздела «Gemini 3.1 Flash-Lite (самый бюджетный из стабильных)»

Ещё дешевле, чем 3.5 Flash-Lite. Осталась в GA как «долгоживущая» модель для тех, кому важна стабильность цен и стабильность behavior.

Verified specs из ai.google.dev/gemini-api/docs/models:

ПараметрЗначение
Model IDgemini-3.1-flash-lite
СтатусGA (Stable)
Контекст1 000 000 токенов
Максимум выхода64 000 токенов
Цена input$0.25 (text / image / video), $0.50 (audio) за 1M токенов
Цена output$1.50 за 1M токенов
Context caching$0.025 (text/image/video), $0.05 (audio), $1.00 хранение
МодальностиПолная мультимодальность

Когда брать 3.1 Flash-Lite: если у вас уже работают пайплайны на 3.1 и они стабильны; если вам критично держать бюджет ещё ниже, чем на 3.5 Flash-Lite; для внутренних инструментов с миллионами запросов, где качество Ultra не нужно.

3.1 Flash-Lite всё ещё поддерживается, но новые проекты Google рекомендует начинать с 3.5 Flash-Lite или 3.6 Flash. 3.1 постепенно двигается к «legacy» роли.

Это самая мощная Gemini для reasoning, кода и агентов. Google описывает её как «latest performance, intelligence, and usability improvements to the best model family in the world for multimodal understanding, agentic capabilities, and vibe-coding».

Verified specs из ai.google.dev/gemini-api/docs/models:

ПараметрЗначение
Model IDgemini-3.1-pro-preview (+ gemini-3.1-pro-preview-customtools)
СтатусPreview
Контекст1 000 000 токенов
Максимум выхода64 000 токенов
Цена input (≤ 200K токенов)$2.00 за 1M токенов
Цена input (> 200K токенов)$4.00 за 1M токенов
Цена output (≤ 200K токенов)$12.00 за 1M токенов
Цена output (> 200K токенов)$18.00 за 1M токенов
Context caching (≤ 200K)$0.20 за 1M + $4.50 хранение
Context caching (> 200K)$0.40 за 1M + $4.50 хранение
МодальностиПолная мультимодальность на входе
Свободный тарифНе доступен

Как и у GPT-5.6 Sol с его «long context surcharge», у Gemini 3.1 Pro тоже двухтарифная модель — если промпт больше 200K токенов, цена вход и выход растёт. Планируйте это в архитектуре: если ваши промпты около 250-300K — часто выгоднее разбить их или использовать context caching.

Когда брать 3.1 Pro: задачи, где стоимость ошибки высока и требуется reasoning уровня «PhD»; сложный код (вибекодинг), где важна архитектурная логика; агентские цепочки с многошаговым планированием; юридические разборы длинных документов; научные и финансовые анализы. Также — если вам нужен Deep Think через Vertex AI или подписку Ultra.

Gemini 2.5 Pro / Flash / Flash-Lite (стабильная предыдущая линейка)

Заголовок раздела «Gemini 2.5 Pro / Flash / Flash-Lite (стабильная предыдущая линейка)»

2.5 всё ещё в проде и активно используется. Google не удалил их, потому что многие продукты завязаны на 2.5-behavior. Migration path из 2.5 в 3.x рекомендованный, но не обязательный.

Verified specs из ai.google.dev/gemini-api/docs/models:

МодельModel IDInputOutputКонтекст
Gemini 2.5 Progemini-2.5-pro$1.25 (≤200K), $2.50 (>200K)$10.00 (≤200K), $15.00 (>200K)1M
Gemini 2.5 Flashgemini-2.5-flash$0.30 (text/image/video), $1.00 (audio)$2.501M
Gemini 2.5 Flash-Litegemini-2.5-flash-lite$0.10 (text/image/video), $0.30 (audio)$0.401M

Заметьте: цены на 2.5 линейку ниже, чем на 3.x. Особенно ощутима разница на Pro: 2.5 Pro стоит $1.25 против $2.00 у 3.1 Pro Preview на текстах до 200K. Если вам не нужны свежие возможности 3.x (Computer Use, улучшенная агентика, native native native), 2.5 Pro остаётся сильным и более дешёвым выбором.

Google указал, что 2.5 Flash скоро придёт с 2M токенов контекста (blog.google от марта 2026 про мартовское обновление). На 31.07.2026 в docs официально указан 1M. Следите за анонсами.

Мультимодальность Gemini: где Google обгоняет всех

Заголовок раздела «Мультимодальность Gemini: где Google обгоняет всех»

Ключевое отличие Gemini от Claude и GPT — нативная мультимодальность. Одна модель обрабатывает текст, изображение, видео и аудио, без переключения на отдельные модели.

Что это даёт на практике (verified из ai.google.dev/gemini-api/docs):

Аудио на вход — до 9.5 часов на промпт.

  • Скорость токенизации: 32 токена в секунду аудио (1 минута = 1920 токенов).
  • Формат downsampling: 16 Kbps.
  • Поддерживаемые форматы: WAV, MP3, AIFF, AAC, OGG Vorbis, FLAC.
  • Многоканальный звук сводится в один.

Пример: часовой подкаст = ~115 000 токенов на вход. Двухчасовая лекция = ~230 000 токенов. Полный сериал из 8 часов интервью можно скормить одним промптом.

Видео на вход — целые фильмы. Google не публикует точный лимит длины видео в одном промпте, но с контекстом в 1M токенов вы можете скармливать полнометражные фильмы (2 часа при разумной резолюции укладываются в контекст).

Изображения на вход. Каждая модель Gemini 3.x принимает изображения (JPEG, PNG, WEBP, HEIC) как часть промпта. Text + image + video + audio можно смешивать в одном запросе.

Выход — текст. Все базовые Gemini-модели отдают только текст. Для генерации картинок — отдельные Nano Banana / Nano Banana Pro (см. статью [030]). Для генерации видео — Veo и Gemini Omni Flash. Для голоса — TTS-модели.

Это делает Gemini лучшим выбором для задач вроде: «прочитай видео звонка на 45 минут, вытащи главные решения», «прослушай 3-часовой подкаст и сделай summary», «разбери 200-страничный PDF с диаграммами и извлеки данные». В GPT и Claude такие задачи требуют отдельного пайплайна с транскрибацией и предобработкой.

Все цифры проверены на ai.google.dev/gemini-api/docs/models 31.07.2026:

Параметр3.6 Flash3.5 Flash3.5 Flash-Lite3.1 Flash-Lite3.1 Pro2.5 Pro
StatusGAGAGAGAPreviewGA
Input $/1M (text)$1.50$1.50$0.30$0.25$2.00 (≤200K)$1.25 (≤200K)
Output $/1M$7.50$9.00$2.50$1.50$12.00 (≤200K)$10.00 (≤200K)
Контекст1M1M1M1M1M1M
Max output64K64K64K64K64K64K
Аудио (input)ДаДаДаДа ($0.50 tier)ДаДа ($1.00 tier)
Видео (input)ДаДаДаДаДаДа
Изображения (input)ДаДаДаДаДаДа
Computer UseДаДаДаНетДаОграничено
Google Search groundingДа ($14/1000 после 5K)ДаДаДаДаДа ($35/1000)
Thinking defaultmediummediumminimalminimalhighmedium

Обрыв знаний. Google не публикует точную дату knowledge cutoff в docs — только упоминает, что «модели обучены на данных до определённой даты, и для свежих новостей всегда используйте Google Search grounding». На практике для 3.x-линейки Gemini обычно обрыв в диапазоне февраль–май 2026. Для точного ответа — всегда используйте Search grounding.

Возьмите за базу Gemini 3.6 Flash. Это универсальный дефолт. Дальше три вопроса:

  1. Задача массовая, качество Flash достаточно? — уходите вниз к 3.5 Flash-Lite или 3.1 Flash-Lite. Экономия в 5-6 раз на выходе.
  2. Задача сложная, критичная, требует reasoning? — поднимайтесь до 3.1 Pro Preview или Gemini 3 Deep Think через Ultra-подписку.
  3. Задача мультимодальная — видео, аудио, длинный документ с картинками? — любая Gemini обгоняет альтернативы. Начните с 3.6 Flash, потому что мультимодальность у него нативная и с 3.6 упрощена агентика.

Практическая эвристика: 3.6 Flash для агентов, 3.5 Flash-Lite для операций, 3.1 Pro для reasoning. Внутри этой сетки играйте с thinking budget: у Flash-Lite поднять thinking level временно на сложных запросах — часто дешевле, чем перейти на Pro.

Cross-ref с GPT-5.6 Sol/Terra/Luna (артикул 022):

МодельInput $/1MOutput $/1MКонтекстАудио на вход
Gemini 3.6 Flash$1.50$7.501MДа, 9.5ч
Gemini 3.1 Pro Preview$2.00 (≤200K)$12.00 (≤200K)1MДа, 9.5ч
GPT-5.6 Sol$5.00$30.001.05MНет (Realtime отдельно)
GPT-5.6 Terra$2.00$12.001.05MНет
GPT-5.6 Luna$0.20$1.201.05MНет

Три ключевых различия:

  • Мультимодальность. Gemini делает video + audio + image + text в одном API-вызове. У OpenAI для голоса нужен GPT-Realtime, для видео — GPT Videos. Разные API, разная разработка.
  • Цена reasoning. 3.1 Pro Preview ($12 выход) сравним по цене с Terra ($12), но заметно дешевле Sol ($30). Если вам нужно frontier-reasoning с мультимодальностью — Gemini 3.1 Pro сильно выгоднее Sol.
  • Кодинг и агенты. OpenAI сильнее в чистом кодинге и агентских бенчмарках. Google сильнее в мультимодальном понимании и long-context видео.

Если ваш продукт — про голос, видео, длинные документы с картинками — Gemini побеждает по цене и удобству. Если ваш продукт — про строгий код и агентские пайплайны — GPT-5.6 (Sol или Terra) часто выигрывает по качеству.

Cross-ref с Claude Sonnet 5 (артикул 019) и Claude Opus 5 (артикул 020):

МодельInput $/1MOutput $/1MКонтекстМультимодал
Gemini 3.6 Flash$1.50$7.501MПолный (audio 9.5ч)
Gemini 3.1 Pro Preview$2.00-4.00$12.00-18.001MПолный
Claude Sonnet 5см. article 019см. article 019см. article 019Text + image only
Claude Opus 5см. article 020см. article 020см. article 020Text + image only

Claude не поддерживает нативно аудио и видео на входе — только текст и изображения. Если вам нужна работа с голосом или видео — Gemini единственный из трёх big-3, кто делает это в одном API.

Claude сильнее в стилистике текста и «характере ответа» (много агентов пишут через Claude именно поэтому). Gemini сильнее в мультимодальности и цене за длинный контекст. GPT-5.6 — в reasoning и кодинге.

Практический выбор: не бегите менять стек ради разницы в спеке. Прогоните свои реальные задачи на всех трёх — часто разница в качестве на вашей конкретной задаче важнее табличных различий.

Ключевая проблема: Google AI Studio и оплата Gemini API из России напрямую не работают. Google блокирует и создание аккаунта, и оплату с российских карт.

Что работает по состоянию на 31 июля 2026 (детали в статье [028] «Регистрация Google AI Studio и Gemini из России 2026»):

  1. Российские SaaS-агрегаторы. Принимают рубли, отдают доступ к Gemini API через свой прокси-endpoint. Ищите тех, кто прямо указывает gemini-3.6-flash / gemini-3.5-flash / gemini-3.1-pro в списке поддерживаемых.
  2. Vertex AI через юрлицо в дружественной юрисдикции. Для команд с оборотом самый устойчивый путь. Vertex AI Google Cloud даёт доступ к тем же моделям через enterprise-контур.
  3. Зарубежная карта + прокси для регистрации. Технически легально, но требует карты иностранного банка и адреса в поддерживаемой стране.
  4. Криптовалюта через посредника. Часть агрегаторов принимает USDT / BTC и выдаёт баланс на Gemini API.

Прямой Gemini App (потребительский интерфейс) из России блокируется на уровне логина. Существуют сторонние клиенты и «Gemini-like» интеграции в российские платформы, но это не Gemini API напрямую.

Для агентов и продуктов в РФ практический сетап: API-ключ через посредника + свой backend + оплата в рублях по курсу USD агрегатора. Данные к Google не улетают в открытый доступ, если посредник не мультиплексит запросы через свой ключ. Гарантий приватности здесь обычно меньше, чем у прямого доступа через Vertex AI.

Сценарий 1. Тегирование 100 000 карточек Wildberries с картинками. Задача типовая, тегов до 30 на карточку, вход — короткое описание + фото товара. Возьмите 3.5 Flash-Lite. Один запрос ~500 входных токенов + 200 выходных. На 100 000 карточек это 50M input + 20M output = $15 + $50 = $65 за весь батч. На 3.1 Pro Preview это стоило бы $220. Экономия в 3+ раза.

Сценарий 2. Анализ часовой записи звонка с клиентом. Задача — extract решений, задач, тон беседы. Один час аудио = ~115 000 токенов. Возьмите 3.6 Flash. Входа $0.17 + выход $0.02 (5000 токенов ответа) = ~$0.20 за один звонок. Ключевое: у Claude и GPT такую задачу пришлось бы транскрибировать отдельным пайплайном (Whisper + Sonnet). У Gemini — один вызов.

Сценарий 3. Юридический разбор 40-страничного договора. Задача редкая, ошибка стоит миллионы. Возьмите 3.1 Pro Preview. 40 страниц ≈ 30 000 токенов входа + 5 000 токенов ответа = $0.06 + $0.06 = $0.12 за разбор. Если разборов 20 в месяц — $2.40/месяц. Экономить на Flash здесь не имеет смысла — качество reasoning критично.

Сценарий 4. E-commerce сайт генерирует SEO-описания с картинкой товара. Средняя задача, 500 генераций в день, каждое описание 800 токенов на выход + картинка на входе. Возьмите 3.6 Flash. День = 400 000 output токенов + 500 картинок на вход = $3.00 output + $0.75 input = $3.75/день, ~$113/месяц. На 3.5 Flash-Lite это стоило бы $37/месяц, на 3.1 Pro — $270/месяц. 3.6 Flash — правильный баланс.

Сценарий 5. Агент читает 300 PDF-договоров и находит пункты риска. Длинный контекст с изображениями (сканы PDF). Возьмите 3.1 Pro Preview для reasoning. Каждый договор ~50K токенов. Общий батч — 15M входа = $30 + выход $18 (1500 output/договор) = $48. За качество юридического reasoning платите единожды, за человеко-неделю юриста платить не пришлось бы.

Есть ли Ultra-модель у Gemini? Как отдельного model ID через API — нет. «Ultra» это уровень подписки Google Gemini App. Подписчики Ultra получают доступ к режиму Gemini 3 Deep Think — расширенному reasoning на базе Gemini 3 Pro. Через прямой Gemini API отдельная модель gemini-ultra не публикуется. Если нужен максимальный интеллект как разработчику — Gemini 3.1 Pro Preview.

Почему 3.6 Flash дешевле по выходу, чем 3.5 Flash, если он новее? Google оптимизировал 3.6 под меньший расход токенов на многошаговые задачи. Модель делает то же самое за меньше токенов, поэтому Google снизил цену выхода (7.50 против 9.00). Вход тот же ($1.50). Мигрируйте на 3.6 — сэкономите 15-20% на большинстве задач.

Что такое «context caching» и когда его использовать? Это механика Google — если вы часто отправляете одни и те же большие куски (system prompt, документ, база знаний) в несколько промптов, можно закешировать их через API. Кеш стоит $0.15 за 1M токенов на 3.6 Flash + $1.00 за хранение 1M токенов в час. Если один и тот же документ пересылается 20+ раз в день, кеш окупается кратно.

Реальный контекст на всех моделях — 1M токенов? Да, verified из ai.google.dev на всех Gemini 3.x + 2.5. Максимум выхода — 64K. Google обещал 2M токенов для 2.5 Pro в мартовском блог-посте, но в docs 31.07.2026 всё ещё указан 1M. Следите за анонсами. Long-context surcharge у 3.1 Pro Preview срабатывает при 200K — цена вход/выход удваивается для промптов больше этого порога.

Можно ли использовать Gemini для генерации картинок или видео? Не напрямую через основную модель — базовая Gemini отдаёт только текст. Для генерации картинок — Nano Banana / Nano Banana Pro / Nano Banana 2 (см. статью [030]). Для видео — Veo 3.1 и Gemini Omni Flash Preview. Всё в том же Gemini API, но через разные model IDs.

В чём преимущество Gemini перед GPT и Claude для российского пользователя? Единственное объективное — стоимость reasoning с мультимодальностью. Если задача требует и «глубокого думания», и работы с аудио/видео, Gemini дешевле GPT-Sol и функциональнее Claude. Но: доступ из РФ у Gemini сложнее, чем у Claude через Anthropic direct или у OpenAI через посредников. Взвешивайте цену доступа против цены API.

Обрыв знаний у Gemini 3.x — какая точно дата? Google не публикует точную дату knowledge cutoff. По косвенным данным (упоминания событий в ответах модели, тестовые вопросы) — для 3.6 Flash обрыв в диапазоне февраль–апрель 2026. Для 2.5 Pro — конец 2024. Практический вывод: для актуальных вопросов всегда используйте Google Search grounding как инструмент. Это встроено во все Gemini 3.x и стоит $14 за 1000 запросов после первых 5000 бесплатных.

  • Артикул 022 — GPT-5.6 Sol, Terra, Luna: сравнение с Gemini 3.x.
  • Артикул 019 — Claude Sonnet 4.6 для российского пользователя.
  • Артикул 020 — Claude Sonnet 5 разбор.
  • Артикул 028 — Регистрация Google AI Studio и Gemini API из России 2026.
  • Артикул 030 — Nano Banana Pro и генерация картинок через Gemini.
  • Артикул 011 — Big-3 сравнение Claude / GPT / Gemini в единой таблице.
  • Артикул 009 — Мультимодальность LLM: как работает audio-in / video-in.

Все ссылки проверены 31.07.2026. Модельные страницы и docs — первоисточник Google AI for Developers.

  1. Gemini API: Models overview — сводная таблица всех Gemini-моделей, статусы, описания. Проверено 31.07.2026.
  2. Gemini Developer API pricing — цены input / output / context caching для всех моделей 3.x и 2.5. Проверено 31.07.2026.
  3. Gemini API: Latest Gemini models — What’s new in 3.6 Flash — migration guide для 3.6 Flash и 3.5 Flash-Lite. Проверено 31.07.2026.
  4. Gemini API: Long context — про контекст 1M-2M токенов. Проверено 31.07.2026.
  5. Gemini API: Audio understanding — лимит 9.5 часов аудио на промпт, форматы, токенизация. Проверено 31.07.2026.
  6. Google Blog: Gemini 3 launch (Nov 18, 2025) — анонс Gemini 3 Pro и Deep Think. Проверено 31.07.2026.
  7. Google DeepMind: Gemini 2.5 announcement (Mar 2025) — про 1M/2M контекст 2.5 Pro. Проверено 31.07.2026.
  8. Google AI for Developers: Available regions — регионы, где доступен Gemini API напрямую (Россия не в списке). Проверено 31.07.2026.

Актуально на 31.07.2026. Модели, цены и условия доступа меняются часто. Перед бизнес-решением всегда сверяйся с первоисточником — все ссылки в разделе Sources выше. Google меняет статусы моделей (Preview → GA → Deprecated) регулярно; следующие обновления публикуются в разделе Release notes ai.google.dev. RU-специфика доступа (посредники, Vertex AI через юрлицо) может измениться быстрее, чем прайс, — сверяйся отдельно перед оплатой.