Gemini 3.5, 3.6 Flash и 3.1 Pro в 2026: какую модель Google выбрать
Автор: Silvana · Дата: 31.07.2026 · Verified: 01.09.2026 · Reading time: 11 минут · Prerequisite: 002, 009, 011
Gemini в 2026 — это шесть моделей поколения 3.x плюс живая ветка 2.5 Pro для миграции. Флагман Flash — gemini-3.6-flash ($1.50/$7.50 за 1M токенов, дефолт для агентов и мультимодальных задач), сильнейший reasoner — gemini-3.1-pro-preview ($2/$12 до 200K, дальше $4/$18), самый экономный — gemini-3.1-flash-lite ($0.25/$1.50 за текст). Единый контекст 1 000 000 токенов на всю линейку, нативная работа с текстом, изображениями, видео и аудио (до 9.5 часов на промпт). Отдельного gemini-ultra в API нет — «Ultra» это уровень подписки Google, дающий доступ к Gemini 3 Deep Think.
- У Google в продакшне сейчас шесть моделей Gemini поколения 3.x и стабильные Gemini 2.5 Pro / 2.5 Flash / 2.5 Flash-Lite для тех, кто ещё не мигрировал.
- Gemini 3.6 Flash (
gemini-3.6-flash) — самая свежая GA-модель, $1.50 вход / $7.50 выход за 1M токенов. Дефолт для агентских и мультимодальных задач. - Gemini 3.5 Flash (
gemini-3.5-flash) — предыдущий флагман линейки Flash, $1.50 / $9.00. Всё ещё сильнейший 3.5 для сложных агентов. - Gemini 3.5 Flash-Lite (
gemini-3.5-flash-lite) — самый быстрый и дешёвый в 3.5-семье, $0.30 / $2.50. Для массовых операций. - Gemini 3.1 Flash-Lite (
gemini-3.1-flash-lite) — $0.25 / $1.50 за текст. Ещё дешевле, всё ещё стабильна. - Gemini 3.1 Pro (
gemini-3.1-pro-preview) — топ по интеллекту в 3.x, $2.00 / $12.00 до 200K токенов, $4.00 / $18.00 выше. Для reasoning, кода и агентов. - Ultra-тир как отдельного model ID не существует. «Ultra» — уровень подписки Google, дающий доступ к Gemini 3 Deep Think (расширенный reasoning-режим на базе Pro). Через API отдельной модели
gemini-ultraнет. - Единое контекстное окно на всей 3.x-линейке: 1 000 000 токенов вход, 64 000 токенов выход.
- Мультимодальность нативная: текст, изображение, видео, аудио (до 9.5 часов на промпт).
- В РФ прямая оплата и Google AI Studio недоступны напрямую — см. раздел RU-специфика доступа.
Что это и зачем
Заголовок раздела «Что это и зачем»Google построил линейку Gemini иначе, чем OpenAI и Anthropic. Вместо трёх «размеров одной модели» (Sol/Terra/Luna у GPT-5.6 или Haiku/Sonnet/Opus у Claude) — у Google две живые семьи: Flash (скорость + баланс) и Pro (максимум интеллекта). Внутри каждой семьи — несколько поколений (3.1, 3.5, 3.6), которые сосуществуют, пока идёт миграция.
Мысленный образ: если OpenAI даёт три машины одной марки под три бюджета, Google даёт две линии — «городская» (Flash: все Flash-модели быстрые, но с разным уровнем интеллекта) и «шоссейная» (Pro: сильнее в дальней дороге, но дороже за километр). Ultra — это не третья машина, а «выделенная полоса» для владельцев премиум-подписки, где Pro работает с расширенным reasoning.
Для маркетолога это значит: выбор идёт не через размер модели, а через задачу. Если задача про «объём быстро» — почти всегда Flash. Если про «глубокое рассуждение» — Pro. Если про «мультимодальность» (видео, аудио, длинный документ с изображениями) — любая Gemini обгоняет GPT и Claude из коробки, потому что мультимодальность здесь нативная, а не подключаемая через отдельную модель.
Основной разбор
Заголовок раздела «Основной разбор»Обзор актуальной линейки Gemini 3.x
Заголовок раздела «Обзор актуальной линейки Gemini 3.x»По состоянию на 31 июля 2026 в ai.google.dev в статусе Stable (готовы для продакшна) находятся:
| Модель | Model ID | Позиция |
|---|---|---|
| Gemini 3.6 Flash | gemini-3.6-flash | Свежая GA, дефолт |
| Gemini 3.5 Flash | gemini-3.5-flash | Предыдущий Flash-флагман |
| Gemini 3.5 Flash-Lite | gemini-3.5-flash-lite | Быстрый и дешёвый |
| Gemini 3.1 Flash-Lite | gemini-3.1-flash-lite | Ещё дешевле, стабильна |
В статусе Preview (доступны в AI Studio, но не рекомендованы для критичного продакшна):
| Модель | Model ID | Позиция |
|---|---|---|
| Gemini 3.1 Pro Preview | gemini-3.1-pro-preview | Топ по интеллекту |
| Gemini 3 Flash Preview | gemini-3-flash-preview | Frontier-класс за долю цены |
| Gemini 3.5 Live Translate | gemini-3.5-live-translate-preview | Речевая трансляция 70+ языков |
| Gemini 3.1 Flash Live Preview | gemini-3.1-flash-live-preview | Аудио-в-аудио для голосовых агентов |
| Gemini 3.1 Flash TTS Preview | gemini-3.1-flash-tts-preview | Синтез речи |
| Gemini Omni Flash Preview | gemini-omni-flash-preview | Генерация видео |
Отдельно живут генеративные модели медиа (Nano Banana, Nano Banana Pro, Nano Banana 2, Veo 3.1, Lyria 3, Imagen). Про Nano Banana Pro и генерацию картинок Gemini — отдельная статья [030].
Отдельно про Ultra. «Ultra» у Google — это не model ID, а название пользовательской подписки на Gemini App. Подписчики Ultra получают доступ к Gemini 3 Deep Think — режиму расширенного reasoning для Gemini 3 Pro, доступному через приложение и Vertex AI. Через прямой Gemini API отдельная модель gemini-ultra не публикуется. Если вы разработчик и вам нужен максимальный интеллект — используйте Gemini 3.1 Pro Preview.
Gemini 3.6 Flash (дефолт для агентов)
Заголовок раздела «Gemini 3.6 Flash (дефолт для агентов)»Это модель, которую Google рекомендует брать первой, если вы начинаете новый проект в июле 2026. Она заменила Gemini 3.5 Flash на позиции дефолта в Antigravity и других агентских скиллах.
Verified specs из ai.google.dev/gemini-api/docs/models (проверено 31.07.2026):
| Параметр | Значение |
|---|---|
| Model ID | gemini-3.6-flash |
| Статус | GA (Stable) |
| Контекст | 1 000 000 токенов |
| Максимум выхода | 64 000 токенов |
| Default thinking level | medium |
| Цена input | $1.50 за 1M токенов |
| Цена output | $7.50 за 1M токенов (включая thinking-токены) |
| Context caching | $0.15 за 1M + $1.00 хранение / 1M токенов в час |
| Модальности вход | Текст, изображение, видео, аудио |
| Модальности выход | Текст |
| Инструменты | Google Search grounding, Google Maps, Computer Use, File Search, Code execution, URL context |
| Свободный тариф | Free of charge |
Что нового в 3.6 Flash по сравнению с 3.5 Flash (из ai.google.dev):
- Сокращение токенов и тёрнов. Меньше шагов рассуждения и вызовов инструментов на одну и ту же многошаговую задачу.
- Улучшенная генерация кода. Меньше «отладочных петель», выше качество production-ready кода.
- Лучшее следование инструкциям. Меньше нежелательных правок файлов в диагностических задачах.
- Сильнее мультимодальность и пространственное рассуждение. Диаграммы, blueprints, мультиэлементные веб-макеты.
- Native Computer Use. UI-автоматизация как встроенный инструмент.
- Ниже цена вывода. $7.50 против $9.00 у 3.5 Flash. Вход одинаковый ($1.50).
Когда брать 3.6 Flash: агенты, вибекодинг, интеграция с браузером и десктопом, работа с длинными мультимодальными документами (PDF с изображениями и аудиовставками), продуктовые чат-боты с рассуждением. Это «универсальный дефолт» — если нет причин брать что-то другое, начинайте с него.
Gemini 3.5 Flash (сильный, но не самый свежий)
Заголовок раздела «Gemini 3.5 Flash (сильный, но не самый свежий)»3.5 Flash по-прежнему в GA. Google описывает его как «most intelligent model for sustained frontier performance on agentic and coding tasks». Формально по бенчмаркам 3.5 Flash даже сильнее 3.6 в reasoning-задачах — 3.6 Google выпустил как «более эффективную» модель: чуть слабее по потолку, зато дешевле по выходу и меньше токенов ест.
Verified specs из ai.google.dev/gemini-api/docs/models:
| Параметр | Значение |
|---|---|
| Model ID | gemini-3.5-flash |
| Статус | GA (Stable) |
| Контекст | 1 000 000 токенов |
| Максимум выхода | 64 000 токенов |
| Default thinking level | medium |
| Цена input | $1.50 за 1M токенов |
| Цена output | $9.00 за 1M токенов |
| Context caching | $0.15 за 1M + $1.00 хранение / 1M токенов в час |
| Модальности вход | Текст, изображение, видео, аудио |
| Модальности выход | Текст |
Когда брать 3.5 Flash: если у вас уже был production на 3.5 и вы не хотите мигрировать; если ваши бенчмарки показывают, что 3.5 даёт лучше результат на конкретной задаче; или если вам нужна модель, у которой более длительная история стабильности в проде.
Разница в цене на выходе (9.00 против 7.50) — это 20% экономии в пользу 3.6, что при большом объёме токенов становится ощутимо. Прогоните обе модели на своём A/B, прежде чем делать выбор.
Gemini 3.5 Flash-Lite (быстрый и дешёвый)
Заголовок раздела «Gemini 3.5 Flash-Lite (быстрый и дешёвый)»Это флагман категории «дёшево + быстро». Google описывает его как «fastest, most cost-effective 3.5 model for high-throughput execution».
Verified specs из ai.google.dev/gemini-api/docs/models:
| Параметр | Значение |
|---|---|
| Model ID | gemini-3.5-flash-lite |
| Статус | GA (Stable) |
| Контекст | 1 000 000 токенов |
| Максимум выхода | 64 000 токенов |
| Default thinking level | minimal |
| Цена input | $0.30 (text / image / video / audio) за 1M токенов |
| Цена output | $2.50 за 1M токенов |
| Context caching | $0.03 за 1M + $1.00 хранение / 1M токенов в час |
| Модальности | Полная мультимодальность на входе |
Ключевое отличие Flash-Lite от старших братьев: default thinking level = minimal. Модель по умолчанию не тратит бюджет на «медленное размышление», а отвечает быстро. Для сложных задач можно поднять thinking-уровень руками в параметрах запроса, но пока держите его в минимуме — платите меньше.
Что улучшилось в 3.5 Flash-Lite по сравнению с 3.1 Flash-Lite (из ai.google.dev):
- Сниженная latency. Максимальный throughput в семье 3.5 для парсинга и извлечения данных.
- Улучшенное reasoning и мультимодал. HLE 18,0% против 11,0% у 2.5 Flash. CharXIV 74,5% против 63,7%.
- Оркестрация субагентов. Лучше держит цепочки MCP-инструментов.
- Понимание документов. Устойчивее извлекает структуру из PDF, таблиц.
- Chatbot persona persistence. Лучше держит роль и стиль между репликами.
- Native Computer Use. Как и у старших моделей.
Когда брать 3.5 Flash-Lite: массовые операции с текстом и мультимодалом, тегирование, классификация, извлечение полей из документов, first-line support-бот, батч-переводы, генерация коротких SEO-описаний, работа с длинными PDF-договорами (там где не нужен максимальный reasoning).
Gemini 3.1 Flash-Lite (самый бюджетный из стабильных)
Заголовок раздела «Gemini 3.1 Flash-Lite (самый бюджетный из стабильных)»Ещё дешевле, чем 3.5 Flash-Lite. Осталась в GA как «долгоживущая» модель для тех, кому важна стабильность цен и стабильность behavior.
Verified specs из ai.google.dev/gemini-api/docs/models:
| Параметр | Значение |
|---|---|
| Model ID | gemini-3.1-flash-lite |
| Статус | GA (Stable) |
| Контекст | 1 000 000 токенов |
| Максимум выхода | 64 000 токенов |
| Цена input | $0.25 (text / image / video), $0.50 (audio) за 1M токенов |
| Цена output | $1.50 за 1M токенов |
| Context caching | $0.025 (text/image/video), $0.05 (audio), $1.00 хранение |
| Модальности | Полная мультимодальность |
Когда брать 3.1 Flash-Lite: если у вас уже работают пайплайны на 3.1 и они стабильны; если вам критично держать бюджет ещё ниже, чем на 3.5 Flash-Lite; для внутренних инструментов с миллионами запросов, где качество Ultra не нужно.
3.1 Flash-Lite всё ещё поддерживается, но новые проекты Google рекомендует начинать с 3.5 Flash-Lite или 3.6 Flash. 3.1 постепенно двигается к «legacy» роли.
Gemini 3.1 Pro Preview (топ по интеллекту)
Заголовок раздела «Gemini 3.1 Pro Preview (топ по интеллекту)»Это самая мощная Gemini для reasoning, кода и агентов. Google описывает её как «latest performance, intelligence, and usability improvements to the best model family in the world for multimodal understanding, agentic capabilities, and vibe-coding».
Verified specs из ai.google.dev/gemini-api/docs/models:
| Параметр | Значение |
|---|---|
| Model ID | gemini-3.1-pro-preview (+ gemini-3.1-pro-preview-customtools) |
| Статус | Preview |
| Контекст | 1 000 000 токенов |
| Максимум выхода | 64 000 токенов |
| Цена input (≤ 200K токенов) | $2.00 за 1M токенов |
| Цена input (> 200K токенов) | $4.00 за 1M токенов |
| Цена output (≤ 200K токенов) | $12.00 за 1M токенов |
| Цена output (> 200K токенов) | $18.00 за 1M токенов |
| Context caching (≤ 200K) | $0.20 за 1M + $4.50 хранение |
| Context caching (> 200K) | $0.40 за 1M + $4.50 хранение |
| Модальности | Полная мультимодальность на входе |
| Свободный тариф | Не доступен |
Как и у GPT-5.6 Sol с его «long context surcharge», у Gemini 3.1 Pro тоже двухтарифная модель — если промпт больше 200K токенов, цена вход и выход растёт. Планируйте это в архитектуре: если ваши промпты около 250-300K — часто выгоднее разбить их или использовать context caching.
Когда брать 3.1 Pro: задачи, где стоимость ошибки высока и требуется reasoning уровня «PhD»; сложный код (вибекодинг), где важна архитектурная логика; агентские цепочки с многошаговым планированием; юридические разборы длинных документов; научные и финансовые анализы. Также — если вам нужен Deep Think через Vertex AI или подписку Ultra.
Gemini 2.5 Pro / Flash / Flash-Lite (стабильная предыдущая линейка)
Заголовок раздела «Gemini 2.5 Pro / Flash / Flash-Lite (стабильная предыдущая линейка)»2.5 всё ещё в проде и активно используется. Google не удалил их, потому что многие продукты завязаны на 2.5-behavior. Migration path из 2.5 в 3.x рекомендованный, но не обязательный.
Verified specs из ai.google.dev/gemini-api/docs/models:
| Модель | Model ID | Input | Output | Контекст |
|---|---|---|---|---|
| Gemini 2.5 Pro | gemini-2.5-pro | $1.25 (≤200K), $2.50 (>200K) | $10.00 (≤200K), $15.00 (>200K) | 1M |
| Gemini 2.5 Flash | gemini-2.5-flash | $0.30 (text/image/video), $1.00 (audio) | $2.50 | 1M |
| Gemini 2.5 Flash-Lite | gemini-2.5-flash-lite | $0.10 (text/image/video), $0.30 (audio) | $0.40 | 1M |
Заметьте: цены на 2.5 линейку ниже, чем на 3.x. Особенно ощутима разница на Pro: 2.5 Pro стоит $1.25 против $2.00 у 3.1 Pro Preview на текстах до 200K. Если вам не нужны свежие возможности 3.x (Computer Use, улучшенная агентика, native native native), 2.5 Pro остаётся сильным и более дешёвым выбором.
Google указал, что 2.5 Flash скоро придёт с 2M токенов контекста (blog.google от марта 2026 про мартовское обновление). На 31.07.2026 в docs официально указан 1M. Следите за анонсами.
Мультимодальность Gemini: где Google обгоняет всех
Заголовок раздела «Мультимодальность Gemini: где Google обгоняет всех»Ключевое отличие Gemini от Claude и GPT — нативная мультимодальность. Одна модель обрабатывает текст, изображение, видео и аудио, без переключения на отдельные модели.
Что это даёт на практике (verified из ai.google.dev/gemini-api/docs):
Аудио на вход — до 9.5 часов на промпт.
- Скорость токенизации: 32 токена в секунду аудио (1 минута = 1920 токенов).
- Формат downsampling: 16 Kbps.
- Поддерживаемые форматы: WAV, MP3, AIFF, AAC, OGG Vorbis, FLAC.
- Многоканальный звук сводится в один.
Пример: часовой подкаст = ~115 000 токенов на вход. Двухчасовая лекция = ~230 000 токенов. Полный сериал из 8 часов интервью можно скормить одним промптом.
Видео на вход — целые фильмы. Google не публикует точный лимит длины видео в одном промпте, но с контекстом в 1M токенов вы можете скармливать полнометражные фильмы (2 часа при разумной резолюции укладываются в контекст).
Изображения на вход. Каждая модель Gemini 3.x принимает изображения (JPEG, PNG, WEBP, HEIC) как часть промпта. Text + image + video + audio можно смешивать в одном запросе.
Выход — текст. Все базовые Gemini-модели отдают только текст. Для генерации картинок — отдельные Nano Banana / Nano Banana Pro (см. статью [030]). Для генерации видео — Veo и Gemini Omni Flash. Для голоса — TTS-модели.
Это делает Gemini лучшим выбором для задач вроде: «прочитай видео звонка на 45 минут, вытащи главные решения», «прослушай 3-часовой подкаст и сделай summary», «разбери 200-страничный PDF с диаграммами и извлеки данные». В GPT и Claude такие задачи требуют отдельного пайплайна с транскрибацией и предобработкой.
Сравнительная таблица (verified specs)
Заголовок раздела «Сравнительная таблица (verified specs)»Все цифры проверены на ai.google.dev/gemini-api/docs/models 31.07.2026:
| Параметр | 3.6 Flash | 3.5 Flash | 3.5 Flash-Lite | 3.1 Flash-Lite | 3.1 Pro | 2.5 Pro |
|---|---|---|---|---|---|---|
| Status | GA | GA | GA | GA | Preview | GA |
| Input $/1M (text) | $1.50 | $1.50 | $0.30 | $0.25 | $2.00 (≤200K) | $1.25 (≤200K) |
| Output $/1M | $7.50 | $9.00 | $2.50 | $1.50 | $12.00 (≤200K) | $10.00 (≤200K) |
| Контекст | 1M | 1M | 1M | 1M | 1M | 1M |
| Max output | 64K | 64K | 64K | 64K | 64K | 64K |
| Аудио (input) | Да | Да | Да | Да ($0.50 tier) | Да | Да ($1.00 tier) |
| Видео (input) | Да | Да | Да | Да | Да | Да |
| Изображения (input) | Да | Да | Да | Да | Да | Да |
| Computer Use | Да | Да | Да | Нет | Да | Ограничено |
| Google Search grounding | Да ($14/1000 после 5K) | Да | Да | Да | Да | Да ($35/1000) |
| Thinking default | medium | medium | minimal | minimal | high | medium |
Обрыв знаний. Google не публикует точную дату knowledge cutoff в docs — только упоминает, что «модели обучены на данных до определённой даты, и для свежих новостей всегда используйте Google Search grounding». На практике для 3.x-линейки Gemini обычно обрыв в диапазоне февраль–май 2026. Для точного ответа — всегда используйте Search grounding.
Как выбирать модель под задачу
Заголовок раздела «Как выбирать модель под задачу»Возьмите за базу Gemini 3.6 Flash. Это универсальный дефолт. Дальше три вопроса:
- Задача массовая, качество Flash достаточно? — уходите вниз к 3.5 Flash-Lite или 3.1 Flash-Lite. Экономия в 5-6 раз на выходе.
- Задача сложная, критичная, требует reasoning? — поднимайтесь до 3.1 Pro Preview или Gemini 3 Deep Think через Ultra-подписку.
- Задача мультимодальная — видео, аудио, длинный документ с картинками? — любая Gemini обгоняет альтернативы. Начните с 3.6 Flash, потому что мультимодальность у него нативная и с 3.6 упрощена агентика.
Практическая эвристика: 3.6 Flash для агентов, 3.5 Flash-Lite для операций, 3.1 Pro для reasoning. Внутри этой сетки играйте с thinking budget: у Flash-Lite поднять thinking level временно на сложных запросах — часто дешевле, чем перейти на Pro.
Gemini 3.x vs GPT-5.6
Заголовок раздела «Gemini 3.x vs GPT-5.6»Cross-ref с GPT-5.6 Sol/Terra/Luna (артикул 022):
| Модель | Input $/1M | Output $/1M | Контекст | Аудио на вход |
|---|---|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 | 1M | Да, 9.5ч |
| Gemini 3.1 Pro Preview | $2.00 (≤200K) | $12.00 (≤200K) | 1M | Да, 9.5ч |
| GPT-5.6 Sol | $5.00 | $30.00 | 1.05M | Нет (Realtime отдельно) |
| GPT-5.6 Terra | $2.00 | $12.00 | 1.05M | Нет |
| GPT-5.6 Luna | $0.20 | $1.20 | 1.05M | Нет |
Три ключевых различия:
- Мультимодальность. Gemini делает video + audio + image + text в одном API-вызове. У OpenAI для голоса нужен GPT-Realtime, для видео — GPT Videos. Разные API, разная разработка.
- Цена reasoning. 3.1 Pro Preview ($12 выход) сравним по цене с Terra ($12), но заметно дешевле Sol ($30). Если вам нужно frontier-reasoning с мультимодальностью — Gemini 3.1 Pro сильно выгоднее Sol.
- Кодинг и агенты. OpenAI сильнее в чистом кодинге и агентских бенчмарках. Google сильнее в мультимодальном понимании и long-context видео.
Если ваш продукт — про голос, видео, длинные документы с картинками — Gemini побеждает по цене и удобству. Если ваш продукт — про строгий код и агентские пайплайны — GPT-5.6 (Sol или Terra) часто выигрывает по качеству.
Gemini 3.x vs Claude Sonnet 5
Заголовок раздела «Gemini 3.x vs Claude Sonnet 5»Cross-ref с Claude Sonnet 5 (артикул 019) и Claude Opus 5 (артикул 020):
| Модель | Input $/1M | Output $/1M | Контекст | Мультимодал |
|---|---|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 | 1M | Полный (audio 9.5ч) |
| Gemini 3.1 Pro Preview | $2.00-4.00 | $12.00-18.00 | 1M | Полный |
| Claude Sonnet 5 | см. article 019 | см. article 019 | см. article 019 | Text + image only |
| Claude Opus 5 | см. article 020 | см. article 020 | см. article 020 | Text + image only |
Claude не поддерживает нативно аудио и видео на входе — только текст и изображения. Если вам нужна работа с голосом или видео — Gemini единственный из трёх big-3, кто делает это в одном API.
Claude сильнее в стилистике текста и «характере ответа» (много агентов пишут через Claude именно поэтому). Gemini сильнее в мультимодальности и цене за длинный контекст. GPT-5.6 — в reasoning и кодинге.
Практический выбор: не бегите менять стек ради разницы в спеке. Прогоните свои реальные задачи на всех трёх — часто разница в качестве на вашей конкретной задаче важнее табличных различий.
RU-специфика доступа
Заголовок раздела «RU-специфика доступа»Ключевая проблема: Google AI Studio и оплата Gemini API из России напрямую не работают. Google блокирует и создание аккаунта, и оплату с российских карт.
Что работает по состоянию на 31 июля 2026 (детали в статье [028] «Регистрация Google AI Studio и Gemini из России 2026»):
- Российские SaaS-агрегаторы. Принимают рубли, отдают доступ к Gemini API через свой прокси-endpoint. Ищите тех, кто прямо указывает
gemini-3.6-flash/gemini-3.5-flash/gemini-3.1-proв списке поддерживаемых. - Vertex AI через юрлицо в дружественной юрисдикции. Для команд с оборотом самый устойчивый путь. Vertex AI Google Cloud даёт доступ к тем же моделям через enterprise-контур.
- Зарубежная карта + прокси для регистрации. Технически легально, но требует карты иностранного банка и адреса в поддерживаемой стране.
- Криптовалюта через посредника. Часть агрегаторов принимает USDT / BTC и выдаёт баланс на Gemini API.
Прямой Gemini App (потребительский интерфейс) из России блокируется на уровне логина. Существуют сторонние клиенты и «Gemini-like» интеграции в российские платформы, но это не Gemini API напрямую.
Для агентов и продуктов в РФ практический сетап: API-ключ через посредника + свой backend + оплата в рублях по курсу USD агрегатора. Данные к Google не улетают в открытый доступ, если посредник не мультиплексит запросы через свой ключ. Гарантий приватности здесь обычно меньше, чем у прямого доступа через Vertex AI.
Практика (5 сценариев)
Заголовок раздела «Практика (5 сценариев)»Сценарий 1. Тегирование 100 000 карточек Wildberries с картинками. Задача типовая, тегов до 30 на карточку, вход — короткое описание + фото товара. Возьмите 3.5 Flash-Lite. Один запрос ~500 входных токенов + 200 выходных. На 100 000 карточек это 50M input + 20M output = $15 + $50 = $65 за весь батч. На 3.1 Pro Preview это стоило бы $220. Экономия в 3+ раза.
Сценарий 2. Анализ часовой записи звонка с клиентом. Задача — extract решений, задач, тон беседы. Один час аудио = ~115 000 токенов. Возьмите 3.6 Flash. Входа $0.17 + выход $0.02 (5000 токенов ответа) = ~$0.20 за один звонок. Ключевое: у Claude и GPT такую задачу пришлось бы транскрибировать отдельным пайплайном (Whisper + Sonnet). У Gemini — один вызов.
Сценарий 3. Юридический разбор 40-страничного договора. Задача редкая, ошибка стоит миллионы. Возьмите 3.1 Pro Preview. 40 страниц ≈ 30 000 токенов входа + 5 000 токенов ответа = $0.06 + $0.06 = $0.12 за разбор. Если разборов 20 в месяц — $2.40/месяц. Экономить на Flash здесь не имеет смысла — качество reasoning критично.
Сценарий 4. E-commerce сайт генерирует SEO-описания с картинкой товара. Средняя задача, 500 генераций в день, каждое описание 800 токенов на выход + картинка на входе. Возьмите 3.6 Flash. День = 400 000 output токенов + 500 картинок на вход = $3.00 output + $0.75 input = $3.75/день, ~$113/месяц. На 3.5 Flash-Lite это стоило бы $37/месяц, на 3.1 Pro — $270/месяц. 3.6 Flash — правильный баланс.
Сценарий 5. Агент читает 300 PDF-договоров и находит пункты риска. Длинный контекст с изображениями (сканы PDF). Возьмите 3.1 Pro Preview для reasoning. Каждый договор ~50K токенов. Общий батч — 15M входа = $30 + выход $18 (1500 output/договор) = $48. За качество юридического reasoning платите единожды, за человеко-неделю юриста платить не пришлось бы.
Есть ли Ultra-модель у Gemini?
Как отдельного model ID через API — нет. «Ultra» это уровень подписки Google Gemini App. Подписчики Ultra получают доступ к режиму Gemini 3 Deep Think — расширенному reasoning на базе Gemini 3 Pro. Через прямой Gemini API отдельная модель gemini-ultra не публикуется. Если нужен максимальный интеллект как разработчику — Gemini 3.1 Pro Preview.
Почему 3.6 Flash дешевле по выходу, чем 3.5 Flash, если он новее? Google оптимизировал 3.6 под меньший расход токенов на многошаговые задачи. Модель делает то же самое за меньше токенов, поэтому Google снизил цену выхода (7.50 против 9.00). Вход тот же ($1.50). Мигрируйте на 3.6 — сэкономите 15-20% на большинстве задач.
Что такое «context caching» и когда его использовать? Это механика Google — если вы часто отправляете одни и те же большие куски (system prompt, документ, база знаний) в несколько промптов, можно закешировать их через API. Кеш стоит $0.15 за 1M токенов на 3.6 Flash + $1.00 за хранение 1M токенов в час. Если один и тот же документ пересылается 20+ раз в день, кеш окупается кратно.
Реальный контекст на всех моделях — 1M токенов? Да, verified из ai.google.dev на всех Gemini 3.x + 2.5. Максимум выхода — 64K. Google обещал 2M токенов для 2.5 Pro в мартовском блог-посте, но в docs 31.07.2026 всё ещё указан 1M. Следите за анонсами. Long-context surcharge у 3.1 Pro Preview срабатывает при 200K — цена вход/выход удваивается для промптов больше этого порога.
Можно ли использовать Gemini для генерации картинок или видео? Не напрямую через основную модель — базовая Gemini отдаёт только текст. Для генерации картинок — Nano Banana / Nano Banana Pro / Nano Banana 2 (см. статью [030]). Для видео — Veo 3.1 и Gemini Omni Flash Preview. Всё в том же Gemini API, но через разные model IDs.
В чём преимущество Gemini перед GPT и Claude для российского пользователя? Единственное объективное — стоимость reasoning с мультимодальностью. Если задача требует и «глубокого думания», и работы с аудио/видео, Gemini дешевле GPT-Sol и функциональнее Claude. Но: доступ из РФ у Gemini сложнее, чем у Claude через Anthropic direct или у OpenAI через посредников. Взвешивайте цену доступа против цены API.
Обрыв знаний у Gemini 3.x — какая точно дата? Google не публикует точную дату knowledge cutoff. По косвенным данным (упоминания событий в ответах модели, тестовые вопросы) — для 3.6 Flash обрыв в диапазоне февраль–апрель 2026. Для 2.5 Pro — конец 2024. Практический вывод: для актуальных вопросов всегда используйте Google Search grounding как инструмент. Это встроено во все Gemini 3.x и стоит $14 за 1000 запросов после первых 5000 бесплатных.
Что дальше
Заголовок раздела «Что дальше»- Артикул 022 — GPT-5.6 Sol, Terra, Luna: сравнение с Gemini 3.x.
- Артикул 019 — Claude Sonnet 4.6 для российского пользователя.
- Артикул 020 — Claude Sonnet 5 разбор.
- Артикул 028 — Регистрация Google AI Studio и Gemini API из России 2026.
- Артикул 030 — Nano Banana Pro и генерация картинок через Gemini.
- Артикул 011 — Big-3 сравнение Claude / GPT / Gemini в единой таблице.
- Артикул 009 — Мультимодальность LLM: как работает audio-in / video-in.
Sources
Заголовок раздела «Sources»Все ссылки проверены 31.07.2026. Модельные страницы и docs — первоисточник Google AI for Developers.
- Gemini API: Models overview — сводная таблица всех Gemini-моделей, статусы, описания. Проверено 31.07.2026.
- Gemini Developer API pricing — цены input / output / context caching для всех моделей 3.x и 2.5. Проверено 31.07.2026.
- Gemini API: Latest Gemini models — What’s new in 3.6 Flash — migration guide для 3.6 Flash и 3.5 Flash-Lite. Проверено 31.07.2026.
- Gemini API: Long context — про контекст 1M-2M токенов. Проверено 31.07.2026.
- Gemini API: Audio understanding — лимит 9.5 часов аудио на промпт, форматы, токенизация. Проверено 31.07.2026.
- Google Blog: Gemini 3 launch (Nov 18, 2025) — анонс Gemini 3 Pro и Deep Think. Проверено 31.07.2026.
- Google DeepMind: Gemini 2.5 announcement (Mar 2025) — про 1M/2M контекст 2.5 Pro. Проверено 31.07.2026.
- Google AI for Developers: Available regions — регионы, где доступен Gemini API напрямую (Россия не в списке). Проверено 31.07.2026.
Актуальность
Заголовок раздела «Актуальность»Актуально на 31.07.2026. Модели, цены и условия доступа меняются часто. Перед бизнес-решением всегда сверяйся с первоисточником — все ссылки в разделе Sources выше. Google меняет статусы моделей (Preview → GA → Deprecated) регулярно; следующие обновления публикуются в разделе Release notes ai.google.dev. RU-специфика доступа (посредники, Vertex AI через юрлицо) может измениться быстрее, чем прайс, — сверяйся отдельно перед оплатой.