Перейти к содержимому

Что такое мультимодальный AI: текст, картинки, звук в одной модели

Автор: Silvana · Дата: 30.07.2026 · Verified: 30.07.2026 · Reading time: 5 минут · Prerequisite: 002

  • Мультимодальная модель = одна модель принимает и/или выдаёт несколько типов данных: текст, картинки, PDF, аудио, видео.
  • В 2026 стандарт для frontier моделей: Claude Sonnet 5 / Opus 5 / Fable 5, GPT-5.6 (Sol / Terra / Luna), Gemini 3.5-3.6 — все понимают текст и изображения.
  • Голос в реальном времени: OpenAI gpt-realtime-2.1, Gemini Live API. Отдельный gpt-realtime-translate для потокового перевода речи.
  • Аудио на вход (не realtime): Gemini понимает файлы до 9,5 часов. Claude 5 официально работает с текстом и изображениями, аудио — через связку с транскрипцией.
  • Генерация картинок: Nano Banana Pro (Gemini 3 Pro Image) до 4K, GPT Image 2 (gpt-image-2) через API OpenAI.
  • Открытый мультимодал: Qwen2.5-VL (3B / 7B / 72B), Llama 4 Vision, LLaVA-NeXT — можно скачать веса и запустить у себя.

Модальность — тип входных данных. Текст, изображение, аудио, видео, PDF — разные модальности. Раньше на каждую был свой отдельный AI: одна модель распознавала речь, вторая описывала картинки, третья писала тексты. Между собой они не связаны, обмен через файлы.

Мультимодальная модель — одна нейросеть, которая работает с несколькими модальностями сразу. Показал скриншот с ошибкой и спросил «что тут не так?» — она видит и пиксели, и текст, и ответ пишет тем же chat-интерфейсом.

Аналогия. Раньше в офисе работали три сотрудника: один читал письма, другой смотрел фотографии, третий слушал звонки. Между собой они не общались. Теперь пришёл универсал, который умеет всё сразу — можно скинуть ему фото с записью разговора и спросить, кто на фото и о чём говорят.

Практически: вы фотографируете страницу учебника на английском и пишете «переведи и объясни термины». Модель распознаёт текст на картинке, переводит, объясняет. Одна отправка, один ответ. В 2020 году это была цепочка из 3-4 сервисов.

По официальной документации platform.claude.com/docs/en/build-with-claude/vision все текущие модели Claude поддерживают ввод текста и изображений на всех тарифах — Fable 5, Opus 5, Sonnet 5, Haiku 4.5.

Что понимает:

  • PNG, JPEG, WEBP, GIF (не анимированные) — форматы стандартные.
  • До 100 изображений в одном запросе через API.
  • Рекомендованный размер — до 1,15 мегапикселя (например, 1092×1092 пикселей). Большие изображения автоматически уменьшаются до этого предела на стандартном тарифе.
  • Есть режим high-resolution (например, для скриншотов интерфейсов и плотных документов) — там сохраняются изображения до 4K без даунсемпла, но токенов расходуется до трёх раз больше.
  • Входные PDF обрабатываются как последовательность изображений страницы + текст.

Что НЕ делает Claude сам:

  • Не работает с аудио и видео на вход напрямую. Для звонков — расшифровка внешним сервисом, потом текст в Claude.
  • Не генерирует изображения. Для картинок связка с внешними инструментами.
  • Не идентифицирует людей на фото (отказывается по политике).

Официальные ограничения из документации:

  • Может ошибиться на очень маленьких изображениях (меньше 200 пикселей), размытых и повёрнутых.
  • Не подходит для интерпретации сложных медицинских снимков (КТ, МРТ).
  • Не определяет, сгенерирована ли картинка AI.

GPT-5.6 Sol / Terra / Luna: текст, изображения, аудио, реальный голос

Заголовок раздела «GPT-5.6 Sol / Terra / Luna: текст, изображения, аудио, реальный голос»

По документации developers.openai.com/api/docs/guides/images-vision все модели семейства GPT-5.6 понимают текст и изображения. Голос и живой аудио-режим вынесены в отдельное семейство Realtime.

Что понимает по картинкам:

  • PNG, JPEG, WEBP, GIF (не анимированные).
  • До 1 500 изображений в одном запросе, суммарный размер payload до 512 МБ.
  • Параметрdetail(low / high / original / auto) регулирует, насколько модель тратит токены на разбор изображения.
  • На GPT-5.5 и GPT-5.6 значение auto равно original.

Голосовой стек OpenAI (отдельные модели по developers.openai.com/api/docs/guides/realtime):

  • gpt-realtime-2.1— низкоалатентный голосовой агент. Модель слушает, отвечает голосом, вызывает инструменты. Работает через WebRTC (браузер) или WebSocket (серверные пайплайны).
  • gpt-realtime-translate— потоковый устный перевод. Клиент стримит речь, сервис отдаёт переведённую речь + текстовые дельты.
  • gpt-live-transcribe— стриминговая транскрипция (текст без ответов модели).

Генерация картинок:отдельная модель gpt-image-2 (в семействе GPT Image). Вызывается либо через Responses API как инструментimage_generation, либо через отдельный Image API.

Gemini 3.5 / 3.6: изображения, видео, аудио, генерация до 4K

Заголовок раздела «Gemini 3.5 / 3.6: изображения, видео, аудио, генерация до 4K»

По документации ai.google.dev/gemini-api/docs Gemini исторически позиционируется как модель, «мультимодальная с рождения», и на 2026 год этот акцент сохраняется.

Изображения (ai.google.dev/gemini-api/docs/image-understanding):

  • PNG, JPEG, WEBP, HEIC, HEIF.
  • До 3 600 изображений в одном запросе — самый большой лимит среди трёх семейств.
  • Токенизация: 258 токенов, если обе стороны ≤ 384 пикселей. Большие изображения режутся на плитки 768×768, каждая плитка = 258 токенов.
  • В Gemini 3 добавлен параметрmedia_resolutionдля точного контроля токенов на изображение и кадр видео.

Аудио (ai.google.dev/gemini-api/docs/audio):

  • До9,5 часоваудио в одном запросе — рекорд среди frontier моделей.
  • 32 токена на секунду аудио (1 минута ≈ 1 920 токенов).
  • Поддерживается speaker diarization (кто из говорящих сказал что) и распознавание эмоций (happy / sad / angry / neutral).
  • Понимает не только речь, но и не-речевые звуки (птицы, сирены и т. п.).

Живой голос:Live API — двухсторонний стрим для голосовых агентов, плюс отдельные preview модели 3.5 Live Translate, 3.1 Flash Live, 3.1 Flash TTS.

Генерация изображений (ai.google.dev/gemini-api/docs/image-generation) — Nano Banana:

  • Nano Banana Pro(Gemini 3 Pro Image,gemini-3-pro-image) — премиум: сложные визуальные задачи, брендовая консистентность, точный текст на картинке.
  • Nano Banana 2(Gemini 3.1 Flash Image,gemini-3.1-flash-image) — рабочая лошадка: генерация до 4K, надёжный рендер текста, работа с несколькими референсами.
  • Nano Banana 2 Lite(Gemini 3.1 Flash Lite Image) — самый быстрый и дешёвый.
  • Nano Banana(Gemini 2.5 Flash Image) — легаси, Google рекомендует переходить на Nano Banana 2 Lite.
  • Все сгенерированные картинки помечаются водяным знаком SynthID.

Открытые мультимодальные модели: Qwen2.5-VL и Llama Vision

Заголовок раздела «Открытые мультимодальные модели: Qwen2.5-VL и Llama Vision»

Если задача требует работать на своём сервере без облака — есть открытые мультимодальные модели с публичными весами. По официальной страничке huggingface.co/docs/transformers/main/en/model_doc/qwen2_5_vl:

  • Qwen2.5-VLот Alibaba — vision-language модель в трёх размерах: 3B, 7B, 72B параметров. Предобучена на 4,1 трлн токенов. Использует window attention в ViT энкодере для ускорения, динамический FPS-семплинг для видео и MRoPE (multi-resolutional rotary positional encoding) для лучшего понимания временной динамики.
  • Llama 4 Visionот Meta — открытые веса, доступ через Hugging Face.
  • LLaVA-NeXT— сообщество, комбинирует открытые LLM (Llama, Vicuna) с визуальными энкодерами (CLIP-подобные).
  • Из документации Transformers-библиотеки видно, что за 2026 год список открытых VLM растёт: Kimi K-2.5, Gemma 4, InternVL, Pixtral, DeepseekVL и десятки других.

Открытые модели уступают frontier моделям в качестве, но дают полный контроль: данные не уходят в облако, модель можно дообучить на своих данных, стоимость инференса — только железо.

Ключевые ограничения (важно для практики)

Заголовок раздела «Ключевые ограничения (важно для практики)»
  • Текст внутри изображений при генерации— исторически слабая точка всех генераторов. Nano Banana 2 и Pro специально позиционируются как «reliable text rendering». gpt-image-2 тоже улучшил рендер текста, но кириллица местами всё ещё ломается. Проверяй каждую картинку с текстом руками.
  • Длина видео.Gemini поддерживает часы видео (счётчик черезmedia_resolution), Claude и OpenAI работают с видео через покадровое разбиение — там лимиты жёстче.
  • Стоимость.Одно изображение в high-resolution режиме Claude Opus 5 = несколько тысяч токенов. Часовая аудиозапись в Gemini = ~115 000 токенов. Мультимодал дороже чистого текста.
  • Точность OCR.Модели читают текст с картинки, но для десятков страниц в день специализированные OCR (Yandex Vision, Tesseract) быстрее и дешевле.

Скинуть скриншот UI → «сделай UX-аудит».Claude Sonnet 5 хорошо разбирает интерфейсы. Просишь модель описать иерархию, найти проблемы, предложить правки. Для скриншотов лучше сразу переключиться на high-resolution режим — цена выше, но детали не потеряются.

Договор в PDF → «где невыгодные пункты».Claude умеет работать с PDF нативно (страницы обрабатываются как последовательность изображений + текст). Можно спросить «какие пункты защищают одну сторону в ущерб другой» — модель прочитает и подсветит.

Голосовое сообщение → расшифровать + ответить.Gemini 3.6 Flash принимает mp3 напрямую, отдаёт транскрипт с раздельными спикерами и эмоцией. Если нужна двухсторонняя беседа в реальном времени — GPT-realtime-2.1 через Live API или Gemini Live API.

Проверить работу дизайнера.Скидываешь Nano Banana Pro референс + бриф — она сгенерирует до 4K, с относительно точным текстом на картинке (для инфографики или обложек).

Актуально на 30.07.2026. Мультимодальные возможности моделей меняются быстрее всего остального — за квартал появляются новые версии, новые лимиты и новые модальности. Перед бизнес-решением всегда сверяйся с первоисточниками по ссылкам выше.