Что такое мультимодальный AI: текст, картинки, звук в одной модели
Автор: Silvana · Дата: 30.07.2026 · Verified: 30.07.2026 · Reading time: 5 минут · Prerequisite: 002
- Мультимодальная модель = одна модель принимает и/или выдаёт несколько типов данных: текст, картинки, PDF, аудио, видео.
- В 2026 стандарт для frontier моделей: Claude Sonnet 5 / Opus 5 / Fable 5, GPT-5.6 (Sol / Terra / Luna), Gemini 3.5-3.6 — все понимают текст и изображения.
- Голос в реальном времени: OpenAI gpt-realtime-2.1, Gemini Live API. Отдельный gpt-realtime-translate для потокового перевода речи.
- Аудио на вход (не realtime): Gemini понимает файлы до 9,5 часов. Claude 5 официально работает с текстом и изображениями, аудио — через связку с транскрипцией.
- Генерация картинок: Nano Banana Pro (Gemini 3 Pro Image) до 4K, GPT Image 2 (gpt-image-2) через API OpenAI.
- Открытый мультимодал: Qwen2.5-VL (3B / 7B / 72B), Llama 4 Vision, LLaVA-NeXT — можно скачать веса и запустить у себя.
Что это и зачем
Заголовок раздела «Что это и зачем»Модальность — тип входных данных. Текст, изображение, аудио, видео, PDF — разные модальности. Раньше на каждую был свой отдельный AI: одна модель распознавала речь, вторая описывала картинки, третья писала тексты. Между собой они не связаны, обмен через файлы.
Мультимодальная модель — одна нейросеть, которая работает с несколькими модальностями сразу. Показал скриншот с ошибкой и спросил «что тут не так?» — она видит и пиксели, и текст, и ответ пишет тем же chat-интерфейсом.
Аналогия. Раньше в офисе работали три сотрудника: один читал письма, другой смотрел фотографии, третий слушал звонки. Между собой они не общались. Теперь пришёл универсал, который умеет всё сразу — можно скинуть ему фото с записью разговора и спросить, кто на фото и о чём говорят.
Практически: вы фотографируете страницу учебника на английском и пишете «переведи и объясни термины». Модель распознаёт текст на картинке, переводит, объясняет. Одна отправка, один ответ. В 2020 году это была цепочка из 3-4 сервисов.
Основной разбор
Заголовок раздела «Основной разбор»Claude Sonnet 5 / Opus 5 / Fable 5: текст, изображения, PDF
Заголовок раздела «Claude Sonnet 5 / Opus 5 / Fable 5: текст, изображения, PDF»По официальной документации platform.claude.com/docs/en/build-with-claude/vision все текущие модели Claude поддерживают ввод текста и изображений на всех тарифах — Fable 5, Opus 5, Sonnet 5, Haiku 4.5.
Что понимает:
- PNG, JPEG, WEBP, GIF (не анимированные) — форматы стандартные.
- До 100 изображений в одном запросе через API.
- Рекомендованный размер — до 1,15 мегапикселя (например, 1092×1092 пикселей). Большие изображения автоматически уменьшаются до этого предела на стандартном тарифе.
- Есть режим high-resolution (например, для скриншотов интерфейсов и плотных документов) — там сохраняются изображения до 4K без даунсемпла, но токенов расходуется до трёх раз больше.
- Входные PDF обрабатываются как последовательность изображений страницы + текст.
Что НЕ делает Claude сам:
- Не работает с аудио и видео на вход напрямую. Для звонков — расшифровка внешним сервисом, потом текст в Claude.
- Не генерирует изображения. Для картинок связка с внешними инструментами.
- Не идентифицирует людей на фото (отказывается по политике).
Официальные ограничения из документации:
- Может ошибиться на очень маленьких изображениях (меньше 200 пикселей), размытых и повёрнутых.
- Не подходит для интерпретации сложных медицинских снимков (КТ, МРТ).
- Не определяет, сгенерирована ли картинка AI.
GPT-5.6 Sol / Terra / Luna: текст, изображения, аудио, реальный голос
Заголовок раздела «GPT-5.6 Sol / Terra / Luna: текст, изображения, аудио, реальный голос»По документации developers.openai.com/api/docs/guides/images-vision все модели семейства GPT-5.6 понимают текст и изображения. Голос и живой аудио-режим вынесены в отдельное семейство Realtime.
Что понимает по картинкам:
- PNG, JPEG, WEBP, GIF (не анимированные).
- До 1 500 изображений в одном запросе, суммарный размер payload до 512 МБ.
- Параметр
detail(low / high / original / auto) регулирует, насколько модель тратит токены на разбор изображения. - На GPT-5.5 и GPT-5.6 значение auto равно original.
Голосовой стек OpenAI (отдельные модели по developers.openai.com/api/docs/guides/realtime):
- gpt-realtime-2.1— низкоалатентный голосовой агент. Модель слушает, отвечает голосом, вызывает инструменты. Работает через WebRTC (браузер) или WebSocket (серверные пайплайны).
- gpt-realtime-translate— потоковый устный перевод. Клиент стримит речь, сервис отдаёт переведённую речь + текстовые дельты.
- gpt-live-transcribe— стриминговая транскрипция (текст без ответов модели).
Генерация картинок:отдельная модель gpt-image-2 (в семействе GPT Image). Вызывается либо через Responses API как инструментimage_generation, либо через отдельный Image API.
Gemini 3.5 / 3.6: изображения, видео, аудио, генерация до 4K
Заголовок раздела «Gemini 3.5 / 3.6: изображения, видео, аудио, генерация до 4K»По документации ai.google.dev/gemini-api/docs Gemini исторически позиционируется как модель, «мультимодальная с рождения», и на 2026 год этот акцент сохраняется.
Изображения (ai.google.dev/gemini-api/docs/image-understanding):
- PNG, JPEG, WEBP, HEIC, HEIF.
- До 3 600 изображений в одном запросе — самый большой лимит среди трёх семейств.
- Токенизация: 258 токенов, если обе стороны ≤ 384 пикселей. Большие изображения режутся на плитки 768×768, каждая плитка = 258 токенов.
- В Gemini 3 добавлен параметр
media_resolutionдля точного контроля токенов на изображение и кадр видео.
Аудио (ai.google.dev/gemini-api/docs/audio):
- До9,5 часоваудио в одном запросе — рекорд среди frontier моделей.
- 32 токена на секунду аудио (1 минута ≈ 1 920 токенов).
- Поддерживается speaker diarization (кто из говорящих сказал что) и распознавание эмоций (happy / sad / angry / neutral).
- Понимает не только речь, но и не-речевые звуки (птицы, сирены и т. п.).
Живой голос:Live API — двухсторонний стрим для голосовых агентов, плюс отдельные preview модели 3.5 Live Translate, 3.1 Flash Live, 3.1 Flash TTS.
Генерация изображений (ai.google.dev/gemini-api/docs/image-generation) — Nano Banana:
- Nano Banana Pro(Gemini 3 Pro Image,
gemini-3-pro-image) — премиум: сложные визуальные задачи, брендовая консистентность, точный текст на картинке. - Nano Banana 2(Gemini 3.1 Flash Image,
gemini-3.1-flash-image) — рабочая лошадка: генерация до 4K, надёжный рендер текста, работа с несколькими референсами. - Nano Banana 2 Lite(Gemini 3.1 Flash Lite Image) — самый быстрый и дешёвый.
- Nano Banana(Gemini 2.5 Flash Image) — легаси, Google рекомендует переходить на Nano Banana 2 Lite.
- Все сгенерированные картинки помечаются водяным знаком SynthID.
Открытые мультимодальные модели: Qwen2.5-VL и Llama Vision
Заголовок раздела «Открытые мультимодальные модели: Qwen2.5-VL и Llama Vision»Если задача требует работать на своём сервере без облака — есть открытые мультимодальные модели с публичными весами. По официальной страничке huggingface.co/docs/transformers/main/en/model_doc/qwen2_5_vl:
- Qwen2.5-VLот Alibaba — vision-language модель в трёх размерах: 3B, 7B, 72B параметров. Предобучена на 4,1 трлн токенов. Использует window attention в ViT энкодере для ускорения, динамический FPS-семплинг для видео и MRoPE (multi-resolutional rotary positional encoding) для лучшего понимания временной динамики.
- Llama 4 Visionот Meta — открытые веса, доступ через Hugging Face.
- LLaVA-NeXT— сообщество, комбинирует открытые LLM (Llama, Vicuna) с визуальными энкодерами (CLIP-подобные).
- Из документации Transformers-библиотеки видно, что за 2026 год список открытых VLM растёт: Kimi K-2.5, Gemma 4, InternVL, Pixtral, DeepseekVL и десятки других.
Открытые модели уступают frontier моделям в качестве, но дают полный контроль: данные не уходят в облако, модель можно дообучить на своих данных, стоимость инференса — только железо.
Ключевые ограничения (важно для практики)
Заголовок раздела «Ключевые ограничения (важно для практики)»- Текст внутри изображений при генерации— исторически слабая точка всех генераторов. Nano Banana 2 и Pro специально позиционируются как «reliable text rendering». gpt-image-2 тоже улучшил рендер текста, но кириллица местами всё ещё ломается. Проверяй каждую картинку с текстом руками.
- Длина видео.Gemini поддерживает часы видео (счётчик через
media_resolution), Claude и OpenAI работают с видео через покадровое разбиение — там лимиты жёстче. - Стоимость.Одно изображение в high-resolution режиме Claude Opus 5 = несколько тысяч токенов. Часовая аудиозапись в Gemini = ~115 000 токенов. Мультимодал дороже чистого текста.
- Точность OCR.Модели читают текст с картинки, но для десятков страниц в день специализированные OCR (Yandex Vision, Tesseract) быстрее и дешевле.
Практика
Заголовок раздела «Практика»Скинуть скриншот UI → «сделай UX-аудит».Claude Sonnet 5 хорошо разбирает интерфейсы. Просишь модель описать иерархию, найти проблемы, предложить правки. Для скриншотов лучше сразу переключиться на high-resolution режим — цена выше, но детали не потеряются.
Договор в PDF → «где невыгодные пункты».Claude умеет работать с PDF нативно (страницы обрабатываются как последовательность изображений + текст). Можно спросить «какие пункты защищают одну сторону в ущерб другой» — модель прочитает и подсветит.
Голосовое сообщение → расшифровать + ответить.Gemini 3.6 Flash принимает mp3 напрямую, отдаёт транскрипт с раздельными спикерами и эмоцией. Если нужна двухсторонняя беседа в реальном времени — GPT-realtime-2.1 через Live API или Gemini Live API.
Проверить работу дизайнера.Скидываешь Nano Banana Pro референс + бриф — она сгенерирует до 4K, с относительно точным текстом на картинке (для инфографики или обложек).
Sources
Заголовок раздела «Sources»- https://platform.claude.com/docs/en/build-with-claude/vision· проверено 30.07.2026
- https://platform.claude.com/docs/en/about-claude/models/overview· проверено 30.07.2026
- https://developers.openai.com/api/docs/guides/images-vision· проверено 30.07.2026
- https://developers.openai.com/api/docs/guides/realtime· проверено 30.07.2026
- https://ai.google.dev/gemini-api/docs/image-understanding· проверено 30.07.2026
- https://ai.google.dev/gemini-api/docs/audio· проверено 30.07.2026
- https://ai.google.dev/gemini-api/docs/image-generation· проверено 30.07.2026
- https://huggingface.co/docs/transformers/main/en/model_doc/qwen2_5_vl· проверено 30.07.2026
Актуальность
Заголовок раздела «Актуальность»Актуально на 30.07.2026. Мультимодальные возможности моделей меняются быстрее всего остального — за квартал появляются новые версии, новые лимиты и новые модальности. Перед бизнес-решением всегда сверяйся с первоисточниками по ссылкам выше.