Перейти к содержимому

Qwen 3 Max и open-source Qwen от Alibaba в 2026: Coder, VL, Omni и Qwen Chat

Автор: Silvana · Дата: 02.08.2026 · Verified: 01.09.2026 · Reading time: 11 минут · Prerequisite: 002, 011

Qwen — семейство моделей Alibaba Cloud, лидер open-source AI: почти 500 весов на HuggingFace под Apache 2.0, включая MoE-флагманы на 235B и 480B параметров. В линейке одновременно живут dense-модели (0.6B–32B) и MoE (Qwen3-30B-A3B и Qwen3-235B-A22B), плюс специализированные Qwen3-Coder (480B/35B для программирования), Qwen3-VL (235B/22B, vision + text) и Qwen3-Omni (30B/3B, text + image + audio + video, генерирует речь в реальном времени). Проприетарный флагман Qwen 3 Max доступен только через API Alibaba Cloud Model Studio (OpenAI- и Anthropic-совместимый, регионы от Пекина до Франкфурта). Веб-чат chat.qwen.ai, текущая модель в чате — Qwen3.7-Plus.

  • Qwen — семейство моделей от Alibaba Cloud (команда Qwen внутри Alibaba Group). Лидер open-source AI: почти все веса выложены под лицензией Apache 2.0, включая флагманские MoE-модели на 235B и 480B параметров.
  • В линейке одновременно живут dense и MoE архитектуры. Dense-модели — от 0.6B до 32B параметров, MoE — Qwen3-30B-A3B (30B / 3B активных) и Qwen3-235B-A22B (235B / 22B активных). Проприетарный флагман Qwen 3 Max доступен только через API.
  • Отдельные линейки под задачи: Qwen3-Coder (480B / 35B, программирование), Qwen3-VL (235B / 22B, vision + text), Qwen3-Omni (30B / 3B, text + image + audio + video, генерирует речь в реальном времени).
  • Контекст 256K токенов на MoE-моделях, расширяется до 1M токенов через YaRN и Dual Chunk Attention.
  • Веса выложены на Hugging Face и ModelScope. Self-hosting поддерживают Ollama, vLLM, SGLang, llama.cpp, LM Studio, MLX.
  • API доступен через Alibaba Cloud Model Studio (бывший DashScope) с OpenAI-совместимым, Anthropic-совместимым и нативным эндпоинтом. Регионы: Пекин, Гонконг, Сингапур, Токио, Франкфурт, США (Вирджиния).
  • Веб-чат — chat.qwen.ai. На 2 августа 2026 текущая доступная в чате модель — Qwen3.7-Plus.

Если DeepSeek — это китайский стартап-выскочка, а Llama — американский open-source-стандарт от Meta, то Qwen — это китайская корпорация, которая делает open-source нормой. Alibaba за три года выпустила больше открытых моделей семейства Llama/Qwen/DeepSeek, чем любой другой мировой вендор: почти 500 моделей на Hugging Face, все под Apache 2.0, все с полными весами.

Мысленный образ: это не одна модель и не флагман с двумя младшими братьями. Это библиотека под разные задачи и разное железо. Хотите чат-бота на ноутбуке — берите Qwen3-4B. Нужен production-агент на кластере — Qwen3-Coder-480B. Нужна модель, которая слушает голос и отвечает голосом — Qwen3-Omni. Всё это работает через один и тот же API-протокол и весь стек тулинга.

Для маркетолога и предпринимателя из РФ это значит одно: у вас есть путь к enterprise-grade AI, который не зависит от санкций. Веса можно скачать и поставить на свой сервер, лицензия Apache 2.0 разрешает коммерческое использование, дообучение под свои данные и продажу продукта на этом.

Линейка развивается быстро — примерно одна крупная итерация раз в полгода:

  • Qwen 1 / Qwen 1.5 (2023–2024) — первая волна, dense-модели до 72B. Мало кто в мире тогда замечал.
  • Qwen 2 / Qwen 2.5 (лето 2024 — начало 2025) — прорыв. Qwen2.5-72B по бенчмаркам догнал GPT-4 в базовых задачах. Появились специализированные модели: Qwen2.5-Coder, Qwen2.5-Math, Qwen2.5-VL.
  • Qwen 3 (апрель 2025 — сейчас) — переход на MoE-архитектуру, гибридный режим «thinking / non-thinking», 119 языков, объём предобучения удвоен до ~36T токенов.

В Q3-поколении окончательно сформировались подсерии, каждая под свою задачу:

  • Base — сырая предобученная модель для fine-tuning.
  • Instruct — инструкции-следование, дефолт для чат-агентов.
  • Thinking — режим «размышления» с блоками <think>...</think> перед ответом.
  • Coder — специализация на коде.
  • Math — специализация на математике.
  • VL (Vision-Language) — vision + текст.
  • Omni — text + image + audio + video, генерирует речь.
  • ASR / TTS — распознавание и синтез речи отдельными моделями (Qwen3-ASR).
  • Image — генерация изображений (Qwen-Image, 20B MMDiT).
  • Guard — safety-классификация (Qwen3Guard).

Релиз 29 апреля 2025 года (qwenlm.github.io/blog/qwen3, verified 02.08.2026).

Восемь моделей одним пакетом:

МодельТипПараметрыКонтекстЛицензия
Qwen3-0.6BDense0.6B32KApache 2.0
Qwen3-1.7BDense1.7B32KApache 2.0
Qwen3-4BDense4B128KApache 2.0
Qwen3-8BDense8B128KApache 2.0
Qwen3-14BDense14B128KApache 2.0
Qwen3-32BDense32.8B (31.2B non-embed)32K → 131K с YaRNApache 2.0
Qwen3-30B-A3BMoE30B total / 3B активных128KApache 2.0
Qwen3-235B-A22BMoE235B total / 22B активных256K → 1M с DCAApache 2.0

Ключевое:

  • Двухрежимная модель. Каждая Qwen3 умеет enable_thinking=True (пишет <think>...</think> перед ответом) и enable_thinking=False (быстрый ответ). Управляется параметром или тегами /think / /no_think в промпте.
  • 119 языков. Русский поддерживается, качество — на уровне флагманов.
  • Объём предобучения ~36T токенов — почти вдвое против Qwen 2.5. При этом Qwen3-1.7B/4B/8B/14B/32B-Base по бенчмаркам соответствуют Qwen2.5-3B/7B/14B/32B/72B-Base — то есть параметрическая эффективность выросла примерно в 2 раза.

Qwen 3 Max — это закрытая модель, доступная только через API на Alibaba Cloud Model Studio. Веса не выложены, архитектура публично не раскрыта. На 2 августа 2026 в консоли DashScope она проходит как qwen3.7-max (Alibaba использует минорные версии линейки Max: 3.5-max → 3.6-max → 3.7-max).

Что известно точно:

  • Позиционируется Alibaba как «highest performance tier» (help.aliyun.com/zh/model-studio, verified 02.08.2026).
  • Доступна через OpenAI-compatible, Anthropic-compatible и DashScope-native эндпоинты.
  • Регионы: Beijing, Hong Kong, Singapore, Tokyo, Frankfurt, US Virginia.

Что не известно публично и что не стоит выдумывать:

  • Количество параметров.
  • Дата обрыва знаний (varies по мере обновления mid-line версий).
  • Точный контекст (Alibaba пишет 256K для API, но не документирует лимит на выход).
  • Точные бенчмарки — Alibaba даёт их только в маркетинговых материалах, независимой воспроизводимой методики нет.

Практический вывод: Qwen 3 Max — это про доступ к максимальному качеству через API, если вам не подходит open-source версия. Если вы можете развернуть Qwen3-235B-A22B у себя (см. ниже) — вы получите ~90% качества за счёт железа, но без vendor lock-in.

Релиз 22 июля 2025 года (qwenlm.github.io/blog/qwen3-coder, verified 02.08.2026).

Флагманская модель — Qwen3-Coder-480B-A35B-Instruct:

ПараметрЗначение
Total parameters480B
Active parameters35B
Experts160 total, 8 активных на токен
Layers62
Attention96 heads (Q), 8 heads (KV), GQA
Native context262 144 токенов (256K)
Extended contextдо 1M токенов через YaRN
ЛицензияApache 2.0
Данные7.5T токенов, 70% код

Verified benchmarks из Hugging Face model card (verified 02.08.2026):

  • SWE-Bench Pro: 38.7
  • Terminalbench 2.0: 23.9
  • EvasionBench: 78.16

Alibaba в блоге релиза указывает, что модель «comparable to Claude Sonnet 4» и достигает state-of-the-art среди open-source на SWE-Bench Verified.

Интеграции:

  • Qwen Code CLI — консольный агент, форкнутый от Gemini Code, ставится через npm.
  • Claude Code — работает через прокси Alibaba Cloud Model Studio.
  • Cline — работает через OpenAI-совместимый эндпоинт.

Практика: Qwen3-Coder-480B в связке с Ollama или vLLM на кластере — это self-hosted альтернатива Claude Sonnet для команды, которая не может отдавать код внешнему API.

Флагман — Qwen3-VL-235B-A22B-Instruct (Hugging Face, verified 02.08.2026).

Ключевое:

  • MoE, 235B total / 22B активных.
  • Три архитектурные новинки: Interleaved-MRoPE (позиционные эмбеддинги по времени, ширине и высоте — для длинных видео), DeepStack (fusion фич из ViT для точной привязки текст-изображение), Text-Timestamp Alignment (привязка событий к таймкодам в видео).
  • Контекст 256K → 1M токенов.
  • OCR — 32 языка (было 19 в Qwen2.5-VL).
  • Visual Agent — модель распознаёт UI-элементы, понимает их функции, вызывает инструменты. То есть может водить мышкой по экрану как оператор.
  • Visual Coding — генерирует Draw.io / HTML / CSS / JS из скриншотов и видео.
  • Spatial Perception — определяет расположение объектов, точку зрения, окклюзию. 2D + 3D grounding.
  • Лицензия Apache 2.0.

Практическая ниша: multimodal-агенты, автоматизация UI, разбор чертежей и скриншотов, длинные видео с индексацией по секундам.

Флагман — Qwen3-Omni-30B-A3B-Instruct (Hugging Face, verified 02.08.2026).

Архитектура Thinker–Talker:

  • Thinker — chain-of-thought рассуждение + понимание всех модальностей.
  • Talker — реальный синтез речи в стриминге, низкая задержка.

Что модель принимает и что генерирует:

МодальностьВходВыход
Текст✓ (119 языков)
Аудио✓ (18 языков)✓ (10 языков, включая русский)
Изображение
Видео

Русский поддерживается и на вход (распознавание речи), и на выход (синтез речи). Это редкость для open-source omni-моделей.

  • Контекст 32K → 65K токенов при multi-GPU.
  • Лицензия Apache 2.0.
  • Alibaba заявляет SOTA на 32 из 36 audio / video бенчмарков среди open-source, качество сравнимо с Gemini 2.5 Pro в ASR и голосовой беседе.

Практическая ниша: голосовые агенты, авто-транскрипция, real-time дубляж, приложения для незрячих (описание видео голосом).

Публичный веб-интерфейс — chat.qwen.ai.

Что доступно на 2 августа 2026 (verified):

  • Текущая доступная в чате модель — Qwen3.7-Plus (это средний тир линейки Max/Plus/Flash).
  • Регистрация нужна — есть Log in / Sign up.
  • Поддерживается генерация изображений (модель Qwen-Image, 20B MMDiT).
  • Поддерживаются загрузки файлов, картинок, PDF.

Что не verified из публичной документации:

  • Полный список моделей в чате.
  • Точные лимиты бесплатного тарифа.
  • Полная поддержка русского в UI (интерфейс основной — китайский и английский).
  • Легальность и стабильность доступа из РФ — сверяй сам перед бизнес-задачей.

Практический совет: chat.qwen.ai — это для попробовать модель на реальной задаче. Для production — API DashScope или self-hosting.

Model Studio — это платформа Alibaba Cloud (бывший DashScope), которая раздаёт Qwen-модели через API. Регистрация — через Alibaba Cloud аккаунт.

Три эндпоинта на выбор (help.aliyun.com/zh/model-studio, verified 02.08.2026):

  • OpenAI-compatible — можно переключить существующий OpenAI-код на Qwen сменой base URL.
  • Anthropic-compatible — для интеграции с Claude-стек-приложениями.
  • DashScope native — родной формат, чуть богаче фичами.

Модели в API (актуальная линейка на 02.08.2026):

  • qwen3.7-max — флагман, максимальное качество.
  • qwen3.7-plus — баланс.
  • qwen3.6-flash — быстрый и дешёвый.
  • qwen3.5-omni-plus — multimodal (text + image + audio + video).
  • qwen3.5-omni-plus-realtime — real-time голосовая беседа.

Регионы: Beijing, Hong Kong, Singapore, Tokyo, Frankfurt, US Virginia.

Цены. На дату проверки (02.08.2026) публичная сводная страница пейволла Alibaba Cloud Model Studio недоступна из открытого доступа (страницы help.aliyun.com/zh/model-studio/pricing отдают 404 без залогина в консоль). Актуальные цены — только в консоли bailian.console.aliyun.com. Не выдумывай цифры, если пишешь бизнес-план — залогинься и сверь.

Регистрация из РФ. Alibaba Cloud формально не блокирует российские аккаунты, но:

  • KYC для юрлица требует налоговый ID международного формата.
  • Оплата российской картой не проходит.
  • Для физлица есть Alibaba Cloud International (в отличие от .cn) — можно попробовать зарубежную карту.
  • Практический путь для РФ-команды: юрлицо в дружественной юрисдикции (Гонконг, ОАЭ, Казахстан) + локальная карта. Либо посредник, который перепродаёт доступ к DashScope через свой прокси.

Все базовые Qwen3-модели (dense и MoE, кроме проприетарного Qwen 3 Max) выложены под Apache 2.0. Это значит:

  • Скачать веса можно свободно и легально.
  • Использовать в коммерческих продуктах — можно.
  • Продавать fine-tune-версии как свой продукт — можно.
  • Требуется указать копирайт и лицензию Apache 2.0 в дистрибутиве продукта.

Два зеркала весов:

  • Hugging Face — 458+ моделей, международное сообщество, торренты, ONNX-конверсии.
  • ModelScope — китайский аналог, лучше подходит для деплоя внутри Китая.

Практически: скачай с того зеркала, откуда быстрее качается из твоей сети. Веса идентичны.

Три главных сценария:

1. Ollama — для лаптопа и небольшого сервера.

Все размеры Qwen3 доступны одной командой (ollama.com/library/qwen3, verified 02.08.2026):

МодельРазмерКонтекстКоманда
qwen3:0.6b523 MB40Kollama run qwen3:0.6b
qwen3:1.7b1.4 GB40Kollama run qwen3:1.7b
qwen3:4b2.5 GB256Kollama run qwen3:4b
qwen3:8b5.2 GB40Kollama run qwen3:8b
qwen3:14b9.3 GB40Kollama run qwen3:14b
qwen3:30b (MoE)19 GB256Kollama run qwen3:30b
qwen3:32b (dense)20 GB40Kollama run qwen3:32b
qwen3:235b (MoE)142 GB256Kollama run qwen3:235b

Ориентир по железу (для BF16 / 4-bit квантизаций):

  • 0.6B–4B — работает на CPU и на встроенной графике. MacBook M-серии тянет без проблем.
  • 8B–14B — нужна GPU 12–24 GB VRAM.
  • 30B (MoE) — GPU 24 GB VRAM или CPU с 32 GB RAM (медленно).
  • 32B dense — GPU 24–48 GB VRAM.
  • 235B MoE — минимум 4× A100 80GB или эквивалент. Для 1M контекста — ~1000 GB общей GPU-памяти (по данным model card).

2. vLLM — для production-инференса.

Стандарт для serving-а. Поддерживает tensor parallelism, prefix caching, continuous batching. Команда для флагмана:

Окно терминала
vllm serve Qwen/Qwen3-235B-A22B-Instruct-2507 \
--tensor-parallel-size 8 \
--max-model-len 262144

3. SGLang — для сложных агентских сценариев.

Оптимизирован под structured output, tool calling, длинные цепочки:

Окно терминала
python3 -m sglang.launch_server \
--model-path Qwen/Qwen3-235B-A22B-Instruct-2507 \
--context-length 262144 --tp 8

Также поддерживаются llama.cpp (CPU-инференс), LM Studio (GUI на macOS/Windows), MLX LM (для Apple Silicon).

Три причины взять Qwen в РФ:

  1. Веса открыты и лицензия разрешает коммерцию. Скачал, поставил, продал — легально. Никто не может отозвать доступ.
  2. Русский язык хороший. Qwen3 обучалась на 119 языках, русский — один из основных. Qwen3-Omni умеет распознавать русскую речь и синтезировать русский голос — это редкое сочетание.
  3. Обход санкционных ограничений. Нет платы американскому вендору, нет зависимости от Anthropic / OpenAI, self-hosting отрезает vendor lock-in полностью.

Кому подходит:

  • Enterprise с requirement on-premise (compliance, персональные данные).
  • Продукты для СНГ / арабского / китайского рынка, где нужен сильный не-английский.
  • Команды с собственной инфраструктурой и желанием fine-tune под свои данные.
  • Стартапы, у которых нет 10 000 USD в месяц на OpenAI, но есть 1 GPU-сервер за 30 000 USD один раз.

Кому не подходит:

  • Продукты, где надо мгновенно из коробки — тогда прямой OpenAI/Claude всё равно проще, если оплата решаема.
  • Малый бизнес без DevOps — self-hosting требует людей, которые умеют vLLM и мониторинг.
  • Задачи, где нужна абсолютно свежая мировая база знаний — обрыв знаний у Qwen может быть месяцы назад.

Три главных open-source семейства 2026 года. Сравнение флагманов:

МодельTotal / ActiveКонтекстЛицензияЯзыкиНиша
Qwen3-235B-A22B235B / 22B256K → 1MApache 2.0119Универсал, силён в reasoning
Qwen3-Coder-480B-A35B480B / 35B256K → 1MApache 2.0119Программирование, агенты
DeepSeek-V3671B / 37B128KMIT~50Reasoning, дешёвый API
Llama 4 Maverick / Behemothзависит от версиизависит от версииLlama-community license~40Универсал, силён в EN

Ключевое отличие Qwen:

  • Больше специализированных моделей. DeepSeek — 2-3 модели, Llama — 3-4 варианта, Qwen — 458+ моделей на HF.
  • Apache 2.0 на всё. У Llama лицензия ограничивает продукты с 700M+ MAU. У Qwen ограничений нет.
  • Multi-language. 119 языков против ~50 у DeepSeek. Русский, арабский, корейский, японский — все хороши.
  • Multimodal. VL и Omni — сильнее чем у DeepSeek (только текст) и Llama (image только через отдельные модели).

Практическое правило: если нужен универсал и максимум качества по бенчмаркам — DeepSeek. Если нужен код и агенты — Qwen3-Coder. Если нужен голос / видео / много языков — Qwen3-Omni.

Сценарий 1. On-premise чат-бот для enterprise-клиента с requirement на PCI-DSS.

Задача — не пускать пользовательские данные наружу. Решение: Qwen3-30B-A3B через vLLM на 1× A100 80GB. Стоимость железа — ~20 000 USD один раз, дальше только электричество. Даёт качество Qwen 2.5-72B, но в 3 раза меньше памяти. Русский из коробки. Fine-tune под лексикон домена — по 24 часам на том же сервере.

Сценарий 2. Кодовый агент для команды 15 разработчиков без права экспортировать код за периметр.

Решение: Qwen3-Coder-480B-A35B на кластере 4× H100 80GB через vLLM. Стоимость кластера — 200 000 USD, работает 3+ года. Даёт качество Claude Sonnet на SWE-Bench. Интеграция через Cline или Qwen Code CLI — команды не меняют workflow.

Сценарий 3. Голосовой ассистент для колл-центра с русскоязычной аудиторией.

Решение: Qwen3-Omni-30B-A3B на 2× A100 80GB. Принимает голос, отвечает голосом, длина реплики — стриминг с задержкой ~500ms. Русский на выход поддерживается. Fine-tune на скриптах колл-центра — 2 недели работы ML-инженера.

Сценарий 4. Fine-tune для юр-техника: разбор договоров на русском.

Решение: Qwen3-32B dense — сладкое пятно между качеством и стоимостью fine-tune. Датасет: 3 000 размеченных договоров + инструкции. Обучение LoRA на 1× A100 80GB за 1 неделю. На выходе — модель, которая читает договор на 40 страниц и находит риски.

Сценарий 5. Multimodal-агент для WB-селлера: разбор скриншотов личного кабинета + голос.

Решение: Qwen3-VL-235B-A22B через API на DashScope (self-hosting слишком дорог для одиночного бизнеса). Модель смотрит на скриншот WB Аналитики, находит проблему, отвечает голосом через Qwen3-Omni. Стоимость — по use через API, оценить в консоли DashScope.

Что означает «A22B» / «A3B» / «A35B» в названии Qwen-моделей? Это активные параметры в Mixture-of-Experts архитектуре. Qwen3-235B-A22B — 235B общих параметров, но на любой отдельный токен «активируется» только 22B (модель выбирает 8 из 128 экспертов). Инференс дешевле, чем у dense-модели того же размера, но общая память для загрузки всех весов нужна как для полных 235B.

В чём разница между Qwen 3 и Qwen 3 Max? Qwen 3 — базовое семейство open-source моделей до Qwen3-235B-A22B, все веса выложены на Hugging Face под Apache 2.0. Qwen 3 Max (в API — qwen3.7-max) — закрытая проприетарная модель, только через API Alibaba Cloud, без открытых весов и без публичной документации архитектуры.

Можно ли скачать Qwen 3 Max и запустить у себя? Нет. Флагманский Qwen 3 Max — proprietary, весов нет. Максимум open-source, что можно скачать — Qwen3-Coder-480B-A35B и Qwen3-VL-235B-A22B. Они меньше Max, но по бенчмаркам близко к нему в своих нишах.

Что такое «thinking mode» и когда его включать? enable_thinking=True заставляет модель писать блоки <think>...</think> перед ответом — это внутреннее рассуждение по цепочке. Включай для задач с многошаговой логикой (математика, юридический анализ, отладка кода). Отключай (/no_think) для быстрых ответов и когда важна скорость. По умолчанию thinking включён.

Работает ли Qwen на русском языке? Да, русский — один из 119 языков предобучения. Качество близко к английскому. Qwen3-Omni дополнительно поддерживает русский и на вход (распознавание речи), и на выход (синтез речи).

Есть ли риск, что Alibaba «отзовёт» лицензию Apache 2.0 у уже скачанной модели? Нет. Apache 2.0 — необратимая публичная лицензия. Веса, скачанные и сохранённые локально, остаются вашими, даже если Alibaba завтра закроет свой репозиторий. Это фундаментальная причина, почему self-hosting Qwen — устойчивая стратегия для РФ.

В чём Qwen сильнее DeepSeek? Больше моделей, больше специализаций (VL, Omni, Coder, Math), больше языков (119 против ~50), Apache 2.0 без ограничений. DeepSeek сильнее в чистом reasoning и в цене API, но у Qwen шире портфель.

Можно ли смешивать Qwen с OpenAI-эндпоинтом в существующем коде? Да. DashScope-эндпоинт Qwen поддерживает OpenAI-совместимый формат. Достаточно поменять base_url и модель на qwen3.7-max — остальной OpenAI-SDK-код работает. То же для Anthropic-совместимого эндпоинта.

Нужен ли GPU-кластер для Qwen3-235B, если хочу попробовать? Не обязательно. Есть три пути: (1) API DashScope — платишь только за токены. (2) Ollama на CPU с 128 GB RAM — работает медленно, но работает. (3) 4-битная квантизация на 2× RTX 4090 (48 GB VRAM) — компромисс по качеству.

Где взять русскоязычную документацию Qwen? Официальной русской документации нет. Опирайся на первоисточник и переводи браузером или руками: qwen.readthedocs.io, github.com/QwenLM, model cards на huggingface.co/Qwen. Русские пересказы на сторонних медиа могут быть устаревшими или неточными — не используй их как источник фактов.

Можно ли fine-tune Qwen на своих данных? Да, лицензия Apache 2.0 разрешает. Стандартные тулкиты — LLaMA-Factory, axolotl, transformers Trainer. Для мелких моделей (0.6B–8B) — LoRA на 1 GPU за часы. Для 32B — LoRA на 1× A100 за день. Для 235B — QLoRA на кластере 4–8 GPU за неделю.

Что читать, чтобы начать с Qwen прямо сейчас? Три ссылки: (1) qwenlm.github.io — блог с релиз-нотами. (2) huggingface.co/Qwen — model cards с примерами кода. (3) ollama.com/library/qwen3 — простейший путь запустить у себя за 2 минуты.

  • Артикул 040 — «DeepSeek V3 и R1: китайский reasoning-стек для российского пользователя».
  • Артикул 041 — «Llama 4 и open-source-стек Meta в 2026».
  • Артикул 011 — big-3 сравнение Claude / GPT / Gemini vs open-source.
  • Артикул 019 / 020 — Claude Sonnet для контекста, чем отличается подход к open-source у западных вендоров.

Все ссылки проверены 02.08.2026. Первоисточники — официальные материалы Alibaba Cloud, репозитории QwenLM на GitHub, модельные карточки на Hugging Face.

  1. Qwen official blog — релиз-ноты и анонсы. Проверено 02.08.2026.
  2. Qwen3 announcement blog — релиз 29.04.2025, полная линейка dense и MoE, 119 языков, thinking mode. Проверено 02.08.2026.
  3. Qwen3-Coder announcement blog — релиз 22.07.2025, 480B-A35B, 7.5T данных, 70% код. Проверено 02.08.2026.
  4. Qwen3-235B-A22B-Instruct-2507 model card — MoE 235B/22B, 256K→1M контекст, Apache 2.0, benchmarks против GPT-4o, DeepSeek-V3, Claude Opus 4. Проверено 02.08.2026.
  5. Qwen3-Coder-480B-A35B-Instruct model card — 480B total, 35B active, 160 экспертов, benchmarks SWE-Bench. Проверено 02.08.2026.
  6. Qwen3-VL-235B-A22B-Instruct model card — vision-language, Interleaved-MRoPE, Visual Agent, 32 языка OCR. Проверено 02.08.2026.
  7. Qwen3-Omni-30B-A3B-Instruct model card — omni-модель, Thinker-Talker, 119 языков текста, 18/10 языков голоса. Проверено 02.08.2026.
  8. Qwen3-32B model card — dense-флагман, thinking mode, YaRN до 131K. Проверено 02.08.2026.
  9. QwenLM GitHub organization — все репозитории (Qwen3, Qwen3-Coder, Qwen3-VL, Qwen3-Omni, qwen-code). Проверено 02.08.2026.
  10. Hugging Face Qwen organization — 458+ моделей под Apache 2.0. Проверено 02.08.2026.
  11. Ollama Qwen3 library — все размеры от 0.6B до 235B, команды запуска. Проверено 02.08.2026.
  12. Alibaba Cloud Model Studio: available models — qwen3.7-max / plus / flash, omni-plus, регионы, OpenAI/Anthropic/DashScope API. Проверено 02.08.2026.
  13. Qwen Chat — веб-чат, Qwen3.7-Plus, генерация изображений. Проверено 02.08.2026.
  14. Qwen documentation — общий обзор моделей, self-hosting через vLLM, Ollama, llama.cpp, LM Studio, MLX. Проверено 02.08.2026.
  15. ModelScope Qwen organization — китайское зеркало Hugging Face. Проверено 02.08.2026.

Актуально на 02.08.2026. Модели, цены и условия доступа меняются часто. Alibaba выпускает минорные версии линейки Max (3.5 → 3.6 → 3.7) примерно каждые 3-4 месяца. Перед бизнес-решением всегда сверяйся с первоисточником — все ссылки в разделе Sources выше. Цены DashScope доступны только в консоли Alibaba Cloud после регистрации; открытая pricing-страница на 02.08.2026 не отдаётся публично. RU-специфика доступа (юрлицо, оплата, KYC) может измениться быстрее, чем прайс — сверяй отдельно перед развёртыванием.