Qwen 3 Max и open-source Qwen от Alibaba в 2026: Coder, VL, Omni и Qwen Chat
Автор: Silvana · Дата: 02.08.2026 · Verified: 01.09.2026 · Reading time: 11 минут · Prerequisite: 002, 011
Qwen — семейство моделей Alibaba Cloud, лидер open-source AI: почти 500 весов на HuggingFace под Apache 2.0, включая MoE-флагманы на 235B и 480B параметров. В линейке одновременно живут dense-модели (0.6B–32B) и MoE (Qwen3-30B-A3B и Qwen3-235B-A22B), плюс специализированные Qwen3-Coder (480B/35B для программирования), Qwen3-VL (235B/22B, vision + text) и Qwen3-Omni (30B/3B, text + image + audio + video, генерирует речь в реальном времени). Проприетарный флагман Qwen 3 Max доступен только через API Alibaba Cloud Model Studio (OpenAI- и Anthropic-совместимый, регионы от Пекина до Франкфурта). Веб-чат chat.qwen.ai, текущая модель в чате — Qwen3.7-Plus.
- Qwen — семейство моделей от Alibaba Cloud (команда Qwen внутри Alibaba Group). Лидер open-source AI: почти все веса выложены под лицензией Apache 2.0, включая флагманские MoE-модели на 235B и 480B параметров.
- В линейке одновременно живут dense и MoE архитектуры. Dense-модели — от 0.6B до 32B параметров, MoE — Qwen3-30B-A3B (30B / 3B активных) и Qwen3-235B-A22B (235B / 22B активных). Проприетарный флагман Qwen 3 Max доступен только через API.
- Отдельные линейки под задачи: Qwen3-Coder (480B / 35B, программирование), Qwen3-VL (235B / 22B, vision + text), Qwen3-Omni (30B / 3B, text + image + audio + video, генерирует речь в реальном времени).
- Контекст 256K токенов на MoE-моделях, расширяется до 1M токенов через YaRN и Dual Chunk Attention.
- Веса выложены на Hugging Face и ModelScope. Self-hosting поддерживают Ollama, vLLM, SGLang, llama.cpp, LM Studio, MLX.
- API доступен через Alibaba Cloud Model Studio (бывший DashScope) с OpenAI-совместимым, Anthropic-совместимым и нативным эндпоинтом. Регионы: Пекин, Гонконг, Сингапур, Токио, Франкфурт, США (Вирджиния).
- Веб-чат — chat.qwen.ai. На 2 августа 2026 текущая доступная в чате модель — Qwen3.7-Plus.
Что это и зачем
Заголовок раздела «Что это и зачем»Если DeepSeek — это китайский стартап-выскочка, а Llama — американский open-source-стандарт от Meta, то Qwen — это китайская корпорация, которая делает open-source нормой. Alibaba за три года выпустила больше открытых моделей семейства Llama/Qwen/DeepSeek, чем любой другой мировой вендор: почти 500 моделей на Hugging Face, все под Apache 2.0, все с полными весами.
Мысленный образ: это не одна модель и не флагман с двумя младшими братьями. Это библиотека под разные задачи и разное железо. Хотите чат-бота на ноутбуке — берите Qwen3-4B. Нужен production-агент на кластере — Qwen3-Coder-480B. Нужна модель, которая слушает голос и отвечает голосом — Qwen3-Omni. Всё это работает через один и тот же API-протокол и весь стек тулинга.
Для маркетолога и предпринимателя из РФ это значит одно: у вас есть путь к enterprise-grade AI, который не зависит от санкций. Веса можно скачать и поставить на свой сервер, лицензия Apache 2.0 разрешает коммерческое использование, дообучение под свои данные и продажу продукта на этом.
Основной разбор
Заголовок раздела «Основной разбор»История Qwen: от Q1 до Q3
Заголовок раздела «История Qwen: от Q1 до Q3»Линейка развивается быстро — примерно одна крупная итерация раз в полгода:
- Qwen 1 / Qwen 1.5 (2023–2024) — первая волна, dense-модели до 72B. Мало кто в мире тогда замечал.
- Qwen 2 / Qwen 2.5 (лето 2024 — начало 2025) — прорыв. Qwen2.5-72B по бенчмаркам догнал GPT-4 в базовых задачах. Появились специализированные модели: Qwen2.5-Coder, Qwen2.5-Math, Qwen2.5-VL.
- Qwen 3 (апрель 2025 — сейчас) — переход на MoE-архитектуру, гибридный режим «thinking / non-thinking», 119 языков, объём предобучения удвоен до ~36T токенов.
В Q3-поколении окончательно сформировались подсерии, каждая под свою задачу:
- Base — сырая предобученная модель для fine-tuning.
- Instruct — инструкции-следование, дефолт для чат-агентов.
- Thinking — режим «размышления» с блоками
<think>...</think>перед ответом. - Coder — специализация на коде.
- Math — специализация на математике.
- VL (Vision-Language) — vision + текст.
- Omni — text + image + audio + video, генерирует речь.
- ASR / TTS — распознавание и синтез речи отдельными моделями (Qwen3-ASR).
- Image — генерация изображений (Qwen-Image, 20B MMDiT).
- Guard — safety-классификация (Qwen3Guard).
Qwen 3 (апрель 2025) — базовая линейка
Заголовок раздела «Qwen 3 (апрель 2025) — базовая линейка»Релиз 29 апреля 2025 года (qwenlm.github.io/blog/qwen3, verified 02.08.2026).
Восемь моделей одним пакетом:
| Модель | Тип | Параметры | Контекст | Лицензия |
|---|---|---|---|---|
| Qwen3-0.6B | Dense | 0.6B | 32K | Apache 2.0 |
| Qwen3-1.7B | Dense | 1.7B | 32K | Apache 2.0 |
| Qwen3-4B | Dense | 4B | 128K | Apache 2.0 |
| Qwen3-8B | Dense | 8B | 128K | Apache 2.0 |
| Qwen3-14B | Dense | 14B | 128K | Apache 2.0 |
| Qwen3-32B | Dense | 32.8B (31.2B non-embed) | 32K → 131K с YaRN | Apache 2.0 |
| Qwen3-30B-A3B | MoE | 30B total / 3B активных | 128K | Apache 2.0 |
| Qwen3-235B-A22B | MoE | 235B total / 22B активных | 256K → 1M с DCA | Apache 2.0 |
Ключевое:
- Двухрежимная модель. Каждая Qwen3 умеет
enable_thinking=True(пишет<think>...</think>перед ответом) иenable_thinking=False(быстрый ответ). Управляется параметром или тегами/think//no_thinkв промпте. - 119 языков. Русский поддерживается, качество — на уровне флагманов.
- Объём предобучения ~36T токенов — почти вдвое против Qwen 2.5. При этом Qwen3-1.7B/4B/8B/14B/32B-Base по бенчмаркам соответствуют Qwen2.5-3B/7B/14B/32B/72B-Base — то есть параметрическая эффективность выросла примерно в 2 раза.
Qwen 3 Max (проприетарный флагман)
Заголовок раздела «Qwen 3 Max (проприетарный флагман)»Qwen 3 Max — это закрытая модель, доступная только через API на Alibaba Cloud Model Studio. Веса не выложены, архитектура публично не раскрыта. На 2 августа 2026 в консоли DashScope она проходит как qwen3.7-max (Alibaba использует минорные версии линейки Max: 3.5-max → 3.6-max → 3.7-max).
Что известно точно:
- Позиционируется Alibaba как «highest performance tier» (help.aliyun.com/zh/model-studio, verified 02.08.2026).
- Доступна через OpenAI-compatible, Anthropic-compatible и DashScope-native эндпоинты.
- Регионы: Beijing, Hong Kong, Singapore, Tokyo, Frankfurt, US Virginia.
Что не известно публично и что не стоит выдумывать:
- Количество параметров.
- Дата обрыва знаний (varies по мере обновления mid-line версий).
- Точный контекст (Alibaba пишет 256K для API, но не документирует лимит на выход).
- Точные бенчмарки — Alibaba даёт их только в маркетинговых материалах, независимой воспроизводимой методики нет.
Практический вывод: Qwen 3 Max — это про доступ к максимальному качеству через API, если вам не подходит open-source версия. Если вы можете развернуть Qwen3-235B-A22B у себя (см. ниже) — вы получите ~90% качества за счёт железа, но без vendor lock-in.
Qwen 3 Coder (программирование)
Заголовок раздела «Qwen 3 Coder (программирование)»Релиз 22 июля 2025 года (qwenlm.github.io/blog/qwen3-coder, verified 02.08.2026).
Флагманская модель — Qwen3-Coder-480B-A35B-Instruct:
| Параметр | Значение |
|---|---|
| Total parameters | 480B |
| Active parameters | 35B |
| Experts | 160 total, 8 активных на токен |
| Layers | 62 |
| Attention | 96 heads (Q), 8 heads (KV), GQA |
| Native context | 262 144 токенов (256K) |
| Extended context | до 1M токенов через YaRN |
| Лицензия | Apache 2.0 |
| Данные | 7.5T токенов, 70% код |
Verified benchmarks из Hugging Face model card (verified 02.08.2026):
- SWE-Bench Pro: 38.7
- Terminalbench 2.0: 23.9
- EvasionBench: 78.16
Alibaba в блоге релиза указывает, что модель «comparable to Claude Sonnet 4» и достигает state-of-the-art среди open-source на SWE-Bench Verified.
Интеграции:
- Qwen Code CLI — консольный агент, форкнутый от Gemini Code, ставится через npm.
- Claude Code — работает через прокси Alibaba Cloud Model Studio.
- Cline — работает через OpenAI-совместимый эндпоинт.
Практика: Qwen3-Coder-480B в связке с Ollama или vLLM на кластере — это self-hosted альтернатива Claude Sonnet для команды, которая не может отдавать код внешнему API.
Qwen 3 VL (vision + text)
Заголовок раздела «Qwen 3 VL (vision + text)»Флагман — Qwen3-VL-235B-A22B-Instruct (Hugging Face, verified 02.08.2026).
Ключевое:
- MoE, 235B total / 22B активных.
- Три архитектурные новинки: Interleaved-MRoPE (позиционные эмбеддинги по времени, ширине и высоте — для длинных видео), DeepStack (fusion фич из ViT для точной привязки текст-изображение), Text-Timestamp Alignment (привязка событий к таймкодам в видео).
- Контекст 256K → 1M токенов.
- OCR — 32 языка (было 19 в Qwen2.5-VL).
- Visual Agent — модель распознаёт UI-элементы, понимает их функции, вызывает инструменты. То есть может водить мышкой по экрану как оператор.
- Visual Coding — генерирует Draw.io / HTML / CSS / JS из скриншотов и видео.
- Spatial Perception — определяет расположение объектов, точку зрения, окклюзию. 2D + 3D grounding.
- Лицензия Apache 2.0.
Практическая ниша: multimodal-агенты, автоматизация UI, разбор чертежей и скриншотов, длинные видео с индексацией по секундам.
Qwen 3 Omni (text + image + audio + video + голос)
Заголовок раздела «Qwen 3 Omni (text + image + audio + video + голос)»Флагман — Qwen3-Omni-30B-A3B-Instruct (Hugging Face, verified 02.08.2026).
Архитектура Thinker–Talker:
- Thinker — chain-of-thought рассуждение + понимание всех модальностей.
- Talker — реальный синтез речи в стриминге, низкая задержка.
Что модель принимает и что генерирует:
| Модальность | Вход | Выход |
|---|---|---|
| Текст | ✓ | ✓ (119 языков) |
| Аудио | ✓ (18 языков) | ✓ (10 языков, включая русский) |
| Изображение | ✓ | ✗ |
| Видео | ✓ | ✗ |
Русский поддерживается и на вход (распознавание речи), и на выход (синтез речи). Это редкость для open-source omni-моделей.
- Контекст 32K → 65K токенов при multi-GPU.
- Лицензия Apache 2.0.
- Alibaba заявляет SOTA на 32 из 36 audio / video бенчмарков среди open-source, качество сравнимо с Gemini 2.5 Pro в ASR и голосовой беседе.
Практическая ниша: голосовые агенты, авто-транскрипция, real-time дубляж, приложения для незрячих (описание видео голосом).
Qwen Chat (chat.qwen.ai) — веб-чат
Заголовок раздела «Qwen Chat (chat.qwen.ai) — веб-чат»Публичный веб-интерфейс — chat.qwen.ai.
Что доступно на 2 августа 2026 (verified):
- Текущая доступная в чате модель — Qwen3.7-Plus (это средний тир линейки Max/Plus/Flash).
- Регистрация нужна — есть Log in / Sign up.
- Поддерживается генерация изображений (модель Qwen-Image, 20B MMDiT).
- Поддерживаются загрузки файлов, картинок, PDF.
Что не verified из публичной документации:
- Полный список моделей в чате.
- Точные лимиты бесплатного тарифа.
- Полная поддержка русского в UI (интерфейс основной — китайский и английский).
- Легальность и стабильность доступа из РФ — сверяй сам перед бизнес-задачей.
Практический совет: chat.qwen.ai — это для попробовать модель на реальной задаче. Для production — API DashScope или self-hosting.
API через Alibaba Cloud Model Studio (DashScope)
Заголовок раздела «API через Alibaba Cloud Model Studio (DashScope)»Model Studio — это платформа Alibaba Cloud (бывший DashScope), которая раздаёт Qwen-модели через API. Регистрация — через Alibaba Cloud аккаунт.
Три эндпоинта на выбор (help.aliyun.com/zh/model-studio, verified 02.08.2026):
- OpenAI-compatible — можно переключить существующий OpenAI-код на Qwen сменой base URL.
- Anthropic-compatible — для интеграции с Claude-стек-приложениями.
- DashScope native — родной формат, чуть богаче фичами.
Модели в API (актуальная линейка на 02.08.2026):
qwen3.7-max— флагман, максимальное качество.qwen3.7-plus— баланс.qwen3.6-flash— быстрый и дешёвый.qwen3.5-omni-plus— multimodal (text + image + audio + video).qwen3.5-omni-plus-realtime— real-time голосовая беседа.
Регионы: Beijing, Hong Kong, Singapore, Tokyo, Frankfurt, US Virginia.
Цены. На дату проверки (02.08.2026) публичная сводная страница пейволла Alibaba Cloud Model Studio недоступна из открытого доступа (страницы help.aliyun.com/zh/model-studio/pricing отдают 404 без залогина в консоль). Актуальные цены — только в консоли bailian.console.aliyun.com. Не выдумывай цифры, если пишешь бизнес-план — залогинься и сверь.
Регистрация из РФ. Alibaba Cloud формально не блокирует российские аккаунты, но:
- KYC для юрлица требует налоговый ID международного формата.
- Оплата российской картой не проходит.
- Для физлица есть Alibaba Cloud International (в отличие от .cn) — можно попробовать зарубежную карту.
- Практический путь для РФ-команды: юрлицо в дружественной юрисдикции (Гонконг, ОАЭ, Казахстан) + локальная карта. Либо посредник, который перепродаёт доступ к DashScope через свой прокси.
Open-source (главная сила Qwen)
Заголовок раздела «Open-source (главная сила Qwen)»Все базовые Qwen3-модели (dense и MoE, кроме проприетарного Qwen 3 Max) выложены под Apache 2.0. Это значит:
- Скачать веса можно свободно и легально.
- Использовать в коммерческих продуктах — можно.
- Продавать fine-tune-версии как свой продукт — можно.
- Требуется указать копирайт и лицензию Apache 2.0 в дистрибутиве продукта.
Два зеркала весов:
- Hugging Face — 458+ моделей, международное сообщество, торренты, ONNX-конверсии.
- ModelScope — китайский аналог, лучше подходит для деплоя внутри Китая.
Практически: скачай с того зеркала, откуда быстрее качается из твоей сети. Веса идентичны.
Self-hosting Qwen
Заголовок раздела «Self-hosting Qwen»Три главных сценария:
1. Ollama — для лаптопа и небольшого сервера.
Все размеры Qwen3 доступны одной командой (ollama.com/library/qwen3, verified 02.08.2026):
| Модель | Размер | Контекст | Команда |
|---|---|---|---|
| qwen3:0.6b | 523 MB | 40K | ollama run qwen3:0.6b |
| qwen3:1.7b | 1.4 GB | 40K | ollama run qwen3:1.7b |
| qwen3:4b | 2.5 GB | 256K | ollama run qwen3:4b |
| qwen3:8b | 5.2 GB | 40K | ollama run qwen3:8b |
| qwen3:14b | 9.3 GB | 40K | ollama run qwen3:14b |
| qwen3:30b (MoE) | 19 GB | 256K | ollama run qwen3:30b |
| qwen3:32b (dense) | 20 GB | 40K | ollama run qwen3:32b |
| qwen3:235b (MoE) | 142 GB | 256K | ollama run qwen3:235b |
Ориентир по железу (для BF16 / 4-bit квантизаций):
- 0.6B–4B — работает на CPU и на встроенной графике. MacBook M-серии тянет без проблем.
- 8B–14B — нужна GPU 12–24 GB VRAM.
- 30B (MoE) — GPU 24 GB VRAM или CPU с 32 GB RAM (медленно).
- 32B dense — GPU 24–48 GB VRAM.
- 235B MoE — минимум 4× A100 80GB или эквивалент. Для 1M контекста — ~1000 GB общей GPU-памяти (по данным model card).
2. vLLM — для production-инференса.
Стандарт для serving-а. Поддерживает tensor parallelism, prefix caching, continuous batching. Команда для флагмана:
vllm serve Qwen/Qwen3-235B-A22B-Instruct-2507 \ --tensor-parallel-size 8 \ --max-model-len 2621443. SGLang — для сложных агентских сценариев.
Оптимизирован под structured output, tool calling, длинные цепочки:
python3 -m sglang.launch_server \ --model-path Qwen/Qwen3-235B-A22B-Instruct-2507 \ --context-length 262144 --tp 8Также поддерживаются llama.cpp (CPU-инференс), LM Studio (GUI на macOS/Windows), MLX LM (для Apple Silicon).
Qwen для российского пользователя
Заголовок раздела «Qwen для российского пользователя»Три причины взять Qwen в РФ:
- Веса открыты и лицензия разрешает коммерцию. Скачал, поставил, продал — легально. Никто не может отозвать доступ.
- Русский язык хороший. Qwen3 обучалась на 119 языках, русский — один из основных. Qwen3-Omni умеет распознавать русскую речь и синтезировать русский голос — это редкое сочетание.
- Обход санкционных ограничений. Нет платы американскому вендору, нет зависимости от Anthropic / OpenAI, self-hosting отрезает vendor lock-in полностью.
Кому подходит:
- Enterprise с requirement on-premise (compliance, персональные данные).
- Продукты для СНГ / арабского / китайского рынка, где нужен сильный не-английский.
- Команды с собственной инфраструктурой и желанием fine-tune под свои данные.
- Стартапы, у которых нет 10 000 USD в месяц на OpenAI, но есть 1 GPU-сервер за 30 000 USD один раз.
Кому не подходит:
- Продукты, где надо мгновенно из коробки — тогда прямой OpenAI/Claude всё равно проще, если оплата решаема.
- Малый бизнес без DevOps — self-hosting требует людей, которые умеют vLLM и мониторинг.
- Задачи, где нужна абсолютно свежая мировая база знаний — обрыв знаний у Qwen может быть месяцы назад.
Сравнение Qwen vs DeepSeek vs Llama 4
Заголовок раздела «Сравнение Qwen vs DeepSeek vs Llama 4»Три главных open-source семейства 2026 года. Сравнение флагманов:
| Модель | Total / Active | Контекст | Лицензия | Языки | Ниша |
|---|---|---|---|---|---|
| Qwen3-235B-A22B | 235B / 22B | 256K → 1M | Apache 2.0 | 119 | Универсал, силён в reasoning |
| Qwen3-Coder-480B-A35B | 480B / 35B | 256K → 1M | Apache 2.0 | 119 | Программирование, агенты |
| DeepSeek-V3 | 671B / 37B | 128K | MIT | ~50 | Reasoning, дешёвый API |
| Llama 4 Maverick / Behemoth | зависит от версии | зависит от версии | Llama-community license | ~40 | Универсал, силён в EN |
Ключевое отличие Qwen:
- Больше специализированных моделей. DeepSeek — 2-3 модели, Llama — 3-4 варианта, Qwen — 458+ моделей на HF.
- Apache 2.0 на всё. У Llama лицензия ограничивает продукты с 700M+ MAU. У Qwen ограничений нет.
- Multi-language. 119 языков против ~50 у DeepSeek. Русский, арабский, корейский, японский — все хороши.
- Multimodal. VL и Omni — сильнее чем у DeepSeek (только текст) и Llama (image только через отдельные модели).
Практическое правило: если нужен универсал и максимум качества по бенчмаркам — DeepSeek. Если нужен код и агенты — Qwen3-Coder. Если нужен голос / видео / много языков — Qwen3-Omni.
Практика (5 сценариев)
Заголовок раздела «Практика (5 сценариев)»Сценарий 1. On-premise чат-бот для enterprise-клиента с requirement на PCI-DSS.
Задача — не пускать пользовательские данные наружу. Решение: Qwen3-30B-A3B через vLLM на 1× A100 80GB. Стоимость железа — ~20 000 USD один раз, дальше только электричество. Даёт качество Qwen 2.5-72B, но в 3 раза меньше памяти. Русский из коробки. Fine-tune под лексикон домена — по 24 часам на том же сервере.
Сценарий 2. Кодовый агент для команды 15 разработчиков без права экспортировать код за периметр.
Решение: Qwen3-Coder-480B-A35B на кластере 4× H100 80GB через vLLM. Стоимость кластера — 200 000 USD, работает 3+ года. Даёт качество Claude Sonnet на SWE-Bench. Интеграция через Cline или Qwen Code CLI — команды не меняют workflow.
Сценарий 3. Голосовой ассистент для колл-центра с русскоязычной аудиторией.
Решение: Qwen3-Omni-30B-A3B на 2× A100 80GB. Принимает голос, отвечает голосом, длина реплики — стриминг с задержкой ~500ms. Русский на выход поддерживается. Fine-tune на скриптах колл-центра — 2 недели работы ML-инженера.
Сценарий 4. Fine-tune для юр-техника: разбор договоров на русском.
Решение: Qwen3-32B dense — сладкое пятно между качеством и стоимостью fine-tune. Датасет: 3 000 размеченных договоров + инструкции. Обучение LoRA на 1× A100 80GB за 1 неделю. На выходе — модель, которая читает договор на 40 страниц и находит риски.
Сценарий 5. Multimodal-агент для WB-селлера: разбор скриншотов личного кабинета + голос.
Решение: Qwen3-VL-235B-A22B через API на DashScope (self-hosting слишком дорог для одиночного бизнеса). Модель смотрит на скриншот WB Аналитики, находит проблему, отвечает голосом через Qwen3-Omni. Стоимость — по use через API, оценить в консоли DashScope.
Что означает «A22B» / «A3B» / «A35B» в названии Qwen-моделей? Это активные параметры в Mixture-of-Experts архитектуре. Qwen3-235B-A22B — 235B общих параметров, но на любой отдельный токен «активируется» только 22B (модель выбирает 8 из 128 экспертов). Инференс дешевле, чем у dense-модели того же размера, но общая память для загрузки всех весов нужна как для полных 235B.
В чём разница между Qwen 3 и Qwen 3 Max?
Qwen 3 — базовое семейство open-source моделей до Qwen3-235B-A22B, все веса выложены на Hugging Face под Apache 2.0. Qwen 3 Max (в API — qwen3.7-max) — закрытая проприетарная модель, только через API Alibaba Cloud, без открытых весов и без публичной документации архитектуры.
Можно ли скачать Qwen 3 Max и запустить у себя? Нет. Флагманский Qwen 3 Max — proprietary, весов нет. Максимум open-source, что можно скачать — Qwen3-Coder-480B-A35B и Qwen3-VL-235B-A22B. Они меньше Max, но по бенчмаркам близко к нему в своих нишах.
Что такое «thinking mode» и когда его включать?
enable_thinking=True заставляет модель писать блоки <think>...</think> перед ответом — это внутреннее рассуждение по цепочке. Включай для задач с многошаговой логикой (математика, юридический анализ, отладка кода). Отключай (/no_think) для быстрых ответов и когда важна скорость. По умолчанию thinking включён.
Работает ли Qwen на русском языке? Да, русский — один из 119 языков предобучения. Качество близко к английскому. Qwen3-Omni дополнительно поддерживает русский и на вход (распознавание речи), и на выход (синтез речи).
Есть ли риск, что Alibaba «отзовёт» лицензию Apache 2.0 у уже скачанной модели? Нет. Apache 2.0 — необратимая публичная лицензия. Веса, скачанные и сохранённые локально, остаются вашими, даже если Alibaba завтра закроет свой репозиторий. Это фундаментальная причина, почему self-hosting Qwen — устойчивая стратегия для РФ.
В чём Qwen сильнее DeepSeek? Больше моделей, больше специализаций (VL, Omni, Coder, Math), больше языков (119 против ~50), Apache 2.0 без ограничений. DeepSeek сильнее в чистом reasoning и в цене API, но у Qwen шире портфель.
Можно ли смешивать Qwen с OpenAI-эндпоинтом в существующем коде?
Да. DashScope-эндпоинт Qwen поддерживает OpenAI-совместимый формат. Достаточно поменять base_url и модель на qwen3.7-max — остальной OpenAI-SDK-код работает. То же для Anthropic-совместимого эндпоинта.
Нужен ли GPU-кластер для Qwen3-235B, если хочу попробовать? Не обязательно. Есть три пути: (1) API DashScope — платишь только за токены. (2) Ollama на CPU с 128 GB RAM — работает медленно, но работает. (3) 4-битная квантизация на 2× RTX 4090 (48 GB VRAM) — компромисс по качеству.
Где взять русскоязычную документацию Qwen? Официальной русской документации нет. Опирайся на первоисточник и переводи браузером или руками: qwen.readthedocs.io, github.com/QwenLM, model cards на huggingface.co/Qwen. Русские пересказы на сторонних медиа могут быть устаревшими или неточными — не используй их как источник фактов.
Можно ли fine-tune Qwen на своих данных? Да, лицензия Apache 2.0 разрешает. Стандартные тулкиты — LLaMA-Factory, axolotl, transformers Trainer. Для мелких моделей (0.6B–8B) — LoRA на 1 GPU за часы. Для 32B — LoRA на 1× A100 за день. Для 235B — QLoRA на кластере 4–8 GPU за неделю.
Что читать, чтобы начать с Qwen прямо сейчас? Три ссылки: (1) qwenlm.github.io — блог с релиз-нотами. (2) huggingface.co/Qwen — model cards с примерами кода. (3) ollama.com/library/qwen3 — простейший путь запустить у себя за 2 минуты.
Что дальше
Заголовок раздела «Что дальше»- Артикул 040 — «DeepSeek V3 и R1: китайский reasoning-стек для российского пользователя».
- Артикул 041 — «Llama 4 и open-source-стек Meta в 2026».
- Артикул 011 — big-3 сравнение Claude / GPT / Gemini vs open-source.
- Артикул 019 / 020 — Claude Sonnet для контекста, чем отличается подход к open-source у западных вендоров.
Sources
Заголовок раздела «Sources»Все ссылки проверены 02.08.2026. Первоисточники — официальные материалы Alibaba Cloud, репозитории QwenLM на GitHub, модельные карточки на Hugging Face.
- Qwen official blog — релиз-ноты и анонсы. Проверено 02.08.2026.
- Qwen3 announcement blog — релиз 29.04.2025, полная линейка dense и MoE, 119 языков, thinking mode. Проверено 02.08.2026.
- Qwen3-Coder announcement blog — релиз 22.07.2025, 480B-A35B, 7.5T данных, 70% код. Проверено 02.08.2026.
- Qwen3-235B-A22B-Instruct-2507 model card — MoE 235B/22B, 256K→1M контекст, Apache 2.0, benchmarks против GPT-4o, DeepSeek-V3, Claude Opus 4. Проверено 02.08.2026.
- Qwen3-Coder-480B-A35B-Instruct model card — 480B total, 35B active, 160 экспертов, benchmarks SWE-Bench. Проверено 02.08.2026.
- Qwen3-VL-235B-A22B-Instruct model card — vision-language, Interleaved-MRoPE, Visual Agent, 32 языка OCR. Проверено 02.08.2026.
- Qwen3-Omni-30B-A3B-Instruct model card — omni-модель, Thinker-Talker, 119 языков текста, 18/10 языков голоса. Проверено 02.08.2026.
- Qwen3-32B model card — dense-флагман, thinking mode, YaRN до 131K. Проверено 02.08.2026.
- QwenLM GitHub organization — все репозитории (Qwen3, Qwen3-Coder, Qwen3-VL, Qwen3-Omni, qwen-code). Проверено 02.08.2026.
- Hugging Face Qwen organization — 458+ моделей под Apache 2.0. Проверено 02.08.2026.
- Ollama Qwen3 library — все размеры от 0.6B до 235B, команды запуска. Проверено 02.08.2026.
- Alibaba Cloud Model Studio: available models — qwen3.7-max / plus / flash, omni-plus, регионы, OpenAI/Anthropic/DashScope API. Проверено 02.08.2026.
- Qwen Chat — веб-чат, Qwen3.7-Plus, генерация изображений. Проверено 02.08.2026.
- Qwen documentation — общий обзор моделей, self-hosting через vLLM, Ollama, llama.cpp, LM Studio, MLX. Проверено 02.08.2026.
- ModelScope Qwen organization — китайское зеркало Hugging Face. Проверено 02.08.2026.
Актуальность
Заголовок раздела «Актуальность»Актуально на 02.08.2026. Модели, цены и условия доступа меняются часто. Alibaba выпускает минорные версии линейки Max (3.5 → 3.6 → 3.7) примерно каждые 3-4 месяца. Перед бизнес-решением всегда сверяйся с первоисточником — все ссылки в разделе Sources выше. Цены DashScope доступны только в консоли Alibaba Cloud после регистрации; открытая pricing-страница на 02.08.2026 не отдаётся публично. RU-специфика доступа (юрлицо, оплата, KYC) может измениться быстрее, чем прайс — сверяй отдельно перед развёртыванием.