Перейти к содержимому

Open-weight LLM: Llama, Qwen, DeepSeek — что можно скачать

Автор: Silvana · Дата: 30.07.2026 · Verified: 30.07.2026 · Reading time: 4 минуты · Prerequisite: 011-big-3-llm-2026-claude-gpt-gemini

  • Open-weight — модель, у которой «мозги» (веса нейросети) выложены в открытый доступ. Можно скачать и запустить у себя.
  • В отличие от Claude, GPT, Gemini — не нужно платить за токены и отправлять данные в чужое облако.
  • Крупнейшие семейства 2026 года: Llama (Meta), Qwen (Alibaba), DeepSeek.
  • Цена — своё железо: топовые модели требуют серверных GPU, лёгкие крутятся на обычном ноутбуке.
  • Полезно, когда важна приватность данных, работа офлайн или контроль над моделью.

Представь разницу между сервисом в облаке и программой на своём компьютере. Google Docs — облако: удобно, но документы лежат у Google. Microsoft Word — локально: файлы у тебя, работает без интернета, зато обновлять и содержать надо самому.

Open-weight LLM — примерно то же самое. Claude или GPT — облачные модели, ты отправляешь запрос, компания обрабатывает и возвращает ответ. Веса самой нейросети — коммерческая тайна. Open-weight модели наоборот: разработчик выкладывает файл с весами в открытый доступ, ты скачиваешь и запускаешь локально или на своём сервере.

Зачем это нужно. Первое — приватность. Медицинские данные, персональные документы клиентов, коммерческая тайна — всё это можно не отправлять в OpenAI. Второе — стоимость на объёме. Если модель обрабатывает миллионы запросов в день, счёт за API станет больше, чем аренда своего сервера. Третье — контроль. Ты можешь дообучить модель под свою задачу и знаешь, что завтра её не «отключат» и не изменят.

Llama — самое известное семейство open-weight-моделей от Meta. Актуальные версии, доступные на Hugging Face и через Ollama:

  • Llama 3.1— три размера: 8B, 70B, 405B параметров. Поддерживает вызов инструментов.
  • Llama 3.2— компактные модели на 1B и 3B параметров, работают даже на смартфонах.
  • Llama 3.3— обновлённая модель на 70 миллиардов параметров.

Скачать можно на Hugging Face после принятия лицензии Meta. Компания разрешает коммерческое использование в большинстве случаев.

Qwen — семейство от китайского Alibaba. Многие модели идут под лицензией Apache 2.0, то есть можно свободно использовать в бизнесе. Актуальные версии:

  • Qwen 3— плотные модели от 0.6B до 32B параметров (0.6B / 1.7B / 4B / 8B / 14B / 32B) и MoE-варианты: Qwen3-30B-A3B (30 миллиардов параметров, 3 миллиарда активированных) и флагман Qwen3-235B-A22B (235 миллиардов параметров, 22 миллиарда активированных). Все выложены под Apache 2.0.
  • Qwen 3имеет гибридный режим мышления — модель либо «думает» пошагово перед ответом, либо отвечает мгновенно. Управляется параметромenable_thinking.
  • Qwen 3.5— новое поколение (vision + tools + thinking + audio), доступно в Ollama в размерах от 0.8B до 122B.
  • qwen3-coder— специализированные модели для кода в размерах 30B и 480B.

Qwen предобучен на 36 триллионах токенов, покрывающих 119 языков и диалектов, включая русский.

DeepSeek — китайская лаборатория, известная моделями серии V (сейчас V4) и R1 (умеет рассуждать). Актуальная API-линейка на 30.07.2026:

  • deepseek-v4-flash— быстрая модель, $0.14 вход / $0.28 выход за 1M токенов.
  • deepseek-v4-pro— более сильная модель, $0.435 / $0.87 за 1M токенов.

Веса R1 выложены в открытый доступ (в Ollama доступны размеры от 1.5B до 671B параметров, с поддержкой tools и thinking). DeepSeek стала известна тем, что близка по качеству к Claude и GPT при заметно меньших затратах на обучение и инференс.

  • Модель на 1–3B параметров — крутится на ноутбуке с 8–16 ГБ RAM.
  • Модель на 7–14B — нужен видеочип с 12–24 ГБ VRAM или мощный CPU.
  • Модель на 30B и выше — уже серверная задача, несколько GPU или облачный инстанс.
  • Готовые обёртки для запуска: Ollama, LM Studio, llama.cpp — прячут сложность внутри одной команды.
  • Работает из РФ напрямую.Hugging Face и GitHub доступны из России. Веса моделей можно свободно скачать.
  • Оплата в РФ.Скачивание бесплатное. DeepSeek API — оплата через китайскую или зарубежную карту. Локальный запуск на своём железе — бесплатный после покупки GPU.
  • RU-локализация.Llama 3.1/3.3 и Qwen 3 работают на нормальном уровне, DeepSeek — заметно лучше среднего. Все три семейства обучались на многоязычных корпусах, включая русский.
  • Российские альтернативы.Если данные вообще не должны покидать РФ и нужен официальный договор — см.«YandexGPT vs GigaChat: сравнение российских LLM». Open-weight часто выбирают компании, которым нельзя отдавать данные за границу и которые готовы держать модель у себя.

Актуально на 30.07.2026. Модели, цены и условия доступа меняются часто. Перед бизнес-решением всегда сверяйся с первоисточником по ссылкам выше.