Перейти к содержимому

Локальные LLM: Ollama, LM Studio, vLLM — что выбрать

Автор: Silvana · Дата: 30.07.2026 · Verified: 30.07.2026 · Reading time: 6 минут · Prerequisite: 002

  • Локальная LLM — это open-weight модель, которая скачивается один раз и работает на твоём компьютере или сервере. Ничего не уходит наружу.
  • Три главных стека: Ollama (простой CLI и REST API), LM Studio (десктоп-GUI), vLLM (production-инференс на GPU).
  • Что скачивать: Llama 3.1 (Meta, 8B/70B/405B), Qwen 2.5 (Alibaba, 0.5B–72B), DeepSeek-R1 (1.5B–671B, с thinking mode), Gemma 3 (Google, до 27B), Mistral 7B, Phi 4 (Microsoft, 14B).
  • Требования к железу: 7-8B модели крутятся на ноутбуке (16-32 ГБ RAM), 70B — нужна видеокарта 24+ ГБ VRAM или Apple Silicon с общей памятью, 400B — только сервер с несколькими GPU.
  • Локальные модели уступают frontier-моделям (Opus 5, GPT-5) на самых сложных задачах, но для типовой работы с текстом и кодом часто хватает.

Есть два пути получить AI-ответ: отправить запрос в облако вендора (OpenAI, Anthropic, Google) или запустить модель у себя. Первый — быстрее и мощнее, но данные уходят на чужой сервер, есть тарификация и зависимость от доступа. Второй — медленнее и слабее по frontier-задачам, но полная приватность, никаких лимитов и никакой зависимости от чужих политик.

Open-weight модели — это модели, у которых опубликованы веса. Скачал файл — можешь запускать сколько угодно. Ими делятся Meta (Llama), Alibaba (Qwen), DeepSeek, Google (Gemma), Mistral и десятки лабораторий поменьше через Hugging Face.

Три инструмента ниже — это оболочки, которые скрывают возню с CUDA, драйверами, форматами весов и запускают модель за пару команд.

Ollama (ollama.com) — самый простой способ запустить локальную модель. Ставится одной командой на macOS 14+, Windows, Linux и через Docker. После установки:

ollama run llama3.1

— и Meta Llama 3.1 8B скачивается и открывает чат в терминале. Дальше подключается любой клиент через REST-эндпоинтhttp://localhost:11434, включая Claude Code, OpenClaw, Continue, LibreChat.

Что есть в библиотеке (ollama.com/library, verified 30.07.2026):

  • Llama 3.1— 8B, 70B, 405B, поддержка tool-use, 117.9M скачиваний.
  • DeepSeek-R1— 1.5B–671B, reasoning с thinking mode и tools, 90.7M.
  • Llama 3.2— 1B, 3B, компактные модели с tools, 78.3M.
  • Gemma 3— 270M–27B, vision + thinking, 39.1M.
  • Qwen 2.5— 0.5B–72B, обучалась на 18 трлн токенов, tools, мультиязычность, 35.7M.
  • Mistral 7B— базовая с tool-use, 31.5M.
  • Phi 4— 14B от Microsoft, 7.6M.

Плюсы: минимум настройки, из коробки OpenAI-совместимый API. Идеально для персональной работы, экспериментов, локального RAG.

Минусы: под высокую нагрузку и параллельные запросы не оптимизирован — для этого есть vLLM.

LM Studio — GUI для тех, кому не нужен терминал

Заголовок раздела «LM Studio — GUI для тех, кому не нужен терминал»

LM Studio (lmstudio.ai) — приложение с интерфейсом. Работает на macOS (Apple Silicon), Windows (x64/ARM64), Linux (x64). Внутри — каталог моделей с поиском (питается от Hugging Face), кнопка «загрузить», окно чата.

Форматы: GGUF (llama.cpp) и MLX (native для Apple Silicon с ускорением на Neural Engine). Может работать как локальный OpenAI-совместимый сервер, через SDK на Python и TypeScript. Есть режим headless (llmster) для запуска на сервере без GUI, интеграция с MCP-серверами.

С 8 июля 2025 года LM Studio бесплатна и для личного, и для рабочего использования — раньше для work требовалась отдельная коммерческая лицензия, сейчас не нужна. Платные тарифы Teams и Enterprise существуют для организаций, которым нужны SSO, приватные team-hubs, централизованный контроль моделей и MCP.

Плюсы: полностью визуальный интерфейс, встроенный поиск моделей, работа с документами через RAG, поддержка voice-input с локальной обработкой.

Минусы: не рассчитан на production-нагрузку с сотнями параллельных запросов.

vLLM (docs.vllm.ai) — библиотека Python для быстрого инференса LLM в production. Разрабатывается в открытом коде, поддерживается индустрией. Целевой сценарий — не «запустить у себя на ноуте», а «поднять AI-сервис на сервере с GPU и обслуживать тысячи запросов в секунду».

Ключевые фичи: PagedAttention для эффективного управления KV-cache, continuous batching, chunked prefill, prefix caching, tensor/pipeline/data parallelism, поддержка форматов квантизации FP8, INT4, INT8, GPTQ, AWQ. Из коробки — OpenAI-совместимый сервер и Anthropic Messages API.

Поддерживает 200+ архитектур: decoder-only LLM (Llama, Qwen), MoE (Mixtral, DeepSeek-V3), multi-modal (LLaVA, Qwen-VL), embedding-модели. Работает на NVIDIA (CUDA), AMD (ROCm), Intel XPU, Google TPU, Ascend NPU, Apple Silicon (через плагины).

Установка на Linux с NVIDIA GPU:

uv pip install vllm --torch-backend=auto
vllm serve Qwen/Qwen2.5-1.5B-Instruct

Плюсы: production-grade throughput, гибкая шардировка на несколько GPU, экономия VRAM через PagedAttention, OpenAI-совместимость.

Минусы: требует Linux и GPU, для «просто попробовать на ноуте» избыточно.

  • Персональная работа, эксперименты, локальный chat/RAG на своём ноуте— Ollama.
  • То же самое, но нужен GUI и удобный поиск моделей— LM Studio.
  • Собственный AI-сервис для команды или продукта, нужен throughput— vLLM на сервере с GPU.
  • Комбинация— LM Studio для локального prompt-testing, vLLM для деплоя в production.
  • 1-3B модели(Llama 3.2 1B/3B, Qwen 0.5B–3B) — работают на любом ноутбуке с 8-16 ГБ RAM, ответы быстрые, качество для черновиков.
  • 7-8B модели(Llama 3.1 8B, Qwen 7B, Mistral 7B) — рабочий уровень для типовых задач, нужны 16-32 ГБ RAM на CPU или 8+ ГБ VRAM.
  • 13-32B(Phi 4 14B, Qwen 32B, Gemma 3 27B) — заметно сильнее, 32-64 ГБ RAM или 24 ГБ VRAM.
  • 70B(Llama 3.1 70B) — уровень небольшой frontier-модели, нужна карта 48+ ГБ VRAM или Apple Silicon Mac Studio.
  • 400B+(Llama 3.1 405B, DeepSeek-R1 671B) — только серверная сборка с несколькими GPU, чаще всего через vLLM с tensor parallelism.
  • Работает из РФ напрямую.Да. Ollama, LM Studio, vLLM ставятся из РФ без ограничений. Модели скачиваются с Hugging Face — иногда требует регистрации, доступ из РФ работает.
  • Оплата в РФ.Сами инструменты бесплатные. Оплата нужна только за железо (GPU или Mac с большой памятью) — покупается в РФ через любые каналы.
  • RU-локализация.Интерфейсы Ollama и vLLM — на английском. LM Studio — многоязычный UI, включая русский. Модели: Qwen 2.5, Gemma 3, Llama 3.1 — свободно работают с русским; DeepSeek — сильнее в китайском и английском, русский держит.
  • Российские альтернативы.YaLM open-source от Yandex (архив на GitHub), русскоязычные тюны Llama и Mistral от энтузиастов на Hugging Face. Ollama и vLLM запускают любую open-weight модель, включая российские.

Актуально на 30.07.2026. Библиотеки локальных LLM обновляются каждую неделю, новые модели выходят почти ежедневно. Перед выбором стека сверяйся с официальными репозиториями и списками моделей по ссылкам выше.