Перейти к содержимому

Kimi K3, K2.7 Code и K2.6 от Moonshot AI в 2026: длинный контекст 1M и thinking mode

Автор: Silvana · Дата: 02.08.2026 · Verified: 01.09.2026 · Reading time: 10 минут · Prerequisite: 002, 011

Kimi K3 — актуальный флагман китайской Moonshot AI, объявлен в июле 2026: MoE на 2.8 триллиона параметров суммарно и 104 миллиарда активных, контекст 1 048 576 токенов, нативная мультимодальность и всегда включённое «мышление» (thinking mode с уровнями low/high/max). Цена K3 через API — $3 за 1M входных и $15 за 1M выходных токенов, cache-hit — $0.30. В линейке также K2.7 Code (специализация на программировании, 256K контекста) и K2.6 (универсальная с vision) — обе по $0.95/$4. Веб-чат kimi.com работает с русским и без подписки, API — platform.kimi.ai с минимальным пополнением $1. Оплата российской картой не проходит.

  • Kimi — линейка моделей китайской компании Moonshot AI (Пекин). Актуальный флагман на 2 августа 2026 — Kimi K3, объявлен в июле 2026, веса доступны с 27 июля 2026.
  • Kimi K3 — Mixture-of-Experts модель на 2.8 триллиона параметров суммарно, 104 миллиарда активных на токен (16 экспертов из 896). Контекст 1 048 576 токенов (1M), нативная мультимодальность (текст, изображения, видео).
  • Всегда включённое «мышление» (thinking mode) — K3 возвращает поле reasoning_content, режим настраивается уровнями low, high, max.
  • Цены K3 через официальный API: $3 за миллион входных токенов, $15 за миллион выходных, $0.30 за миллион cache-hit. Дешевле GPT-5.6 Sol в 1.5–2 раза при сопоставимом контексте.
  • Веб-чат kimi.com — бесплатный, работает с русским языком. API-платформа platform.kimi.ai — OpenAI-совместимая, минимальное пополнение $1.
  • В линейке также K2.7 Code (специализация на коде, 256K контекста) и K2.6 (универсальная, 256K, с vision), обе — по $0.95/$4 за миллион токенов.
  • Веса K3 и старых K2 выложены на Hugging Face. K2 — Modified MIT, K3 — собственная лицензия Kimi K3 License.
  • Прямая оплата российской картой на platform.kimi.ai не проходит — только зарубежная карта, посредник или крипта.

Moonshot AI — китайская компания из Пекина, зарегистрированная в 2023 году (юр. лицо «北京月之暗面科技有限公司» — «Пекинская технологическая компания „Обратная сторона Луны“»). Продукт называется Kimi. Позиционируется как frontier-модель для агентной работы, длинного кода и глубокого reasoning.

Если раньше главной фишкой Kimi был длинный контекст (в 2024 году они первыми в Китае показали 2 миллиона токенов у Kimi 1.5), то в 2026 году контекст 1M уже базовая планка у всех топовых моделей — Claude Fable 5, GPT-5.6, Gemini 3.5. Kimi перестала быть «моделью про длинный контекст» и стала полноценным конкурентом на арене frontier-моделей с фокусом на код и агентов.

Российскому разработчику Kimi полезен в двух сценариях. Первый — вы хотите frontier-качество, но не готовы платить $30 за миллион выходных токенов GPT-5.6 Sol. K3 даёт близкий уровень на кодинге и агентных задачах за $15. Второй — вам нужны открытые веса для self-hosting или дообучения. K2 доступен под Modified MIT, K3 — под собственной, но открытой лицензией.

Verified specs из huggingface.co/moonshotai/Kimi-K3 и github.com/MoonshotAI/Kimi-K3 (проверено 02.08.2026):

ПараметрЗначение
Model IDkimi-k3
ТипMixture-of-Experts
Всего параметров2 800 000 000 000 (2.8T)
Активных на токен104 000 000 000 (104B)
Экспертов всего896
Экспертов на токен16
Слоёв93 (69 KDA + 24 Gated MLA)
Vocabulary160 000 токенов
Контекст1 048 576 токенов (1M)
Максимум выхода1 048 576 токенов (по умолчанию 131 072)
Vision-энкодерMoonViT-V2 (401M параметров)
МультимодальностьТекст, изображение, видео
Thinking modeВсегда включён (low / high / max)
КвантованиеMXFP4 веса, MXFP8 активации
ЛицензияKimi K3 License (собственная)
Дата релиза27 июля 2026

K3 позиционируется Moonshot как первая открытая модель класса 3T параметров. Архитектурный прыжок — Kimi Delta Attention (KDA) плюс Attention Residuals (AttnRes) — по заявлениям авторов даёт «примерно 2,5× улучшение общей эффективности масштабирования» относительно K2. Технический отчёт опубликован в июле 2026.

Цены K3 через официальный API (platform.kimi.ai/docs/pricing, проверено 02.08.2026):

ПараметрЗначение
Input$3.00 за 1M токенов
Output$15.00 за 1M токенов
Cache hit$0.30 за 1M токенов
Минимальное пополнение$1

Prefix caching включается автоматически, если исходный промпт больше 256 токенов. То есть если вы отправляете один и тот же system prompt на 50 000 токенов повторно — вторая и последующие итерации на этой части стоят $0.30 вместо $3 за миллион.

Бенчмарки K3 (из карточки модели на Hugging Face, проверено 02.08.2026):

КатегорияБенчмаркK3
КодингDeepSWE67.5
КодингTerminal-Bench 2.188.3
ReasoningGPQA Diamond93.5
ReasoningAA-LCR74.7
Агентные задачиBrowseComp91.2
Агентные задачиOSWorld-Verified84.8
VisionMathVision94.3 / 97.8 (pass@1/5)
VisionVideo-MME90.0

По собственным сравнениям Moonshot, K3 уступает GPT-5.6 Sol и Claude Fable 5 в топовых сценариях, но существенно опережает все открытые альтернативы. Для frontier-уровня открытой модели с MoE-экономикой инференса — рыночный лидер на конец июля 2026.

Verified specs из platform.kimi.ai (проверено 02.08.2026):

ПараметрЗначение
Model IDkimi-k2.7-code
Размер (на HF)1.1T
Контекст262 144 токенов (256K)
Input$0.95 за 1M токенов
Output$4.00 за 1M токенов
Cache hit$0.19 за 1M токенов
СпециализацияCoding, follow instructions
Дата на HF15 июня 2026

K2.7 Code — это модель для тех, кому нужен приличный кодинг за очень скромные деньги. Один миллион выходных токенов на K2.7 Code стоит $4 против $15 у K3 и $30 у GPT-5.6 Sol. Для массовой генерации кода в CI, автосабмита pull request-ов или AI-code review — очевидный выбор.

Контекст 256K — этого хватит на средний Go/Python-репозиторий целиком без chunking. Если вы работаете с monorepo на 3–4 миллиона строк — берите K3 с его 1M.

Verified specs из platform.kimi.ai (проверено 02.08.2026):

ПараметрЗначение
Model IDkimi-k2.6
Размер (на HF)1.1T
Контекст262 144 токенов (256K)
Input$0.95 за 1M токенов
Output$4.00 за 1M токенов
Cache hit$0.16 за 1M токенов
VisionЕсть
Thinking modeОпциональный (thinking / non-thinking)
Дата на HF19 мая 2026

K2.6 — это «middle-tier» универсальная модель Kimi. По ценнику ровно как K2.7 Code, но универсальнее (есть vision, есть переключение thinking mode).

Практика: если задача — код и никакой картинки, берите K2.7 Code, вы в среднем получите лучший результат. Если задача — универсальная (описания карточек, разбор скринов, чат-бот, RAG), берите K2.6.

Verified specs из huggingface.co/moonshotai/Kimi-K2-Instruct (проверено 02.08.2026):

ПараметрЗначение
Model IDKimi-K2-Instruct
ТипMixture-of-Experts
Всего параметров1T
Активных на токен32B
Экспертов всего384
Экспертов на токен8 (плюс 1 shared)
Слоёв61 (включая 1 dense)
AttentionMLA (Multi-head Latent Attention)
Контекст131 072 токенов (128K)
Vocabulary160 000 токенов
Тренировка15.5T токенов, оптимизатор Muon
ThinkingReflex-grade (без long thinking)
ЛицензияModified MIT
Дата на HF23 апреля 2026 (Kimi-K2-Instruct)

K2 — это последняя версия Kimi, для которой Moonshot выложил веса под лицензией, близкой к MIT, без ограничений на коммерческое использование. С K3 ситуация иначе — там своя лицензия «Kimi K3 License», с ограничениями.

Для self-hosting и дообучения на своих данных, если вам не нужен frontier K3, Kimi K2-Instruct — сильный кандидат. По бенчмаркам он на уровне GPT-4-класса (MMLU 89,5%, SWE-bench Verified 65,8%), при этом веса открыты и лицензия минимально ограничивающая.

Отдельно — Kimi-K2-Base (тоже 1T/32B, тоже 128K, тоже Modified MIT) — это foundation-модель без instruction-tuning, для тех, кто хочет тренировать свой post-training pipeline.

API совместим с OpenAI SDK. Endpoint: https://api.moonshot.ai/v1. Аутентификация — Bearer token в заголовке.

Минимальный пример на Python:

import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Разбери мой договор поставки на 40 страниц"}],
reasoning_effort="high", # low / high / max
)
print(completion.choices[0].message.content)
print(completion.choices[0].message.reasoning_content) # цепочка рассуждения

Ключевые особенности API:

  • OpenAI-совместимый интерфейс. Существующий код на openai SDK работает после смены base_url и model.
  • Anthropic-совместимый интерфейс. Есть режим совместимости с Claude Messages API — для тех, у кого код уже написан под Anthropic SDK.
  • Structured Output. JSON-схемы через параметр response_format — как у OpenAI.
  • Tool calling с tool_choice="required". До 300 шагов вызовов инструментов в одной цепочке — для сложных агентов.
  • Prefix caching автоматический. Кэш включается, когда исходный промпт больше 256 токенов. Cache hit стоит в 10 раз дешевле обычного input.

Rate limits идут по tiers, зависят от общего пополнения баланса. Для минимального tier ($1) лимиты небольшие — этого хватит на тесты, но не на продакшн. Для продакшн-нагрузки Moonshot предлагает связаться напрямую.

kimi.com — бесплатный веб-чат от Moonshot. По состоянию на 2 августа 2026 в веб-интерфейсе показывает модель K3 как основную. Из интерфейса доступно:

  • Обычный чат с K3 (текст + загрузка файлов, включая PDF)
  • Плагины (Plugins)
  • Запланированные задачи (Scheduled Tasks)
  • Раздел «Explore inspiration» — готовые сценарии
  • Многоязычность (русский поддерживается)

Веб-чат бесплатен без явных лимитов, но при высокой нагрузке может ограничивать длину и скорость. Есть платный тариф (Kimi Business для корпоративных клиентов) — цены на сайте не указаны, только «связаться с продажами».

Использование из России. Веб-чат kimi.com в базовом виде открывается напрямую без прокси и специальных настроек. Регистрация возможна по email. Прямая оплата российской картой на платной подписке или на API-платформе не проходит — карты РФ не принимаются в Moonshot. Варианты обхода — те же, что и с OpenAI: зарубежная карта, посредник, крипта.

Хотя 1M контекста в 2026 году есть уже у Claude Sonnet 5, GPT-5.6 и Gemini 3.5 — Kimi K3 попадает в эту нишу с существенно более низкой ценой. Один миллион токенов на вход стоит $3 против $5 у GPT-5.6 Sol и близко к цене Claude Haiku при качестве Claude Sonnet-класса.

Что это даёт на практике:

  • Загрузка PDF на 500+ страниц целиком. Средний многотомный отчёт, годовая финансовая отчётность, полная нормативка на подотрасль — всё влезает без chunking и RAG.
  • Analysis целой книги. 300 000 слов ≈ 400 000 токенов — свободно.
  • Multi-file код-ревью. Средний monorepo на 200–500 файлов Python/TypeScript влезает в один промпт.
  • Многочасовая память в agent-режиме. Агент может держать всю историю сессии в контексте, а не в RAG, — за счёт cache hit это ещё и дёшево.
  • Multi-source research. 20–30 длинных статей одновременно в контексте, модель сама сопоставляет.

Раньше эти сценарии закрывались только Claude или Gemini по премиум-ценам. Kimi K3 даёт то же самое в 1.5–2 раза дешевле по API.

Cross-ref с «GPT-5.6: Sol, Terra, Luna — что выбрать в 2026» (артикул 022) и «Claude Sonnet 5» (артикул 020):

МодельInput $/1MOutput $/1MКонтекстПозиционирование
Kimi K3$3.00$15.001MFrontier + open weights
Kimi K2.7 Code$0.95$4.00256KКодинг, эконом
Kimi K2.6$0.95$4.00256KУниверсал, эконом
Kimi K2-InstructOpen weightsOpen weights128KSelf-host, Modified MIT
GPT-5.6 Sol$5.00$30.001.05MFrontier закрытый
GPT-5.6 Terra$2.00$12.001.05MБалансный закрытый
Claude Sonnet 5по прайсу claude.comпо прайсузависит от версииFrontier закрытый
Gemini 3.5по прайсу ai.google.devпо прайсу2MМультимодальный закрытый

Ключевое отличие Kimi от big-3 (OpenAI / Anthropic / Google) — сочетание frontier-качества с открытыми весами и низкой ценой API. GPT и Claude закрыты полностью. Gemini закрыт, но у Google своя игра. Kimi даёт вам одновременно доступ к веб-чату, дешёвому API и открытые веса для тех задач, где нужна независимость.

Для self-hosting K3 официально рекомендуются:

  • vLLM — с готовыми рецептами из github.com/MoonshotAI
  • SGLang — с cookbook примерами
  • TokenSpeed — фирменный инференс-движок Moonshot

По железу: 2.8T параметров с MXFP4-квантованием — это ориентировочно 8× H100 80GB или эквивалент для приемлемой скорости инференса. Практически self-hosting K3 доступен только крупным командам с собственной GPU-инфраструктурой. Для меньших сценариев проще пользоваться API.

Kimi K2-Instruct (1T/32B, Modified MIT) self-host-ится значительно легче: MoE-архитектура с 32B активных параметров запускается на 2× H100 или на 4× A100 80GB. Для тех, кто хочет полный контроль над моделью и данными, — прагматичный выбор.

Дистилляций K3 в меньшие размеры на 2 августа 2026 нет. Дистилляции K2 в 7B / 14B / 32B форматах есть в комьюнити, но качество варьируется — тестируйте под задачу.

Оплата российской картой на platform.kimi.ai по состоянию на 2 августа 2026 не проходит. Практические варианты:

  1. Международный посредник для API. Российские SaaS-агрегаторы, которые ставят Kimi K3/K2 в свой каталог рядом с OpenAI и Claude. Оплата рублями, доступ через прокси-endpoint.
  2. Зарубежная банковская карта. Работает напрямую, если есть карта иностранного банка и адрес выставления счёта в поддерживаемой юрисдикции.
  3. Криптооплата через посредника. Часть агрегаторов принимает USDT.
  4. Собственный self-hosting K2-Instruct. Если у вас своя GPU-инфраструктура, никаких платежей никому — только Modified MIT-лицензия.

Веб-чат kimi.com при этом открывается из РФ напрямую и работает бесплатно с русским языком — этого хватит на большинство личных и small-business задач.

Сценарий 1. Российский разработчик анализирует нормативные документы на 500 страниц. Задача — прочитать оферту маркетплейса вместе с приложениями, найти пункты риска, сравнить с прошлой редакцией. Возьмите Kimi K3. 500 страниц ≈ 350 000 токенов входа + 8 000 выхода. Стоимость одного разбора: $1.05 + $0.12 = $1.17. Cache hit при повторных вопросах по тому же документу — $0.105 на входе.

Сценарий 2. E-commerce генерит SEO-описания карточек товаров. 500 генераций в день, каждое описание ≈ 800 токенов на выход + 300 на вход. Возьмите Kimi K2.6 или K2.7 Code. Дневная стоимость: 400 000 output × $4 + 150 000 input × $0.95 = $1.60 + $0.14 = $1.74/день, месяц ≈ $52. Сравнительно на GPT-5.6 Terra: $144. Экономия почти в 3 раза.

Сценарий 3. Автосабмит pull request-ов в CI. Каждый PR = 15 000 токенов на вход (изменения плюс контекст) + 3 000 токенов на выход (описание + тесты). 200 PR в день. Возьмите Kimi K2.7 Code. Дневная стоимость: 3M input × $0.95 + 600K output × $4 = $2.85 + $2.40 = $5.25, месяц ≈ $158. Сопоставимо: GPT-5.6 Sol — $600. Разница 4×.

Сценарий 4. Кодинг-агент с полным репозиторием в контексте. Проект на TypeScript/Go, 300 файлов, ≈ 500 000 токенов в сумме. Возьмите Kimi K3 с reasoning_effort="high". Один запрос с полным репозиторием: 500 000 input + 15 000 output = $1.50 + $0.225 = $1.73. При кэшированном контексте повторные запросы стоят $0.15 + $0.225 = $0.38. Cache hit решает.

Сценарий 5. Self-hosted K2-Instruct для приватных данных банка. Ключевые запросы с персональными данными нельзя отправлять во внешний API. Разворачиваете Kimi K2-Instruct (Modified MIT) на 4× H100 внутри контура. Стоимость железа: капитальные вложения, но нулевые платежи за токены. Для банковских масштабов — экономически оправдано за 6–12 месяцев.

Kimi — китайская модель, безопасно ли отправлять туда чувствительные данные? Как и с любым SaaS-провайдером за рубежом — нет универсального ответа. По ПДн российских резидентов — не соответствует 152-ФЗ, если вы не оформляли отдельное согласие пользователя. По коммерческой тайне — политика Moonshot по хранению и использованию запросов описана в их Terms; читайте до прод-интеграции. Для критичных данных — self-host K2-Instruct под Modified MIT.

Почему актуальная модель называется K3, а не K2 или K3.5? Kimi 1 → Kimi K1.5 → Kimi K2 → Kimi K2.5 → Kimi K2.6 → Kimi K2.7 Code → Kimi K3. Moonshot идёт мажорными версиями каждые 6–8 месяцев, между ними — точечные апдейты. K3 — первый релиз в новой архитектуре (KDA + AttnRes), первый MoE 2.8T, первая нативная мультимодальность и первая с 1M-контекстом у Kimi. Ждать K3.5 стоит примерно к концу 2026 — началу 2027.

Чем K3 лицензия отличается от K2 Modified MIT? K2-Instruct и K2-Base — Modified MIT, минимально ограничивающая. Коммерческое использование, дообучение, редистрибуция без ограничений (за исключением стандартных «no warranty»). K3 — своя лицензия Kimi K3 License (полный текст на GitHub). По духу — тоже открытая, но с ограничениями на использование моделью для конкурирующей коммерческой AI-услуги в определённых сценариях. Читайте текст лицензии перед использованием K3 в продакшне.

Работает ли Kimi с русским языком? Да. Обучающий корпус K3 включает большое количество текста на разных языках, включая русский. Качество на русском в веб-чате kimi.com сопоставимо с GPT и Claude в бытовых задачах. На нишевых доменах (юр. терминология, техническая документация) прогоняйте свои реальные запросы для калибровки — везде это правило работает одинаково.

Есть ли у Kimi K3 отдельная thinking-версия, как у OpenAI o-series? Нет отдельной версии. У K3 thinking mode всегда включён, регулируется параметром reasoning_effort со значениями low, high, max. То есть K3 — это одновременно и «обычная», и «thinking» модель в одной. У K2.6 thinking mode опциональный (можно включать/выключать), у K2-Instruct — reflex-grade без long thinking.

Что такое Kimi Code? Kimi Code — CLI-агент от Moonshot, аналог Claude Code или Cursor CLI. Работает поверх Kimi K3 через API. Устанавливается через npm, привязывается к API-ключу с platform.kimi.ai. Открытый исходник, MIT-подобная лицензия.

Правда ли, что у Kimi раньше был 2M контекст? Да. В начале 2024 года Moonshot первым в китайском AI-сегменте показал 2M-контекст в модели Kimi 1.5. Но это был исследовательский демо, а не продакшн. В стабильной линейке контекст постепенно рос: 128K → 200K → 256K → 1M у K3. 2M токенов в актуальной линейке K3/K2.7/K2.6 нет. Такой контекст сейчас есть только у Gemini 3.5.

Как быстро отвечает K3 в сравнении с GPT-5.6 Sol? По собственным замерам Moonshot и стороннему тестированию, K3 в режиме reasoning_effort="low" отвечает сопоставимо с GPT-5.6 Terra и заметно медленнее GPT-5.6 Sol Fast mode. В режимах high и max время ответа растёт из-за длинной цепочки рассуждения — как и у любых thinking-моделей. Для интерактивных сценариев (чаты, live-агенты) держите low, для сложных задач — high/max.

Можно ли использовать Kimi для генерации изображений или голоса? Kimi K3 принимает изображения и видео на вход, но отдаёт только текст. Для генерации изображений у Moonshot нет отдельной модели, аналогичной GPT Image 2 или Gemini Image 3. Для голоса — есть исследовательский проект Kimi-Audio как foundation-модель, но не как готовый продакшн-сервис.

Есть ли смысл переходить с Claude или GPT на Kimi? Смотрите на две вещи: качество на ваших реальных запросах и экономику. Прогоните 30–50 своих типовых промптов через веб-чат Kimi и через свой текущий стек. Сравните ответы вслепую. Если Kimi даёт сопоставимое качество и экономит вам 40–70% по API — переход оправдан. Если качество проседает даже на 5–10% — не переезжайте, разница в цене не окупит потерь в конверсии.

  • Артикул 011 — big-3 сравнение Claude / GPT / Gemini в единой таблице.
  • Артикул 022 — «GPT-5.6: Sol, Terra, Luna — что выбрать в 2026».
  • Артикул 039 — «DeepSeek V4: китайский конкурент Kimi для разработчиков» (в производстве).
  • Артикул 040 — «Qwen 3 линейка от Alibaba — open-weight альтернатива Kimi» (в производстве).

Все ссылки проверены 02.08.2026. Основные источники — официальный сайт Moonshot, API-платформа, карточки моделей на Hugging Face и репозитории на GitHub.

  1. Moonshot AI (homepage) — информация о компании, продуктах, миссии. Проверено 02.08.2026.
  2. Kimi web chat — бесплатный веб-интерфейс с K3, доступ из РФ без прокси. Проверено 02.08.2026.
  3. Kimi API Platform — каталог моделей K3, K2.7 Code, K2.6 с ценами и контекстом. Проверено 02.08.2026.
  4. Kimi K3 Quickstart — endpoint, SDK, thinking mode, tool calling. Проверено 02.08.2026.
  5. Kimi API Pricing — детальный прайс по моделям. Проверено 02.08.2026.
  6. Moonshot AI on Hugging Face — 19 моделей, включая K3, K2.7 Code, K2.6, K2.5, K2-Instruct, K2-Base, Moonlight. Проверено 02.08.2026.
  7. Kimi-K3 model card on Hugging Face — параметры, бенчмарки, конфигурация. Проверено 02.08.2026.
  8. Kimi-K2-Instruct model card on Hugging Face — параметры K2, тренировка, лицензия Modified MIT. Проверено 02.08.2026.
  9. MoonshotAI GitHub — репозитории K3, K2, Kimi-VL, Kimi-Audio, Kimi-Linear, Moonlight, MoBA. Проверено 02.08.2026.
  10. MoonshotAI/Kimi-K3 GitHub repo — технический отчёт, конфигурация модели, спецификации. Проверено 02.08.2026.
  11. MoonshotAI/Kimi-K2 GitHub repo — исходники и документация K2, arxiv.org/abs/2507.20534 tech report. Проверено 02.08.2026.
  12. Kimi K3 tech blog — анонс модели, сравнение с K2, целевые сценарии. Проверено 02.08.2026.

Актуально на 02.08.2026. Модели, цены и условия доступа меняются часто. Перед бизнес-решением всегда сверяйся с первоисточником — все ссылки в разделе Sources выше. Веса Kimi K3 опубликованы 27 июля 2026, полная лицензия K3 может пересматриваться — читай текст лицензии на GitHub перед коммерческим использованием. RU-специфика (посредники, оплата) меняется быстрее, чем прайс, — проверяй отдельно перед оплатой.