Модель, которая читает целиком. Миллион токенов контекста — это ваш договор, переписка и весь репозиторий в одном запросе, без нарезки на куски и без «напомни, о чём мы говорили выше».
«Миллион токенов» — цифра, которая ничего не говорит, пока не переведёшь её в страницы и строки. Потяните ползунок и посмотрите, что помещается в один запрос.
Пересчёт приблизительный: для русского текста один токен — это примерно 2,5 знака, страница — 1800 знаков, строка кода — около 40 знаков. На вашем тексте цифры сдвинутся в ту или другую сторону, но порядок будет такой.
Модель не думает всей своей массой сразу. На каждый токен маршрутизатор выбирает шестнадцать экспертов из восьмисот девяноста шести и два общих, которые работают всегда. Поэтому из 2,8 трлн параметров в счёт идут 104 млрд.
Разреженность даёт качество большой модели при вычислениях модели поменьше. Каждая точка справа — эксперт: маленький кусок сети, специализированный на своём. Пурпурные загораются на текущий токен, жёлтые — два общих, они участвуют в каждом.
K3 задумана как рабочая лошадь, а не как собеседник: код, документы, поиск, разбор картинок и видео. Всё это в одном окне и на русском.
Читает репозиторий целиком, а не по файлу за раз: видит, откуда вызывается функция и что сломается, если её тронуть. Работает с командной строкой и умеет доводить задачу до конца сама.
Загрузите пачку договоров, отчётов или выгрузку переписки — модель удержит их одновременно и будет сравнивать между собой, а не пересказывать по очереди.
Зрение встроено в модель, а не привинчено сбоку. Скриншот интерфейса, фотография документа, схема, кадр из ролика — всё это ей на вход наравне с текстом.
Модель ходит по ссылкам, собирает и сверяет источники. На BrowseComp — тесте на способность найти труднодоступный факт — заявлено 91,2 балла.
Усилие переключается между low, high и max. По умолчанию стоит максимальный: модель думает дольше, но точнее. На простых вопросах уровень имеет смысл снизить.
Умеет вызывать функции и возвращать строгий JSON, поэтому её можно ставить внутрь своего процесса, а не только разговаривать с ней в чате.
Обычное внимание дорожает квадратично: вдвое длиннее текст — вчетверо больше работы. Поэтому у большинства моделей контекст упирается в потолок задолго до миллиона.
Moonshot чередует собственное линейное внимание Kimi Delta Attention с полным Gated MLA примерно в отношении три к одному: 69 слоёв KDA и 24 слоя MLA. Лёгкие слои тянут длину, тяжёлые — точность. Такая связка срезает до 75 % кэша ключей и значений, а он и есть главный ограничитель длины.
Ниже — цифры как есть, без округления в свою пользу. Часть замеров опубликована самой Moonshot, часть — независимыми площадками; источник подписан у каждой строки.
В сводных индексах на момент выхода K3 занимала третье место у Artificial Analysis и второе у Vals AI, уступая только Claude Fable 5 и GPT-5.6 Sol. Для модели с открытыми весами это лучший результат, который вообще был: разрыв между открытыми и закрытыми моделями сократился с девяти месяцев примерно до трёх-пяти.
Компанию основали в Пекине в марте 2023 года. По-китайски она называется 月之暗面 — «обратная сторона Луны», в честь альбома Pink Floyd. Kimi — личное английское прозвище основателя Ян Чжилиня, которое стало именем всей линейки.
Пекин, трое основателей во главе с Ян Чжилинем. Ставка с самого начала — длинный контекст.
Чат, который брал документы объёмом в сотни тысяч знаков, когда все остальные считали контекст десятками тысяч.
Появились рассуждения: модель научилась думать перед ответом, а не отвечать первым, что пришло.
Открытые веса на модель такого размера. Тот момент, когда стало ясно, что открытые модели догоняют.
Нативное зрение и отдельные варианты, заточенные под агентную работу с кодом.
2,8 трлн параметров, миллион токенов, видео на входе. Веса выложены 27 июля под собственной лицензией Kimi K3.
У K3 есть чёткая специализация. Там, где задача упирается в объём материала или в длинную цепочку шагов, она сильнее большинства. Там, где нужен быстрый короткий ответ, — берите модель полегче.
Десять редакций одного договора, приложения, протоколы разногласий — всё загружается вместе. Модель сравнивает формулировки между документами, а не пересказывает каждый по очереди, и показывает, в какой редакции условие изменилось.
Проект, который вам достался по наследству, помещается в контекст целиком. Можно спросить, зачем нужен модуль и что отвалится, если его убрать, — и получить ответ с учётом всех вызовов, а не одного файла.
Модель сама ходит по ссылкам, сверяет данные между источниками и отмечает расхождения. Пригодится там, где нужен не пересказ первой выдачи, а перепроверенная фактура.
Полсотни статей в одном окне: модель держит их одновременно, находит противоречия в выводах и собирает общую картину. Формулы и графики со страниц она тоже видит — зрение встроенное.
Данные из карточки модели и технического блога Moonshot на август 2026 года.
| Разработчик | Moonshot AI (月之暗面), Пекин |
| Представлена | 16 июля 2026, веса опубликованы 27 июля 2026 |
| Всего параметров | 2,8 трлн |
| Активных на токен | 104 млрд |
| Экспертов | 896, из них 16 выбираются на токен и 2 общих |
| Слои внимания | 69 Kimi Delta Attention и 24 Gated MLA |
| Контекст | 1 048 576 токенов |
| Вход | текст, изображения, видео |
| Уровни размышления | low, high, max — по умолчанию max |
| Инструменты | вызов функций, строгий JSON, работа в терминале |
| Квантизация | веса MXFP4, активации MXFP8 |
| Веса | опубликованы под лицензией Kimi K3 |
| Прирост к K2 | примерно в 2,5 раза по эффективности масштабирования |
| Доступ в Strelka AI | из России, без VPN и зарубежных карт |
Универсальных моделей не бывает. Три вещи, из-за которых K3 может не подойти под вашу задачу.
Около 34 токенов в секунду при медиане по рынку примерно 97. Для длинного разбора это незаметно, для живой переписки — раздражает. Если нужен быстрый диалог, возьмите модель полегче из того же каталога.
В режиме максимального усилия модель сначала выстраивает цепочку рассуждений и только потом начинает печатать. На сложной задаче ожидание окупается, на простом вопросе — нет. Уровень усилия стоит понижать.
В сводных рейтингах K3 идёт следом за Claude Fable 5 и GPT-5.6 Sol. Её преимущество — контекст и работа с большими объёмами, а не абсолютный максимум качества на коротких задачах.
Kimi K3 и ещё полсотни нейросетей в одном окне. Из России, без VPN и зарубежных карт.