Поиск

Moonshot AI представила Kimi K3: 2,8 трлн параметров и контекст 1 млн токенов

Moonshot AI представила Kimi K3: 2,8 трлн параметров и контекст 1 млн токенов

Китайская компания Moonshot AI представила флагманскую языковую модель Kimi K3. Это самая крупная и мощная разработка студии: в ней заявлено 2,8 трлн параметров, поддержка контекстного окна до 1 млн токенов, а также встроенное понимание изображений и видео. Новинка уже работает в веб-версии Kimi, приложении Kimi Work, терминальном помощнике Kimi Code и через API, а полные веса модели обещано опубликовать не позднее 27 июля 2026 года.

Для пользователей и разработчиков важно, что K3 ориентирована на длительные задачи — программирование, исследования и работу с объёмными документами. Тем, кто выбирает инструмент для продолжительной автономной работы с большими данными, стоит оценить заявленные характеристики и ограничения модели уже сейчас.

Первая открытая модель близко к масштабу 3 трлн параметров

Презентация Kimi K3 состоялась 16 июля. По словам разработчика, модель стала первой открытой системой, приблизившейся к масштабу около 3 трлн параметров. Для сравнения: предыдущая модель семейства, Kimi K2, имела 1 трлн параметров.

Называть K3 полностью открытой пока рано. Сейчас ею можно пользоваться через продукты и API Moonshot AI, но файлы для самостоятельного развёртывания ещё не выложены. Компания обещает опубликовать полные веса до 27 июля вместе с подробным техническим отчётом об архитектуре, обучении и тестах. До этого момента сообщество не сможет запустить модель на своей инфраструктуре и независимо проверить её устройство.

Контекст в 1 млн токенов для длительной работы

Контекстное окно Kimi K3 достигает 1 048 576 токенов. В него помещаются крупная кодовая база, пакет финансовой отчётности, архив технической документации или длинная история действий агента. Модель принимает текст, изображения и видео, а отвечает текстом.

На практике такой объём полезен там, где система должна долго удерживать рабочий контекст: помнить структуру проекта, возвращаться к найденным источникам, учитывать правки и продолжать задачу через сотни шагов. Простая загрузка огромного массива данных не гарантирует точности — важно, находит ли модель нужный фрагмент и не противоречит ли своим ранним решениям.

Moonshot AI добавила автоматическое кэширование контекста. При повторных запросах с одинаковой длинной начальной частью система не обрабатывает весь материал заново, что снижает стоимость для агентов, многократно обращающихся к одним и тем же документам или коду.

Как размещаются 2,8 трлн параметров

Архитектура Kimi K3 использует схему Mixture of Experts — «смесь экспертов». Внутри модели 896 специализированных блоков, но на каждый фрагмент текста активируются только 16. Поэтому число 2,8 трлн не означает такой же объём вычислений на запрос: большая часть параметров остаётся неактивной. Это позволяет наращивать вместимость без пропорционального роста затрат, хотя инфраструктура остаётся тяжёлой — для запуска рекомендуются системы минимум с 64 ускорителями в одном узле.

Новая схема называется Stable LatentMoE и призвана равномерно распределять нагрузку между экспертами, чтобы избежать перегрузки отдельных блоков.

Ускорение длинного контекста через KDA

Ключевое архитектурное изменение — Kimi Delta Attention (KDA). Это механизм внимания, который сочетает классический подход с более экономичным линейным. По данным Moonshot, такая схема особенно эффективна при длинных последовательностях, где обычное внимание расходует слишком много памяти. Дополнительно используется технология Attention Residuals для выборочного возврата к полезным промежуточным представлениям между слоями. Внутренняя оценка компании говорит о 2,5-кратном приросте эффективности масштабирования относительно K2.

Сценарии применения и результаты тестов

Moonshot AI позиционирует K3 как модель для продолжительной самостоятельной работы: разбор репозиториев, использование терминала, написание и проверка кода, исправление ошибок. В демонстрациях модель создала компактный компилятор MiniTriton для GPU и за 48 часов спроектировала микросхему под малую версию своей архитектуры. В научных задачах она изучила более 20 работ по астрофизике, проверила свыше 300 уравнений состояния и написала более 3000 строк Python-кода примерно за два часа.

В программировании K3 сравнивают с Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5 и GLM-5.2. Компания признаёт общее отставание от лидеров, но на отдельных тестах модель лидирует: на SWE Marathon у неё 42 балла против 40 у Claude Opus 4.8 и 39 у GPT-5.6 Sol; на Program Bench — 77,8 при 77,6 у GPT-5.6 Sol. При этом на FrontierSWE K3 получила 81,2 против 86,6 у Claude Fable 5.

В поиске и работе с инструментами K3 набрала 91,2 на BrowseComp и 30,8 на Automation Bench. API поддерживает вызов внешних инструментов и динамическую загрузку функций по ходу диалога, однако интернет-поиск пока помечен как обновляемый и не рекомендованный для рабочих систем.

Доступность, цена и ограничения

Kimi K3 доступна на сайте Kimi, в мобильных приложениях для iOS, Android и HarmonyOS, в Kimi Work 3.1.0 для Windows и Mac с Apple Silicon, в Kimi Code и через API. В Kimi Code модель открыта с уровня подписки Moderato, а контекст 1 млн токенов — с тарифа Allegretto. API совместим с форматом OpenAI и всегда работает в режиме рассуждения.

Стоимость API kimi-k3 составляет $3 за миллион входных и $15 за миллион выходных токенов. При кэшированном входе цена падает до $0,30. Для сравнения, K2.6 стоит $0,95, $0,16 и $4 соответственно. В задачах программирования заявлено более 90% попаданий в кэш.

У модели три заметных ограничения. Первое: некорректная передача истории рассуждений между шагами или переключение сессии с другой модели снижает качество. Второе: избыточная самостоятельность — при нечёткой инструкции агент может пойти неожиданным путём. Третье: сама Moonshot отмечает, что пользовательский опыт K3 пока уступает Claude Fable 5 и GPT-5.6 Sol.

Kimi K3 — заметный шаг в сторону открытых моделей с рекордным масштабом и миллионным контекстом, близких по ряду задач к ведущим закрытым системам. Главная проверка состоится после 27 июля 2026 года, когда выйдут веса и отчёт, и независимые команды смогут оценить реальные требования, устойчивость и итоговую стоимость длинных рабочих циклов.

15:51
123
Нет комментариев. Ваш будет первым!