Moonshot AI 19 июля временно остановила оформление новых подписок после резкого роста интереса к Kimi K3. За 48 часов спрос приблизил доступные вычислительные мощности компании к пределу, поэтому ресурсы направили действующим подписчикам. Новые места будут открывать партиями после расширения инфраструктуры, точную дату возобновления продаж компания пока не назвала.

Moonshot AI остановила новые подписки спустя несколько дней после запуска Kimi K3
Moonshot AI сообщила 19 июля, что временно закрывает оформление новых подписок на сервисы Kimi. Причиной стал всплеск нагрузки после публичного запуска Kimi K3 16 июля: за предыдущие 48 часов потребление вычислительных ресурсов приблизилось к текущему пределу инфраструктуры компании.
Действующие подписчики сохраняют доступ. Moonshot AI решила направить имеющиеся мощности на обслуживание уже оплаченных аккаунтов, чтобы снизить риск очередей, ошибок и заметного падения скорости. Компания расширяет серверную инфраструктуру и планирует возвращать возможность подписки партиями, по мере появления свободной ёмкости.
В сообщении нет даты полного восстановления продаж. Такой формат оставляет Moonshot AI возможность добавлять пользователей постепенно и следить за реальной нагрузкой на каждом этапе.
Свежая новость касается именно подписок. Отдельного объявления об остановке Kimi API компания не публиковала, а официальная документация продолжает показывать модель kimi-k3 среди доступных вариантов. При высокой загрузке скорость и лимиты отдельных точек доступа всё равно могут меняться, поэтому текущие условия лучше проверять непосредственно перед оплатой или интеграцией.
За 48 часов спрос приблизил GPU-мощности Moonshot AI к пределу
Формулировка Moonshot AI указывает на дефицит мощности для инференса — запуска уже обученной модели и генерации ответов пользователям. Обучение Kimi K3 завершено, но каждый новый запрос требует памяти, вычислений и передачи данных между ускорителями. Чем длиннее контекст, глубже рассуждение и сложнее агентная задача, тем дольше заняты GPU.
Kimi K3 по умолчанию запускался с максимальным уровнем вычислительного усилия. Такой режим даёт модели больше времени на рассуждение и проверку промежуточных шагов, одновременно увеличивая расход ресурсов на один запрос. Массовый приток пользователей быстро превращает это свойство в инфраструктурную проблему: сервер должен удерживать большие контексты, обрабатывать цепочки вызовов инструментов и поддерживать долгие программные сессии.
Moonshot AI ограничила новые продажи, чтобы сохранить качество сервиса для уже оплаченных аккаунтов. Для действующих клиентов практический смысл решения понятен: их подписки продолжают работать, а доступная вычислительная ёмкость распределяется между меньшим числом платных пользователей.
Для тех, кто собирался оформить подписку после релиза, ситуация менее определённая. Компания обещает открывать места партиями, поэтому доступ может возвращаться постепенно и различаться между регионами, тарифами или продуктами. Официальное сообщение не уточняет очередность таких запусков.
Kimi Membership и Kimi Code Membership разделят разные сценарии использования
Moonshot AI одновременно объявила о перестройке подписок. Компания готовит два самостоятельных направления:
- Kimi Membership — доступ к Kimi через веб-интерфейс, мобильное приложение и Kimi Work;
- Kimi Code Membership — вычислительные ресурсы для программирования и связанных инструментов.
Разделение помогает прогнозировать нагрузку точнее. Обычный диалог часто состоит из коротких запросов и ответов. Программный агент может часами читать репозиторий, менять десятки файлов, запускать команды в терминале, анализировать ошибки и повторять тесты. Эти сценарии создают разный профиль потребления GPU, памяти и пропускной способности.
Новая структура позволит Moonshot AI выделять мощности под конкретный тип работы. Пользователь, которому нужен чат, документы и исследования, будет выбирать общий тариф. Разработчик, использующий Kimi Code CLI, редактор кода или совместимый агент, получит отдельный план с лимитами, рассчитанными на длительные программные задачи.
Окончательные цены, квоты и правила перехода между двумя направлениями в сообщении от 19 июля подробно не раскрыты. До публикации полной тарифной сетки рано оценивать, станет ли доступ дороже для людей, которые одновременно используют Kimi в браузере и в среде разработки.
Архитектура на 2,8 трлн параметров объясняет высокие требования Kimi K3 к инфраструктуре
Kimi K3 — флагманская модель Moonshot AI с 2,8 трлн параметров, нативной обработкой изображений и контекстным окном до 1 млн токенов. Эти характеристики компания раскрыла в официальном техническом блоге и документации API.
Число 2,8 трлн описывает общий объём параметров, однако модель использует архитектуру Mixture of Experts. Внутри неё работают 896 специализированных экспертных блоков, а для обработки одного токена активируются 16. Такой принцип сокращает объём вычислений по сравнению с одновременным запуском всей сети, хотя хранение модели и обмен данными между ускорителями остаются крайне тяжёлыми задачами.
Moonshot AI построила K3 на двух ключевых механизмах:
- Kimi Delta Attention управляет вниманием модели на длинных последовательностях и снижает стоимость обработки большого контекста;
- Attention Residuals помогает выбирать представления из разных слоёв сети, чтобы информация проходила через очень глубокую модель устойчивее.
По оценке разработчиков, архитектурные изменения дали примерно 2,5-кратный прирост эффективности масштабирования относительно Kimi K2. Это внутренняя оценка Moonshot AI, полученная на собственных методиках и конфигурациях.
Даже с разреженной архитектурой K3 остаётся моделью дата-центрового класса. Для самостоятельного размещения Moonshot AI рекомендует конфигурации уровня суперузла с 64 ускорителями или более. Такой масштаб сразу ограничивает круг организаций, способных запускать полную модель на собственной инфраструктуре.
Контекст в 1 млн токенов рассчитан на большие репозитории и долгие агентные задачи
Контекстное окно определяет, сколько текста, кода, изображений и служебных данных модель способна учитывать в одном рабочем сеансе. Лимит Kimi K3 в 1 млн токенов позволяет загружать крупные кодовые базы, длинные наборы документов и историю многоэтапной задачи без частого удаления ранних частей диалога.
Именно такие сценарии создают повышенную нагрузку. Короткий вопрос занимает сервер на несколько секунд. Анализ репозитория с сотнями файлов может включать чтение исходников, поиск зависимостей, создание патчей, запуск тестов и повторную проверку результата. В этот момент модель удерживает большой объём контекста и регулярно обращается к внешним инструментам.
Kimi K3 поддерживает визуальные данные, поэтому агент может анализировать скриншоты интерфейса, результаты рендеринга, схемы и изображения. Moonshot AI показывает примеры разработки интерфейсов, игр, 3D-сцен, CAD-проектов и научных расчётов. В подобных задачах модель циклически сравнивает код с визуальным результатом, что увеличивает число шагов и суммарное время обработки.
Компания связывает K3 с долгими инженерными сессиями, где агент работает с минимальным контролем человека. Популярность такого режима могла быстро поднять средний расход ресурсов на одного пользователя даже без экстремального роста общего числа аккаунтов.
Полные веса Kimi K3 обещаны к 27 июля 2026 года
Сейчас Kimi K3 доступен через продукты Moonshot AI: веб-сервис Kimi, Kimi Work, Kimi Code и официальный API. Полные веса модели компания обещает опубликовать к 27 июля 2026 года вместе с дополнительными сведениями об архитектуре, обучении и тестировании.
Публикация весов позволит сторонним облачным платформам и крупным организациям разворачивать K3 в собственной инфраструктуре. Часть нагрузки со временем сможет перейти к независимым провайдерам. Быстрого решения текущего дефицита вычислительных мощностей это не гарантирует: подготовка стабильного инференса для модели такого размера требует десятков ускорителей, скоростных соединений и оптимизированного программного стека.
Moonshot AI уже работает с разработчиками vLLM над поддержкой Kimi Delta Attention и кэширования префиксов. Кэш позволяет повторно использовать ранее обработанную часть контекста. Для программных задач, где агент много раз обращается к одному репозиторию и общей истории сеанса, такой механизм заметно сокращает повторные вычисления.
Официальный API использует модель kimi-k3. На момент публикации документации Moonshot AI указывала цены в долларах за миллион токенов:
| Операция | Цена |
| Входные токены при попадании в кэш | $0,30 |
| Входные токены без кэша | $3 |
| Выходные токены | $15 |
Компания заявляет, что в задачах программирования доля попаданий в кэш официального API превышает 90%. Реальный расход зависит от структуры запросов, длины истории, частоты повторного использования контекста и объёма ответа.
Заявленные результаты Kimi K3 потребуют независимой проверки после публикации весов
Moonshot AI позиционирует K3 как модель для программирования, работы со знаниями и глубокого рассуждения. В собственных тестах компания сравнивает её с ведущими закрытыми системами и сообщает высокие результаты в задачах оптимизации GPU-ядер, разработки компиляторов, анализа больших репозиториев и создания интерфейсов.
Эти цифры стоит читать с учётом методики. Для результатов Kimi K3 использовался максимальный уровень рассуждения, а разные модели в отдельных тестах запускались через разные агентные оболочки — Kimi Code, Claude Code или Codex. На итог влияет вся система: модель, набор инструментов, лимит времени, правила повторных попыток и качество программной обвязки.
Полные веса и технический отчёт дадут исследователям возможность воспроизвести часть результатов на одинаковом оборудовании и в одинаковых условиях. До 27 июля основная информация об архитектуре и эффективности исходит от самой Moonshot AI.
Текущая пауза с подписками подтверждает другой измеримый факт: интерес к Kimi K3 оказался выше расчётной ёмкости сервиса. Это говорит о сильном спросе на модель, но само по себе не подтверждает превосходство в качестве ответов или программирования.
Временная пауза показывает реальную цену долгих ИИ-задач
История с Kimi K3 раскрывает инфраструктурную сторону современных ИИ-сервисов. Модель может экономно активировать 16 экспертов из 896, использовать кэш и оптимизированное внимание, а массовый запуск долгих агентных задач всё равно требует огромного парка ускорителей.
Для действующих подписчиков решение Moonshot AI сохраняет приоритет доступа. Новым пользователям придётся следить за поэтапным открытием мест и будущими условиями Kimi Membership и Kimi Code Membership. Компания пока не назвала дату полного снятия ограничений и не раскрыла окончательные параметры разделённых тарифов.
До 27 июля Moonshot AI планирует открыть полные веса Kimi K3 и выпустить дополнительные технические материалы. Тогда станет понятнее, насколько быстро сторонние платформы смогут развернуть модель и снизить зависимость пользователей от мощности официального сервиса.