
Kimi K3: 2,8 trilhões de parâmetros com MoE e contexto de 1M tokens
Kimi K3: o maior modelo open-weight atual
Sebastian Raschka publicou notas sobre a arquitetura do Kimi K3, lançado em 28 de julho de 2026 pela Moonshot AI. O modelo possui 2,8 trilhões de parâmetros com Mixture of Experts (MoE) e contexto de 1 milhão de tokens, sendo o maior modelo open-weight disponível até o momento.
Base e evolução
O K3 é essencialmente uma versão de produção escalada do Kimi Linear, lançado no ano anterior (de 48B para 2,8T parâmetros). O único componente novo em relação ao Kimi Linear é o LatentMoE, que comprime grandes camadas lineares de forma análoga ao multi-head latent attention - conceito também presente no Nemotron 3 Ultra.
Tendência de eficiência
A arquitetura segue a tendência geral de modelos como Nemotron 3 e DeepSeek V4: substituir componentes existentes por versões mais eficientes para inferência. Entre as trocas: MoE → LatentMoE, atenção regular → multi-head latent attention e Kimi Delta Attention.
Attention residuals
A única mudança que não visa eficiência é o uso de attention residuals. Diferentemente do mHC (manifold-constrained Hyper-Connections) do DeepSeek V4, que alargou o caminho residual, os attention residuals conectam os resíduos entre camadas usando um score de atenção como peso de contribuição. Segundo o relatório técnico, isso melhora a validation loss e o desempenho downstream de forma consistente, com custo adicional de ~4% no treinamento e ~2% na inferência.
NoPE em todas as camadas
O Kimi K3 eliminou completamente as camadas RoPE, usando NoPE (No Positional Embeddings) em todas as posições - herdado do Kimi Linear. Embora a tendência recente em outras arquiteturas fosse RoPE em camadas de atenção local e NoPE nas globais, este é o primeiro modelo de nível frontier a adotar NoPE em toda a arquitetura.
Multimodalidade
O K3 também passou a ter suporte multimodal nativo, algo que o Kimi Linear não possuía.