
Moonshot libera pesos do modelo Kimi K3, um MoE de 2,8T
Lançamento dos pesos do Kimi K3
A Moonshot AI liberou os pesos e o relatório técnico do Kimi K3, seu modelo mais capaz: um Mixture of Experts (MoE) com 2,8 trilhões de parâmetros, compreensão visual nativa e janela de contexto de 1 milhão de tokens.
Arquitetura e eficiência
O K3 introduz duas mudanças arquiteturais principais:
- Kimi Delta Attention (KDA): permite decodificação até 6,3x mais rápida em contextos de milhões de tokens.
- Attention Residuals (AttnRes): substitui a acumulação uniforme das conexões residuais por atenção aprendida e dependente do input sobre camadas anteriores, entregando ~25% maior eficiência de treinamento com menos de 2% de custo adicional de inferência.
A esparsidade MoE foi ampliada: o modelo ativa 16 de 896 experts, combinado com um framework Stable LatentMoE. Juntas, essas mudanças resultam em aproximadamente 2,5x de melhoria em eficiência de escalonamento em relação ao K2 - ou seja, mais inteligência por unidade de compute, não apenas mais parâmetros.
Benchmarks internos
Além de benchmarks públicos, o Kimi K3 Max pontua 75,5 no Online Exp Bench, 73,5 no DECK-Bench e 62,6 no Finance-Bench, superando Claude Opus 4.8 (max) e GPT-5.5 (xhigh) nos três. Os resultados refletem ganhos em capacidades de trabalho de conhecimento agêntico.
Stack aberto
Junto com os pesos, a Moonshot abriu componentes da infraestrutura: kernels de atenção de alto desempenho, biblioteca de comunicação MoE e infraestrutura para rodar ambientes de agentes em escala.
Os pesos estão disponíveis no Hugging Face (moonshotai/Kimi-K3) e o relatório técnico no GitHub (MoonshotAI/Kimi-K3).