stamatios
← Voltar ao feed
Thinking Machines lança Inkling-Small, um MoE de 276B parâmetros
IA & Modelos

Thinking Machines lança Inkling-Small, um MoE de 276B parâmetros

resumo de ~3 min

Inkling-Small: arquitetura e eficiência

A Thinking Machines Lab lançou em 30 de julho de 2026 o Inkling-Small, um modelo open-weights do tipo Mixture-of-Experts com 276B parâmetros totais e 12B ativos, treinado em sistemas NVIDIA GB300 NVL72. Ele é cerca de um quarto do tamanho do Inkling (975B totais, 41B ativos) e, segundo a empresa, alcança desempenho comparável com muito menos compute.

O modelo mantém as mesmas capacidades do irmão maior: raciocínio nativo sobre áudio e imagens, esforço de raciocínio variável (de "minimal" a "xhigh"), janela de contexto de até 1M tokens e arquitetura multimodal encoder-free (áudio representado como espectrogramas dMel, imagens em patches de 40×40 pixels processados por uma hMLP de quatro camadas).

Desempenho em benchmarks

Em raciocínio e tarefas agênticas, o Inkling-Small supera o Inkling em vários testes: 31,6% no Humanity's Last Exam (vs. 29,7% do Inkling), 80,2% no SWEBench Verified, 64,7% no Terminal Bench 2.1 e 95,5% no AIME 2026. Em eficiência de tokens, posiciona-se entre os modelos open-weights mais eficientes de sua classe, competindo com DeepSeek V4 Flash, Kimi K2.6, Qwen3.5-397B-A17B e outros.

Em multimodalidade, atinge 74,0% no MMMU Pro, 77,4%/81,3% no Charxiv RQ (sem/com Python), 54,9% no Audio MC e 90,1% no VoiceBench - próximo ao Inkling em quase todas as métricas.

Em epistêmicas e forecasting, o Inkling-Small lidera entre modelos open-weights no ForecastBench (Brier Index de 61,3 sem busca) e tem desempenho competitivo no Prophet Arena.

Onde o Inkling ainda mantém vantagem: cobertura de conhecimento e factualidade (SimpleQA Verified: 43,9% vs. 20,6% do Small; AA Omniscience: +2,1 vs. -9,0).

Treinamento e segurança

O processo de treinamento incorporou melhorias em relação ao Inkling: mudanças na mistura de dados de pré-treino, post-training de um checkpoint anterior (Inkling-Small preview) usando destilação on-policy com o Inkling como professor, e duas semanas adicionais de RL para coding agêntico. Em segurança, herda a mesma receita do Inkling, com 98,4% no StrongREJECT e desempenho competitivo no FORTRESS.

Disponibilidade

Os pesos completos estão disponíveis no Hugging Face. O modelo pode ser usado para fine-tuning na plataforma Tinker e testado no Tinker Playground com texto, imagem e áudio. O preço de output é $1,20 por 1M tokens (vs. $4,05 do Inkling).