
Thinking Machines detalha Inkling, modelo aberto feito para customização
Arquitetura de esparsidade e custo por token
A Thinking Machines, fundada por Mira Murati (ex-CTO da OpenAI), lançou em 15 de julho de 2026 o Inkling, seu primeiro modelo treinado do zero. Os pesos estão no Hugging Face sob licença Apache 2.0. O modelo usa Mixture of Experts com 66 camadas, cada uma contendo 256 especialistas, dos quais apenas seis são ativados por token, mais dois especialistas compartilhados que rodam sempre. O total é de 975 bilhões de parâmetros armazenados, mas apenas cerca de 41 bilhões são usados por token - aproximadamente 4% do modelo em execução simultânea.
O checkpoint em precisão total exige pelo menos 2 TB de memória de GPU combinada (oito NVIDIA B300 ou dezesseis H200). A versão quantizada ocupa cerca de 600 GB e cabe em quatro B300.
Balanceamento de roteamento
O roteador usa sigmoid para pontuar cada especialista. Para evitar o colapso de roteamento - quando poucos especialistas concentram todo o tráfego - a Thinking Machines adota um método de Wang e colegas, também usado pelo DeepSeek: um viés por especialista que afeta apenas a seleção, nunca o peso na combinação de saídas. O viés é atualizado por uma regra de contagem fora da backpropagation, eliminando conflito de gradientes com o objetivo principal de previsão.
Atenção mista e janela de um milhão de tokens
O contexto de um milhão de tokens é viabilizado pela alternância entre camadas de janela deslizante e atenção completa na proporção 5:1. São 55 camadas locais e 11 de atenção plena, pelas quais informações de longo alcance trafegam. O modelo usa 8 cabeças de chave-valor compartilhadas.
Codificação de posição relativa
Em vez de RoPE, padrão atual, o Inkling usa um esquema relativo no estilo de Shaw e colegas. Valores aprendidos são atribuídos à distância entre tokens, não à posição absoluta. Assim, pares a 900 mil tokens de distância usam um valor já visto durante o treino, sem necessidade de extrapolação. A empresa afirma que esse método teve desempenho superior ao RoPE em seus testes. A escolha exige adaptação dos frameworks de inferência, pois o ecossistema foi construído em torno de RoPE.
Multimodalidade sem encoder pré-treinado
Áudio entra como mel spectrogram discretizado pelo método dMel (arredondamento de valores de intensidade). Imagens são divididas em patches de 40×40 pixels processados por uma rede hMLP de quatro estágios. Ambos passam por uma camada leve de conversão e se juntam aos tokens de texto na mesma sequência. Todos os componentes multimodais foram treinados do zero junto com o modelo.
Esforço de raciocínio treinável
O Inkling possui um parâmetro de esforço entre 0 e 1, ajustado durante reinforcement learning. A empresa variou o nível de esforço e o custo por token gerado entre tentativas, fazendo o modelo aprender a associar cada nível a uma extensão de raciocínio. No benchmark Terminal Bench 2.1, o Inkling atinge pontuação equivalente ao Nemotron 3 Ultra da NVIDIA com aproximadamente um terço dos tokens.
Trade-offs declarados
A própria Thinking Machines reconhece que outros modelos abertos e fechados são mais fortes no geral. O posicionamento do Inkling é ser adaptável: pesos abertos, quantização acessível e fine-tuning desde o primeiro dia. Dados de treino, receita exata e código de treinamento permanecem privados. O modelo recomenda uso de moderação externa em vez de depender de suas próprias recusas.