stamatios
← Voltar ao feed
Veleiro pequeno alcançando cargueiro gigante, modelos de linguagem pequenos aproximando-se dos grandes em raciocínio
IA & Modelos

Modelos de linguagem pequenos avançam rápido em raciocínio

resumo de ~3 min

Ameaças à receita das plataformas de IA

O autor parte de estimativas de que as plataformas de IA precisariam gerar cerca de US$ 2 trilhões por ano até 2030 para justificar seus planos de capex - o mercado enterprise seria o único capaz de sustentar esse volume. Ele aponta três ameaças: empresas limitando gastos de funcionários em tokens; o fechamento rápido do gap de desempenho entre modelos fechados americanos (OpenAI, Anthropic) e modelos abertos chineses muito mais baratos; e a possibilidade de rodar modelos open-weight localmente, sem depender de kill-switches de governos ou laboratórios, sem entregar dados críticos e com controle de custos.

Um teste da Bloomberg em parceria com a Vals AI, pedindo a sete modelos a criação de um site fictício de e-commerce de café (Brewberg), mostrou a maioria com 100% de precisão funcional, mas com preços muito diferentes: Claude Fable 5 a US$ 48,99 e Kimi K3 a US$ 11,99. Dados da OpenRouter indicam que modelos chineses superaram os americanos globalmente em junho e somaram mais de 60% de participação no mês seguinte; no Hugging Face, respondem por 41,4% dos downloads de modelos generativos.

O estudo de Stanford

O texto discute o artigo "Intelligence per Watt: Measuring Intelligence Efficiency of Local AI", de Jon Saad-Falcon e outros 14 autores, que avalia mais de 20 modelos locais (até 20 bilhões de parâmetros ativos) em 8 aceleradores, com 1 milhão de consultas reais. A métrica proposta é a "inteligência por watt" (IPW). Resultados principais: modelos locais respondem corretamente 88,7% das consultas; o IPW melhorou 5,3x entre 2023 e 2025, com cobertura de consultas atendíveis localmente subindo de 23,2% para 71,3%; e aceleradores locais têm pelo menos 1,4x mais margem de otimização que os de nuvem.

Joachim Klement resume o estudo: em tarefas de chat, o melhor modelo pequeno (SLM) iguala ou supera os LLMs de nuvem em 90% ou mais dos casos por domínio, com média de 98,6%. Em tarefas de raciocínio, a média é de 62,5%. Na média ponderada do uso real, SLMs são tão bons ou melhores em 81,2% dos casos, com vantagem dos LLMs apenas em engenharia, ciências da vida, transporte e ciência da computação. Os SLMs custam entre 50% e 85% menos em energia e computação. Em raciocínio, os níveis 1 a 3 de dificuldade melhoraram substancialmente, mas o nível 5 segue praticamente insolvido (3,27% a 4,72%), indicando que os problemas mais difíceis permanecem fronteira.

O paralelo com a crise do subprime

Groundbreaker argumenta que o boom da IA se assemelha ao subprime: contratos take-or-pay de compute só começam a ser pagos na entrega, 24 a 36 meses após assinatura - como o "teaser" dos financiamentos ajustáveis. Mais de US$ 2,3 trilhões em contratos de compute estão contabilizados pelas quatro maiores nuvens americanas e ainda não faturam. Em 2027 e 2028, as plataformas precisariam pagar US$ 852 bilhões em dinheiro por compute. Para o autor, seria improvável que empresas que já migram para modelos chineses mais baratos aumentem os gastos 4x no ano seguinte, e improvável também que investidores sigam bancando o prejuízo.

Desenvolvimentos recentes a favor da inferência local

Desde a coleta de dados do estudo (outubro de 2025), vários avanços reforçaram a tendência: o chip RTX Spark da Nvidia, anunciado por Jensen Huang na Computex 2026, roda localmente um modelo de 120 bilhões de parâmetros com janela de 1 milhão de tokens; a estação DGX de US$ 94 mil roda modelos trilionários localmente; a Perplexity lançou o Portable Computer, agente totalmente local em parceria com a Nvidia, sem custos de token; a Apple lançou os chips M6 (primeiro de 2nm da linha) e M5 Ultra, com desktops voltados a desenvolvimento local de IA, aproveitando o suporte a inferência distribuída via MLX e Thunderbolt 5; e a IBM lançou os Granite 4.2 (3B, 8B e 30B), open-weight e focados em raciocínio, com treino para uso de ferramentas nas variantes 8B e 30B.

Conclusão

O estudo argumenta que roteamento inteligente entre processamento local e nuvem pode reduzir de 60% a 80% o custo, energia e compute totais. O autor conclui, concordando com Klement, que os hyperscalers podem estar condenados: a maior parte da inferência tende a ocorrer localmente, restando aos data centers massivos o treino e a inferência em modelos tão caros que quase ninguém poderia pagá-los.