
Nvidia lança Nemotron 3.5 Lightning e roteador Switchyard
A Nvidia anunciou dois lançamentos combinados para reduzir custos de agentes de IA sempre ativos: o Nemotron 3.5 Lightning, modelo aberto de 30 bilhões de parâmetros com arquitetura mixture-of-experts, e o NeMo Switchyard, biblioteca open-source que roteia cada etapa de um fluxo de agente para o modelo mais adequado.
Proposta principal
O problema atacado é o dilema entre usar um modelo de fronteira para todas as tarefas, encarecendo a operação, ou construir lógica própria de roteamento para enviar tarefas simples a modelos mais baratos, o que vira um projeto de engenharia contínuo. A aposta da Nvidia é resolver as duas pontas ao mesmo tempo: um modelo eficiente para alto volume e um roteador aberto que decide, passo a passo, qual modelo usar.
Segundo a empresa, o Lightning entrega saída até 4x mais rápida que modelos comparáveis na mesma classe e completa tarefas agênticas cerca de 30% mais rápido que o Qwen3.6-35B, com precisão equivalente. Combinado ao Switchyard, a Nvidia afirma que o conjunto mantém conclusão de tarefa em nível de fronteira, reduzindo custos de benchmark a aproximadamente um terço do custo de rodar o Opus 4.8 sozinho.
Como o roteador funciona
O Switchyard parte da premissa de que o modelo ideal muda conforme o agente avança: ferramentas retornam resultados, erros aparecem ou uma etapa se revela simples. Em vez de uma escolha fixa de modelo, o roteador usa estratégias como roteamento por estado do agente ou por classificador. O custo entra diretamente na decisão: o sistema pode avaliar a verbosidade provável de cada modelo - quantos tokens ele tende a gerar - e direcionar o trabalho para a opção mais barata antes mesmo da chamada.
A Nvidia posiciona o Switchyard como integração, não substituição. Agent frameworks como Cognition, LangChain e Nous Research chamam o Switchyard diretamente; gateways como Kong, LiteLLM e OpenRouter já embutiram suporte à biblioteca. Os principais rivais são Not Diamond, que alimenta o modo Auto do OpenRouter, e RouteLLM, da UC Berkeley e LMSYS - nenhum dos dois fornece modelo próprio. A aposta é que controlar modelo e roteamento sob a mesma licença aberta seja o diferencial.
Resultados de testes
Resultados compartilhados pela Nvidia com nove empresas incluem: LangChain reduziu custos em 74% em 145 tarefas multi-turno, roteando apenas 7% das chamadas para um modelo de fronteira, com tradeoff de 6% em precisão. A Ramp igualou performance de fronteira no Ramp SWE-Bench cortando custos em 58% e tempo de execução em 33%. A Cognition integrou o roteador ao Devin Desktop e obteve performance quase de fronteira no FrontierCode Main com redução de custo médio de 28%.
Arquitetura e benchmarks do Lightning
O Lightning estende a arquitetura híbrida Mamba-Transformer com latent mixture-of-experts introduzida pela Nvidia na família Nemotron 3 em dezembro de 2025. No Artificial Analysis Intelligence Index, que cobre nove avaliações gerais, o modelo pontuou 24 - atrás de Nemotron 3 Super, Gemma 4 31B, Claude 4.5 Haiku e Mistral Medium 3.5, todos com 30. A Nvidia não reivindica liderança em inteligência geral; a alegação é mais estreita: no PinchBench, benchmark de tarefas agênticas reais (código, pesquisa e gestão de arquivos), o Lightning empata em precisão com o Qwen3.6-35B cerca de 30% mais rápido.
Em pós-treinamento, a Nvidia citou casos de CrowdStrike, CodeRabbit, Harvey, Trajectory e Lila Sciences. O caso mais específico é o da CodeRabbit: a receita padrão NeMo Auto, treinada por uma época, gerou um agente de roteamento funcional por US$ 85 em cerca de duas horas.
Implicações para empresas
O lançamento chega em um momento de forte competição em modelos abertos, com Alibaba, Moonshot, Zhipu, DeepSeek e Meta liberando modelos competitivos recentemente. Para empresas, três tendências se destacam: o roteamento deixa de ser estático e passa a ser dinâmico, decidido por sinais em tempo real como estado do agente e custo de tokens; o open source vira alavanca de custo em duas camadas - modelo e roteador; e a disputa se desloca do melhor modelo para o melhor sistema, onde o diferencial é quão bem a camada de roteamento casa modelos com tarefas em produção.