stamatios
← Voltar ao feed
Baseten lança API mais rápida para GLM-5.2 e antecipa Kimi K3
IA & Modelos · Startups & Deals

Baseten lança API mais rápida para GLM-5.2 e antecipa Kimi K3

resumo de ~3 min

Baseten lança API mais rápida para GLM-5.2 e antecipa Kimi K3

A Baseten anunciou que sua API para o modelo GLM-5.2 agora entrega mais que o dobro da performance em relação ao dia de lançamento, com picos de 280 tokens por segundo e média em torno de 100 tokens por segundo. Os resultados foram validados tanto por benchmarks da Artificial Analysis quanto por uso real.

Além de melhorar a API geral, a empresa criou uma segunda variante chamada GLM-5.2-Fast, focada em reduzir latência para casos de uso como coding e agentes. As duas mudanças de maior impacto foram:

  • Substituição do Attention Data Parallelism (ADP) - usado na API geral para throughput - por Tensor e Expert Parallelism com configurações selecionadas para latência.
  • Redução substancial do max batch size, diminuindo a competição por recursos entre requisições.

Ambas as APIs rodam nas mesmas GPUs NVIDIA B200. Como as otimizações da versão Fast sacrificam throughput em favor de latência, os preços de tokens de entrada e saída são 50% mais altos nessa variante.

Nos benchmarks da Artificial Analysis (medidos em 25 de julho de 2026), a Baseten alcançou o tempo de resposta end-to-end mais rápido da indústria e velocidades de output state-of-the-art. A empresa ressalta que performance de LLMs varia bastante conforme tráfego, padrões de uso e tamanhos de sequência - o benchmark usa prompts de ~10.000 tokens de entrada para gerar ~1.000 tokens de saída.

A Baseten afirma que ainda há melhorias planejadas para o algoritmo de speculative decoding e que está aprendendo com o processo de construção da API para o Kimi K3, com intenção de aplicar esses aprendizados de volta a outros modelos abertos como o GLM-5.2.