stamatios
← Voltar ao feed
Ramp lança SWE-Bench privado com 80 tarefas reais de backend
IA & Modelos · Dev & Engenharia

Ramp lança SWE-Bench privado com 80 tarefas reais de backend

resumo de ~3 min

O que é o Ramp SWE-Bench

A Ramp, fintech de gestão de despesas corporativas, criou um benchmark privado de avaliação de agentes de código com 80 tarefas reais extraídas do trabalho de engenharia backend da própria empresa. O objetivo é medir como modelos de linguagem lidam com engenharia de produção, sem risco de contaminação por dados de treino - um problema crescente nos benchmarks públicos, que saturam rapidamente.

Origem das tarefas

Cada uma das 80 tarefas deriva de um pull request que o agente interno da Ramp, chamado Inspect, entregou em produção após revisão de um engenheiro. As tarefas cobrem domínios como autorização de cartões, pagamento de contas, reembolsos, contabilidade, procurement, tesouraria e prevenção a fraudes. O formato é one-shot: o agente recebe um prompt sintetizado a partir da conversa real do engenheiro com o Inspect, o repositório no commit base, e acesso a bash. Não recebe a conversa original nem o patch de solução.

Pipeline de curadoria

O processo é majoritariamente automatizado, mas com aprovação humana como gargalo de qualidade. As etapas incluem: mineração de PRs mesclados, filtragem por presença de implementação e testes, validação em sandbox (o patch gold deve fazer testes falharem e depois passarem), síntese do prompt a partir da conversa do engenheiro, auditoria por LLMs de diferentes providers para detectar over-specification ou under-specification, e execução contra uma escada de modelos (do menor ao frontier). Tarefas que nenhum modelo resolve ou que todos resolvem são descartadas por não trazerem sinal discriminativo.

Execução e scoring

Todos os modelos rodam no mesmo harness (mini-swe-agent) em ambiente sandbox idêntico. Cada resultado é um único pass@1 - espelhando a expectativa real de engenheiros para agentes background: um patch correto na primeira tentativa. A execução é considerada sucesso se o diff do agente faz os testes falhados passarem sem quebrar os demais. Limite de janela de contexto conta como falha.

Privacidade e próximos passos

Como as tarefas derivam de código de produção privado, a Ramp não publica prompts, patches ou testes. O dashboard público mostra apenas métricas agregadas e comparações pairwise. A Ramp v1 é descrita como uma primeira versão de um "eval vivo", com planos de expandir o conjunto de tarefas, adicionar taxonomias de falha mais ricas, medidas de confiabilidade em execuções repetidas, scoring baseado em juízes LLM e experimentação com outros harnesses.