
BetterWright: navegador persistente para agentes de IA
Proposta
BetterWright é um navegador persistente baseado em Playwright, projetado especificamente para agentes de IA. O projeto se apresenta como uma alternativa ao uso direto do Playwright - que foi construído para testes com scripts confiáveis - em cenários onde um modelo não confiável decide o próximo passo a partir do que observa, e o navegador precisa sobreviver entre turnos.
Eficiência de tokens
O argumento central é que o passo de observação em loops de agentes (observar → decidir → agir) é onde janelas de contexto se esgotam. Dumps de HTML bruto, árvores de acessibilidade completas e loops baseados apenas em screenshots consomem milhares de tokens por turno. BetterWright ataca esse problema com snapshots comprimidos que removem elementos não acionáveis, modo diff que retorna apenas o que mudou após uma ação, filtro interativo que descarta nós de texto estático e conclusão em uma única chamada para tarefas somente de leitura. Sessões persistentes evitam re-login e re-navegação a cada passo.
Modos de uso
O projeto oferece dois modos. No modo integrado, qualquer agente externo (Claude Code, Codex, qualquer cliente MCP ou código próprio) controla o navegador passo a passo via skill, servidor MCP ou API JavaScript. No modo standalone, o comando betterwright exec entrega a tarefa inteira a um loop de agente embutido, que devolve um único objeto JSON com resposta, passos, uso de tokens e caminho da screenshot de prova. Os dois modos compartilham sessões, cofre de credenciais, política de rede e snapshots.
Segurança e credenciais
O código escrito pelo modelo roda em sandbox sem acesso a APIs de arquivo, processo ou roteamento de rede. Toda requisição é verificada contra política de rede, com bloqueio permanente de endpoints de metadados em nuvem. As credenciais ficam em cofre AES-256-GCM fora do perfil do navegador; formulários são detectados e preenchidos sem que o segredo entre na conversa. A recuperação de senhas pelo usuário humano é feita por comandos separados que o worker do navegador não alcança.
Recursos adicionais
O projeto inclui resolução local de CAPTCHAs (checkbox, Turnstile, slider; grids de imagem são encaminhados à visão do agente), live view auto-hospedada com chat e fluxo de handoff para intervenção humana, input com formato humano (movimento curvado do ponteiro, digitação com ritmo), e BetterChromium - um fork do Chromium com farbling estável por perfil de canvas e áudio. Suporta múltiplos provedores de navegador em nuvem e modelos locais via Ollama ou vLLM.
Benchmarks e ressalvas
O projeto reporta 92,7% no Online-Mind2Web (278 de 300 tarefas no snapshot de 2025-11-23), mas esclarece que a pontuação foi calculada pelo próprio juiz multimodal do BetterWright, não por avaliação humana oficial. Trata-se também de campanha iterativa com melhores resultados validados, não de uma execução única de 300 tarefas.
Escopo e licença
BetterWright declara não ser construído para criação em massa de contas, credential stuffing ou scraping em escala atrás de paredes anti-bot. O projeto é distribuído sob licença MIT, com 179 estrelas e 291 commits no GitHub.