stamatios
← Voltar ao feed
Microsoft Orchard: framework agentic open-source para modelagem
Open Source · Agentes

Microsoft Orchard: framework agentic open-source para modelagem

resumo de ~3 min

O que é o Orchard

A Microsoft publicou o Orchard, um framework open-source (licença MIT) para pesquisa em modelagem agêntica. O projeto se organiza em duas camadas principais:

  • Orchard Env - um serviço de sandbox nativo Kubernetes com SDK Python que sobe milhares de containers isolados sob demanda e conduz interações multi-turno entre agente e sandbox (execução de comandos, I/O de arquivos, patches git) via HTTP.
  • Recipes - receitas de treinamento (SFT + RL) exploradas sobre essa base, cobrindo engenharia de software, navegação em navegador, uso de computador e fluxos de assistente pessoal.

Resultados principais

Receita Backbone Resultado de destaque
Orchard-SWE Qwen3.5-35B-A3B 73,0% no SWE-bench Verified
Orchard-GUI Qwen3-VL-4B-Thinking 68,4% média (74,1 / 67,0 / 64,0)
Orchard-Claw Qwen3-30B-A3B-Thinking 59,6% pass@3

Os autores enfatizam que os agentes Orchard se aproximam ou igualam sistemas 10–30× maiores em parâmetros. Orchard-SWE mantém 51,0 no SWE-bench Multilingual (vs. 28,7 do OpenSWE-32B) e ainda funciona sob um harness nunca visto durante o treino. Orchard-GUI supera seu próprio professor de 235B com duas ordens de magnitude menos tarefas de treino.

Extensões recentes

  • OpenWebRL (jun/2026): RL online multi-turno em websites ao vivo. OpenWebRL-4B atinge 67,0% no Online-Mind2Web e 64,0% no DeepShop usando apenas 0,4K trajetórias de inicialização e 2,2K tarefas RL - novo estado da arte open-source em benchmarks de web ao vivo, competitivo com OpenAI CUA e Gemini CUA.
  • OpenForge RL (jul/2026): treina agentes dentro dos harnesses reais de deploy (ZeroClaw, OpenClaw, Codex), eliminando o mismatch treino-deploy. OpenForge-GUI (8B) alcança 37,7 no OSWorld-Verified e 72,3 no WebVoyager.

Orchard Env em detalhe

O serviço expõe uma REST API para ciclo de vida de sandbox e inclui agentes pré-instalados (codex, claude, pi, opencode, hermes) em cada container. Métricas reportadas:

  • Latência média de execução de comando: 0,28 s (vs. E2B 0,747 s e Modal 2,046 s).
  • 1.000 sandboxes em paralelo: 100% de sucesso em 26 s.
  • Custo para 128 sandboxes × 240 h: US$ 673 em spot (~10× mais barato que serviços gerenciados).

Roadmap

A próxima fase adiciona sandboxes stateful: pause/resume, branching (forkar k continuações independentes de um snapshot) e prefix sharing. Isso permite estimar o valor de cada estado via Monte Carlo, transformando credit assignment de inferido para medido.

Datasets

Disponíveis no Hugging Face (microsoft/Orchard): 107.185 trajetórias SWE (média 47,5 turns) e 3.070 rollouts GUI multimodais com screenshots.