stamatios
← Voltar ao feed
Raio domado preso a cavalo robótico em corrida, framework Agent Lightning para RL de agentes.
Agentes · IA & Modelos

Agent Lightning: framework leve para RL de agentes

resumo de ~3 min

O conceito de harnessed agentic RL

Agentes modernos operam dentro de harnesses - estruturas que gerenciam ferramentas, contexto e fluxo de controle -, tornando o harness parte crítica do sistema. O artigo Agent Lightning v1.0 formaliza o paradigma que chama de "harnessed agentic RL": o harness de deploy participa diretamente do pós-treinamento do modelo, enquanto o motor de treinamento observa apenas sequências de pares request-response do LLM. Isso difere do RL agêntico tradicional, em que o motor de treino controla o loop de interação com o ambiente.

Desafios técnicos identificados

Essa separação introduz desafios específicos: retokenização, fusão de amostras, cálculo de vantagens, normalização de loss e agendamento de backend. Segundo os autores, esses fatores podem afetar substancialmente a estabilidade e a eficácia do treinamento. O trabalho original já havia introduzido uma arquitetura disagregada que conecta agentes arbitrários ao treinamento de RL por meio de um proxy de endpoint LLM, abordagem depois adotada por frameworks como verl Uni-Agent, AReaL 2.0, slime e Polar.

O framework Agent Lightning v1.0

A versão 1.0 é um framework leve, implementado em aproximadamente 3.500 linhas de código. Ele suporta harnesses de agentes arbitrários e serve como testbed prático para estudar os desafios do paradigma. Os autores avaliam o framework em agentes de instruction-following, busca e codificação, e fornecem um pipeline completo e reproduzível para RL de agente de codificação.

Resultados

Usando apenas 6 mil exemplos de treinamento e compute modesto, o RL melhorou o Qwen3.5-9B no SWE-bench Verified de 41,8% para 56,4%, um ganho absoluto de 14,6 pontos percentuais. Os autores disponibilizam o workflow completo e os scripts de treinamento para facilitar pesquisa reproduzível em harnessed agentic RL.