stamatios
← Voltar ao feed
Modelo compacto troca interfaces de ferramentas para se adaptar a diferentes harnesses
Agentes · IA & Modelos

TaoLive treina modelo de 35B para se adaptar ao harness

resumo de ~3 min

Problema e proposta

O relatório apresenta um agente de avatar digital voltado a transmissões de comércio eletrônico ao vivo. O sistema precisa responder perguntas sobre produtos, interagir com espectadores e executar estratégias comerciais que mudam em tempo real, mantendo baixa latência, respostas factuais e adequação a exigências atualizadas de campanha, conformidade e estilo.

A proposta é um Harness evolutivo, uma camada de execução que separa do modelo os componentes responsáveis por habilidades, ganchos (Hooks), prompts de sistema e ferramentas. Com essa separação, o comportamento do agente pode mudar durante a operação sem que seja necessário retreinar os pesos do modelo. O relatório ressalta, porém, que essa evolução cria um ambiente de execução variável: modelos compactos ajustados em uma configuração específica podem memorizar nomes, esquemas e modelos de prompt, em vez de seguir o Harness que recebem no momento. Modelos gerais mais fortes, por outro lado, seriam lentos demais para uso em tempo real.

Treinamento consciente do ambiente

Para lidar com essa tensão, a equipe propõe o Harness-Aware Training (HAT), que inclui diferentes estados do Harness na distribuição de treinamento. Seu componente central, o Harness-State Augmentation (HSA), preserva as tarefas enquanto varia habilidades, esquemas de ferramentas, estruturas de prompt e restrições de interação.

O processo tem três etapas. Primeiro, ocorre o ajuste supervisionado com dados aumentados pelo HSA. Depois, uma destilação geral orientada por política busca recuperar capacidades gerais. Por fim, o modelo passa por aprendizado por reforço agentivo baseado em HSA, dentro de um simulador de sala de transmissão informado por condições de produção.

Resultados

Nos quatro conjuntos de avaliação, que somam mais de 4.500 casos, o modelo compacto de 35 bilhões de parâmetros alcançou 94,8 no Live-Stream QA de mundo real. O modelo-base marcou 80,3, enquanto o modelo geral mais forte entre os avaliados obteve 93,0. No Harness-Variant QA, que testa variações do ambiente de execução, o modelo chegou a 94,6. Ele também reteve 83,5 no IFEval, uma avaliação de seguimento de instruções.

O relatório contrasta esses resultados com o ajuste supervisionado em um Harness fixo, que reduziu a pontuação no IFEval em 7,7 pontos. A comparação é apresentada como evidência de que treinar com diferentes estados do ambiente pode reduzir a dependência de uma configuração específica sem eliminar capacidades gerais de instrução.

Em uma reprodução controlada do agente completo, executada em uma única GPU NVIDIA H20 com MTP habilitado, o sistema registrou latência de 3,407 segundos no percentil 50 e de 8,114 segundos no percentil 95. Segundo o relatório, os resultados indicam que o HAT produz um agente compacto compatível com as exigências de latência avaliadas e eficaz diante das mudanças de Harness testadas, sem sacrificar o seguimento geral de instruções.