
Ornith-1.5 lança família de modelos abertos com autoaperfeiçoamento
Lançamento e arquitetura
A DeepReinforce lançou a família Ornith-1.5 em três escalas: um modelo principal de 397B parâmetros com arquitetura mixture-of-experts, um modelo MoE de 35B que ativa 3B parâmetros por token e um modelo denso de 9B com versão quantizada para iPhone e Android. Todos são modelos abertos, com pesos disponíveis no Hugging Face sob licença MIT.
Loop de autoaperfeiçoamento
A principal novidade em relação à geração anterior (Ornith-1.0, lançada em junho de 2026) é a extensão do framework de auto-scaffolding para um ciclo fechado de autoaperfeiçoamento. Na versão anterior, o modelo escrevia o scaffold em torno de tarefas fixas curadas por humanos. Agora, o próprio sistema propõe tarefas progressivamente mais difíceis, gera ou refina o scaffold específico para cada uma (instruções, ferramentas, estratégia de decomposição e orquestração) e produz os rollouts de solução usados no aprendizado por reforço.
Cada ciclo de treino opera em três estágios. A recompensa retropropaga por todas as etapas, permitindo que o sistema aprenda simultaneamente a escrever melhores soluções, tarefas de treino mais úteis e ambientes de avaliação mais confiáveis. A recompensa de tarefa multiplica três sinais: validade e verificabilidade do ambiente, dificuldade próxima à fronteira de capacidade atual e novidade em relação ao trabalho já gerado. A dificuldade-alvo é uma taxa de sucesso empírica de 0,2 - quando o modelo começa a resolver a tarefa com consistência, ela perde valor para o gerador. Tarefas malformadas recebem nota zero. As três etapas são otimizadas com GRPO.
Resultados publicados
Segundo tabelas da empresa, com média de cinco execuções independentes, o Ornith-1.5-397B obtém 85,1 no Terminal-Bench 2.1 e 56,0 no DeepSWE, desempenho que a Ornith reporta como comparável ao Claude Opus 4.8 (85,0 e 59,0) e superior ao GLM-5.2 e ao DeepSeek-V4-Flash-0731 em escala comparável. O modelo de 35B alcança 68,5 no Terminal-Bench 2.1 e 79,0 no SWE-Bench Verified ativando apenas 3B parâmetros por token. O modelo de 9B atinge 47,0 e 70,6 nos mesmos benchmarks, desempenho que a empresa posiciona acima de Gemma 4-31B e Qwen 3.6-35B. Além de código, a cobertura se estende a raciocínio e trabalho agêntico, com 92,8 no GPQA Diamond e 86,6 no BrowseComp na escala principal.
Contexto e ressalvas
A Ornith-1.0 foi pós-treinada sobre checkpoints Gemma 4 e Qwen 3.5 e introduziu a ideia de tratar o scaffold como objeto aprendível que coevolui com a política. A DeepReinforce publicou anteriormente pesquisas sobre otimização de aprendizado por reforço, incluindo CUDA-L1 e o loop de agente IterX. A empresa reconhece que reward hacking é uma preocupação recorrente nesse tipo de trabalho, e o Ornith-1.5 incorpora defesas na geração de tarefas, onde tarefas não verificáveis não recebem recompensa. Os números são auto-reportados pela empresa.