
Mistral apresenta Shieldstral, classificador de segurança multimodal
O que é o Shieldstral
A Mistral AI lançou o Shieldstral, um classificador de segurança multimodal de 3B parâmetros com pesos abertos sob licença Apache 2.0. O modelo iguala ou supera modelos de guarda (guardrail) até 7 vezes maiores em benchmarks de segurança textual e estabelece novo estado da arte em moderação multimodal (texto + imagem).
Abordagem: moderação como pergunta
Em vez de embutir uma taxonomia fixa de categorias de dano nos pesos, o Shieldstral trata a moderação como uma tarefa de resposta binária a perguntas. Cada requisição tem três partes:
- Instruct - contexto da avaliação e definição opcional do que conta como conteúdo inseguro;
- Query - uma pergunta sim/não em linguagem natural (ex.: "Este conteúdo promove violência física?");
- Document - o conteúdo a ser julgado (prompt, resposta, par prompt-resposta ou imagem com texto).
Na inferência, o modelo lê apenas os logits de "yes" e "no" e aplica softmax para gerar um score contínuo de segurança. Isso permite adaptar políticas em tempo de inferência, sem retreinamento, e unifica classificação de prompts, moderação de respostas, detecção de recusa e detecção de toxicidade em uma única interface.
Destaques técnicos
- Rodabilidade leve: opera em uma única GPU NVIDIA de 16 GB.
- Score calibrado: retorna probabilidade contínua, permitindo definir thresholds ou ranquear por confiança.
- Políticas adaptativas: como as políticas são fornecidas como texto livre na query, um mesmo checkpoint se adapta a novos contextos de implantação.
Como foi construído
A Mistral descreve quatro desafios principais resolvidos no processo:
- Unificação de dados heterogêneos - datasets públicos de segurança divergem em taxonomias e formatos de anotação. Todos foram convertidos para o formato instrução–query–documento, com variação de redação e calibração de rigidez por fonte.
- Discriminação em vez de memorização - foram criados pares contrastivos de políticas deliberadamente similares, com reescritas geradas por LLM que violam uma política mas não a outra, ensinando o modelo a distinguir qual política específica é violada.
- Segurança visual - como imagens inseguras não podem ser sintetizadas por LLMs como texto, a Mistral complementou datasets de moderação com imagens de propósito geral como negativos de alta qualidade, usou mutação de queries e filtragem por reranker visão-linguagem.
- Combinação de checkpoints complementares - fine-tuning com LoRA seguido de merge via SLERP de três checkpoints (calibrado em dados públicos, discriminativo com dados gerados e o modelo base instruct).
O desenvolvimento foi feito inteiramente na plataforma Forge, da própria Mistral, para treinamento, alinhamento e avaliação de modelos.
Próximos passos
A Mistral planeja expandir cobertura multilíngue, robustez para documentos longos e segurança multimodal mais ampla. O modelo é parte da Open Secure AI Alliance com a NVIDIA e outras organizações.