stamatios
← Voltar ao feed
Mistral apresenta Shieldstral, classificador de segurança multimodal
Open Source · IA & Modelos

Mistral apresenta Shieldstral, classificador de segurança multimodal

resumo de ~3 min

O que é o Shieldstral

A Mistral AI lançou o Shieldstral, um classificador de segurança multimodal de 3B parâmetros com pesos abertos sob licença Apache 2.0. O modelo iguala ou supera modelos de guarda (guardrail) até 7 vezes maiores em benchmarks de segurança textual e estabelece novo estado da arte em moderação multimodal (texto + imagem).

Abordagem: moderação como pergunta

Em vez de embutir uma taxonomia fixa de categorias de dano nos pesos, o Shieldstral trata a moderação como uma tarefa de resposta binária a perguntas. Cada requisição tem três partes:

  • Instruct - contexto da avaliação e definição opcional do que conta como conteúdo inseguro;
  • Query - uma pergunta sim/não em linguagem natural (ex.: "Este conteúdo promove violência física?");
  • Document - o conteúdo a ser julgado (prompt, resposta, par prompt-resposta ou imagem com texto).

Na inferência, o modelo lê apenas os logits de "yes" e "no" e aplica softmax para gerar um score contínuo de segurança. Isso permite adaptar políticas em tempo de inferência, sem retreinamento, e unifica classificação de prompts, moderação de respostas, detecção de recusa e detecção de toxicidade em uma única interface.

Destaques técnicos

  • Rodabilidade leve: opera em uma única GPU NVIDIA de 16 GB.
  • Score calibrado: retorna probabilidade contínua, permitindo definir thresholds ou ranquear por confiança.
  • Políticas adaptativas: como as políticas são fornecidas como texto livre na query, um mesmo checkpoint se adapta a novos contextos de implantação.

Como foi construído

A Mistral descreve quatro desafios principais resolvidos no processo:

  1. Unificação de dados heterogêneos - datasets públicos de segurança divergem em taxonomias e formatos de anotação. Todos foram convertidos para o formato instrução–query–documento, com variação de redação e calibração de rigidez por fonte.
  2. Discriminação em vez de memorização - foram criados pares contrastivos de políticas deliberadamente similares, com reescritas geradas por LLM que violam uma política mas não a outra, ensinando o modelo a distinguir qual política específica é violada.
  3. Segurança visual - como imagens inseguras não podem ser sintetizadas por LLMs como texto, a Mistral complementou datasets de moderação com imagens de propósito geral como negativos de alta qualidade, usou mutação de queries e filtragem por reranker visão-linguagem.
  4. Combinação de checkpoints complementares - fine-tuning com LoRA seguido de merge via SLERP de três checkpoints (calibrado em dados públicos, discriminativo com dados gerados e o modelo base instruct).

O desenvolvimento foi feito inteiramente na plataforma Forge, da própria Mistral, para treinamento, alinhamento e avaliação de modelos.

Próximos passos

A Mistral planeja expandir cobertura multilíngue, robustez para documentos longos e segurança multimodal mais ampla. O modelo é parte da Open Secure AI Alliance com a NVIDIA e outras organizações.