
Pesquisa mostra como remover alignment de modelos abertos
Problema: remoção trivial de alinhamento em modelos abertos
A pesquisa parte de uma constatação: a recusa (refusal) em modelos de linguagem de pesos abertos é uma propriedade superficial dos pesos. Técnicas como abliteration - que projeta para fora das matrizes de pesos a direção de ativação associada à recusa - removem o alinhamento em minutos, sem gradientes, sem dados curados e em hardware de consumo. Variantes abliteradas de praticamente todo modelo aberto popular surgem dias após o lançamento. Defesas que tentam proteger o mecanismo de recusa (distribuí-lo, reconstruí-lo, treinar adversarialmente contra ablação simulada) têm sido quebradas ou contornadas por atacantes adaptativos.
Proposta: engano defensivo em vez de prevenção
Se a remoção da recusa não pode ser impedida duravelmente, o que resta é controlar o que o ataque desbloqueia. A defesa, chamada Fool's Gold (decoy hardening), segue a tradição de segurança de honeypots e documentos falsos, mas aplicada dentro dos pesos. O modelo abliterado torna-se o honeypot: requisições perigosas no estado atacado recebem respostas confiantes, fluência e registro idênticos aos de uma resposta real, mas com elementos operacionais críticos falsificados (quantidades, temperaturas, tempos, reagentes).
Método
O defensor primeiro ablitera o próprio modelo original para extrair os payloads perigosos reais. Depois reescreve cada payload elemento por elemento, falsificando os valores operacionais mas preservando superfície (registro, especificidade, estrutura, confiança). O fine-tuning minimiza a entropia cruzada dos decoys dentro de uma simulação diferenciável do ataque de ablação, de modo que o comportamento só se expressa quando a recusa é removida. Um pin de recusa e uma leash KL mantêm o comportamento do modelo limpo idêntico ao original. Uma etapa de otimização de preferências on-policy no estado atacado reduz a fração de respostas que ainda saem verdadeiras.
Resultados
Foram testados sete modelos de cinco famílias, de 9B a 122B parâmetros, incluindo arquiteturas densas e mixture-of-experts, todos com uma única receita compartilhada. Nos seis modelos que passaram pelo gate de eficácia registrado, entre 0,51 e 0,90 das respostas no estado atacado são decoys em prompts perigosos nunca vistos no treino. O delta atribuível à defesa varia de +0,27 a +0,84 em relação ao modelo indefeso sob o mesmo ataque. As taxas se replicam em splits de teste congelados e estratos não tocados. O modelo menor (Qwen3.5-9B) não passou no gate e é reportado como caso de fronteira.
As pontuações de MMLU, GSM8K, WMDP e IFEval permanecem dentro do ruído entre o modelo original e o defendido. O comportamento de recusa no estado limpo permanece idêntico ao original. A defesa é inerte contra jailbreaks in-context por design.
Limitações e escopo
A reivindicação de segurança é epistêmica: um atacante sem fonte independente de ground truth não consegue separar respostas falsificadas de corretas. Votação por consenso entre múltiplas amostras não restaura confiança. A defesa se aplica apenas a lançamentos inéditos - uma vez que um checkpoint limpo é público, o atacante tem um oráculo. O que a defesa compra é custo, não impossibilidade: extração de pesos atacados passa a exigir exatamente a verificação que o ataque deveria tornar desnecessária.
Disponibilidade
O pipeline completo é open source sob licença MIT. Quatro classes de artefatos são deliberadamente retidas: corpora de decoys, checkpoints atacados, especificações de ataque além das receitas públicas e checkpoints defendidos. O repositório inclui um domínio demo sintético e inofensivo que reproduz todos os contratos de arquivo do pipeline real.