
logit_bias não faz IA soar mais humana
O experimento
Vincent Schmalbach testou se o parâmetro logit_bias - que ajusta numericamente a probabilidade de tokens específicos na API - poderia fazer textos gerados por IA soarem mais humanos ao banir palavras associadas à prosa de IA. A diferença em relação a uma blacklist no prompt é que o logit_bias não é uma instrução que o modelo pode ignorar: ele altera diretamente os scores numéricos usados na seleção de cada token.
Metodologia
O autor partiu de oito artigos gerados por IA e os enviou ao DeepSeek V4 Flash via OpenRouter, pedindo que reescrevesse a prosa preservando todos os fatos, nomes, números e qualificações. Cada artigo passou duas vezes pelo modelo: uma chamada de controle (sem bias) e uma experimental (com bias de -8 nos token IDs da blacklist). Um teste separado com GPT-5.6 Sol (que não aceita logit_bias) usou uma lista de 93 palavras no prompt.
Resultados
- Os artigos-fonte continham 264 ocorrências de palavras da lista. As reescritas com blacklist removeram 84 (cerca de um terço).
- A sobreposição de 5-gramas caiu de 0,982 (controle) para 0,896 (blacklist), indicando que o modelo alterou mais texto.
- Sete das oito reescritas com blacklist preservaram os fatos; a oitava mudou uma entidade e removeu uma qualificação, transformando observação qualificada em afirmação direta.
- Em qualidade de prosa: três ficaram melhores que o original, quatro iguais, uma pior (com substituições agramaticais).
- Critério final (sem mudança de sentido e sem piora na prosa): 7 de 8 controles passaram; 6 de 8 com blacklist passaram.
Limitações do logit_bias
O parâmetro não reduz conhecimento nem altera pesos do modelo - apenas dificulta a seleção de certos tokens. Como não fornece informação sobre qual substituição é gramatical ou se uma qualificação é necessária, o resultado pode parecer menos inteligente. Aumentar a penalidade não resolveu: de -4 a -12 não houve remoção consistente adicional, e em -100 o modelo entrou em loop de repetição.
Compatibilidade de APIs
- OpenAI: o campo existe no schema, mas todos os modelos atuais testados (GPT-5.2 a GPT-5.6) retornaram erro
unsupported_parameter. A Responses API também não expõe o campo. - Anthropic: não possui parâmetro nativo de
logit_bias. - OpenRouter: em 29/07/2026, 115 model IDs anunciavam suporte, incluindo DeepSeek V4 Flash, GLM 5.2, Kimi K3, Gemma 4 31B, Qwen 3.6 27B, Llama 3.3 70B e GPT-4o. Porém, mesmo nessa lista, alguns endpoints rejeitavam ou ignoravam o parâmetro.
Conclusão do autor
Prompt blacklist e logit_bias falham de formas diferentes. O prompt é flexível mas pode ser ignorado ou seguido literalmente demais. O logit_bias aplica pressão direta na seleção de tokens, mas não reconhece quando a palavra banida é a correta. Nenhum dos dois métodos resolve o problema sem tradeoffs.