
Vocabulário típico do Claude aparece em 45% dos PRs 'humanos'
O que foi analisado
O projeto acompanha diariamente 1.000 pull requests do GitHub para identificar tendências de vocabulário. Até o momento apresentado, foram analisados 595 dias, 461.121 pull requests e 51.079.244 palavras. As publicações desde 2025 foram agrupadas em dez clusters de vocabulário por meio de k-means baseado em divergência KL.
O cluster associado a Claude
Um dos clusters teria surgido em 2026 e representado 40% de todos os pull requests atribuídos a humanos no mês anterior à publicação. O texto não afirma que esses pull requests foram necessariamente escritos sem ajuda de IA; ele os descreve como “human-attributed”.
As palavras mais representativas do cluster incluem “load-bearing”, “re-derived”, “byte-identical”, “mutation-tested”, “empirically”, “re-verified”, “invariant”, “root-caused”, “back-compat”, “fail-safe” e “best-effort”, entre muitas outras. Segundo a página, esse vocabulário deve parecer familiar a quem usa agentes de programação, e os exemplos vinculados remetem a discussões sobre Claude Code.
A expressão “load-bearing” aparece 39,47 vezes mais nesse cluster do que em outros contextos. A visualização permite observar a evolução semanal do agrupamento e alternar entre os dez clusters, embora o texto fornecido não apresente uma análise causal sobre a origem desse vocabulário nem uma validação independente de que ele tenha sido produzido por Claude.
Interpretação e limites
O resultado é apresentado como uma análise estatística de padrões lexicais em pull requests, não como prova de autoria automatizada. A associação com Claude decorre da semelhança percebida entre as palavras predominantes e a linguagem usada por pessoas que utilizam agentes de programação. A fonte também não informa quais repositórios foram incluídos, como os pull requests foram classificados como atribuídos a humanos ou quais critérios determinaram a escolha e a interpretação dos clusters.
A página disponibiliza o código e uma descrição da metodologia, além de uma visualização interativa com dados por semana. Sua conclusão implícita é que um vocabulário característico de agentes de programação se tornou muito frequente em pull requests classificados como humanos, mas os dados apresentados não estabelecem, por si só, que esses textos tenham sido gerados por Claude nem que a ferramenta seja responsável por toda a mudança observada.