Louis Abraham lleva tiempo recogiendo 1.000 pull requests de GitHub al día y contando las palabras. El corpus hasta ahora: 595 días, 461.121 pull requests, 51.079.244 palabras.
Agrupar el vocabulario en diez grupos con k-means por divergencia KL produjo uno que no existía antes de 2026. El mes pasado cubría el 40 % de todos los pull requests atribuidos a humanos.
Dentro de ese grupo, «load-bearing» aparece 39,47 veces más que en el corpus entero: 95 por millón de palabras en su punto máximo, frente a 20 en el conjunto.
La palabra que sostiene todo el hallazgo
Atribuidos a humanos.
No es sinónimo de escritos por humanos. Es una clasificación a nivel de cuenta: pull requests de cuentas que no se identifican como bots. Quien usa un agente de programación desde su propia cuenta queda atribuido a humano. Y quien pega la salida de un modelo en la descripción de un PR, también.
El propio planteamiento del estudio es cuidadoso con esto. Presenta una tendencia de vocabulario y no afirma detectar texto escrito por IA. «El 40 % de los pull requests están escritos por IA» no está en la fuente, y es la frase que la mayoría se llevará.
Un detalle merece nombrarse para quien vaya a mirar: la página principal usa el término «atribuidos a humanos» sin definirlo allí. Contamos la palabra «bot» en esa página: cero apariciones. Cómo funciona la atribución está en el repositorio de metodología, a un enlace de distancia. Quien se detiene en el gráfico se lleva una cifra precisa pegada a un término cuyo significado se ha quedado fuera de la página.
Lo que sí demuestra, que no es poco
Un vocabulario apareció en 2026 que antes no existía y hoy domina una parte grande del corpus. Las palabras que lo componen le resultarán familiares a cualquiera que lea salidas de modelos a diario: load-bearing, plainly, quietly, deliberately, genuinely, premise, outright, asserted, re-derived, byte-identical.
Eso es un cambio real, medido y fechado en cómo se describe el software, a lo largo de medio millón de pull requests. Dice que algo cambió en 2026 y aproximadamente cuándo. No dice quién lo escribió.
Son dos afirmaciones distintas, y solo una está respaldada.
Por qué medimos nuestros propios textos
El movimiento evidente es coger la lista de palabras y buscarla en tus propios textos. Lo hicimos, y el resultado demuestra bien por qué no funciona.
En 21 de nuestros artículos en inglés, 20.651 palabras:
marcadores específicos del grupo (load-bearing, re-derived, byte-identical, …) 0 apariciones
palabras comunes del grupo (nobody, plainly, quietly, deliberately, …) 38 apariciones
Cero en los términos distintivos. Pero «nobody» con 920 por millón y «plainly» con 387 por millón, lo que suena alarmante y no significa nada. Son palabras corrientes en inglés que resultan estar en el grupo, y un recuento plano de la lista completa marcará cualquier prosa suficientemente llana. Un compañero que hizo esa misma comprobación ingenua encontró que un aviso legal en alemán puntuaba igual de alto.
El estudio no cuenta palabras de forma plana. Usa divergencia KL contra un corpus de referencia, que es lo que separa una palabra característica de un grupo de una palabra que simplemente está en él. Reproducir el titular con una búsqueda de texto reproduce el número y pierde el método.
Así que nuestro resultado honesto es: ningún marcador distintivo, algo de vocabulario cotidiano compartido, y ninguna conclusión disponible a partir de ninguno de los dos.
El mismo error, una semana antes
Es la segunda vez este mes que una cifra correcta viaja con el sustantivo equivocado al lado.
El 14 de agosto, una docena de medios informó de que Google había liberado como código abierto HEIR, su compilador de cifrado homomórfico. El repositorio es público desde el 17 de abril de 2023, tiene 880 estrellas, compila versiones nocturnas a diario y no tuvo ningún lanzamiento el 14 de agosto. La propia entrada de Google dice «Desde que anunciamos nuestras intenciones en 2023». Lo nuevo era una ampliación y cuatro casos de uso demostrados. Aquella semana no se liberó nada.
Los dos casos tienen la misma forma. La medición es sólida, la cifra es real, y la palabra que va al lado está mal. En uno es «libera como código abierto», en el otro es «humano». Una verificación que compruebe el número aprueba los dos.
Qué hacer con esto
No lo uses para auditar a tu equipo. El estudio no lo respalda, y el autor lo dice.
Si pasas la lista por tus propios textos, usa los términos distintivos, no los comunes. Y ten claro que un acierto te dice que una palabra apareció, no quién la escribió.
Vigila el sustantivo, no el número. La señal de alarma más fiable en una estadística no es una cifra inverosímil. Es una cifra verosímil con una palabra al lado que nadie comprobó.
Fuentes
- Louis Abraham, «The load-bearing vocabulary of Claude»: https://louisabraham.github.io/load-bearing/ (consultado el 28 de agosto de 2026). Origen del tamaño del corpus de 595 días, 461.121 pull requests y 51.079.244 palabras, de los diez grupos por k-means con divergencia KL, del grupo aparecido en 2026 que cubre el 40 % de los pull requests atribuidos a humanos, de la cifra de 39,47× para «load-bearing» con 95 por millón en el máximo frente a 20 en el corpus, y de la lista de palabras representativas del grupo. La página se renderiza en el cliente y devuelve casi nada de texto a una petición HTTP simple; se leyó de la página completamente renderizada, usando «load-bearing» y «cluster» como términos de control. El término «atribuidos a humanos» se usa en esa página sin definirse allí; la palabra «bot» no aparece en ella. Metodología y código: https://github.com/louisabraham/load-bearing
- Google, «How Google is making private AI practical with homomorphic encryption», 14 de agosto de 2026: https://blog.google/security/how-google-is-making-private-ai-practical-with-homomorphic-encryption/ y el repositorio HEIR https://github.com/google/heir (metadatos del repositorio comprobados vía la API de GitHub el 28 de agosto de 2026: creado el 17 de abril de 2023, 880 estrellas, compilaciones nocturnas, ningún lanzamiento con fecha del 14 de agosto de 2026).
- La medición de nuestros propios artículos en inglés se hizo el 28 de agosto de 2026 sobre 21 archivos y 20.651 palabras, contando coincidencias de palabra completa para los términos enumerados.
- Las fuentes existen únicamente en inglés: las citas de este artículo son traducción propia del original, no citas literales en español.
