Reservar demo →
← Todos los insights AI News

Una palabra se volvió 39 veces más frecuente. Qué demuestra eso y qué no.

Una palabra se volvió 39 veces más frecuente. Qué demuestra eso y qué no.

Louis Abraham lleva tiempo recogiendo 1.000 pull requests de GitHub al día y contando las palabras. El corpus hasta ahora: 595 días, 461.121 pull requests, 51.079.244 palabras.

Agrupar el vocabulario en diez grupos con k-means por divergencia KL produjo uno que no existía antes de 2026. El mes pasado cubría el 40 % de todos los pull requests atribuidos a humanos.

Dentro de ese grupo, «load-bearing» aparece 39,47 veces más que en el corpus entero: 95 por millón de palabras en su punto máximo, frente a 20 en el conjunto.

La palabra que sostiene todo el hallazgo

Atribuidos a humanos.

No es sinónimo de escritos por humanos. Es una clasificación a nivel de cuenta: pull requests de cuentas que no se identifican como bots. Quien usa un agente de programación desde su propia cuenta queda atribuido a humano. Y quien pega la salida de un modelo en la descripción de un PR, también.

El propio planteamiento del estudio es cuidadoso con esto. Presenta una tendencia de vocabulario y no afirma detectar texto escrito por IA. «El 40 % de los pull requests están escritos por IA» no está en la fuente, y es la frase que la mayoría se llevará.

Un detalle merece nombrarse para quien vaya a mirar: la página principal usa el término «atribuidos a humanos» sin definirlo allí. Contamos la palabra «bot» en esa página: cero apariciones. Cómo funciona la atribución está en el repositorio de metodología, a un enlace de distancia. Quien se detiene en el gráfico se lleva una cifra precisa pegada a un término cuyo significado se ha quedado fuera de la página.

Lo que sí demuestra, que no es poco

Un vocabulario apareció en 2026 que antes no existía y hoy domina una parte grande del corpus. Las palabras que lo componen le resultarán familiares a cualquiera que lea salidas de modelos a diario: load-bearing, plainly, quietly, deliberately, genuinely, premise, outright, asserted, re-derived, byte-identical.

Eso es un cambio real, medido y fechado en cómo se describe el software, a lo largo de medio millón de pull requests. Dice que algo cambió en 2026 y aproximadamente cuándo. No dice quién lo escribió.

Son dos afirmaciones distintas, y solo una está respaldada.

Por qué medimos nuestros propios textos

El movimiento evidente es coger la lista de palabras y buscarla en tus propios textos. Lo hicimos, y el resultado demuestra bien por qué no funciona.

En 21 de nuestros artículos en inglés, 20.651 palabras:

marcadores específicos del grupo   (load-bearing, re-derived, byte-identical, …)    0 apariciones
palabras comunes del grupo         (nobody, plainly, quietly, deliberately, …)     38 apariciones

Cero en los términos distintivos. Pero «nobody» con 920 por millón y «plainly» con 387 por millón, lo que suena alarmante y no significa nada. Son palabras corrientes en inglés que resultan estar en el grupo, y un recuento plano de la lista completa marcará cualquier prosa suficientemente llana. Un compañero que hizo esa misma comprobación ingenua encontró que un aviso legal en alemán puntuaba igual de alto.

El estudio no cuenta palabras de forma plana. Usa divergencia KL contra un corpus de referencia, que es lo que separa una palabra característica de un grupo de una palabra que simplemente está en él. Reproducir el titular con una búsqueda de texto reproduce el número y pierde el método.

Así que nuestro resultado honesto es: ningún marcador distintivo, algo de vocabulario cotidiano compartido, y ninguna conclusión disponible a partir de ninguno de los dos.

El mismo error, una semana antes

Es la segunda vez este mes que una cifra correcta viaja con el sustantivo equivocado al lado.

El 14 de agosto, una docena de medios informó de que Google había liberado como código abierto HEIR, su compilador de cifrado homomórfico. El repositorio es público desde el 17 de abril de 2023, tiene 880 estrellas, compila versiones nocturnas a diario y no tuvo ningún lanzamiento el 14 de agosto. La propia entrada de Google dice «Desde que anunciamos nuestras intenciones en 2023». Lo nuevo era una ampliación y cuatro casos de uso demostrados. Aquella semana no se liberó nada.

Los dos casos tienen la misma forma. La medición es sólida, la cifra es real, y la palabra que va al lado está mal. En uno es «libera como código abierto», en el otro es «humano». Una verificación que compruebe el número aprueba los dos.

Qué hacer con esto

No lo uses para auditar a tu equipo. El estudio no lo respalda, y el autor lo dice.

Si pasas la lista por tus propios textos, usa los términos distintivos, no los comunes. Y ten claro que un acierto te dice que una palabra apareció, no quién la escribió.

Vigila el sustantivo, no el número. La señal de alarma más fiable en una estadística no es una cifra inverosímil. Es una cifra verosímil con una palabra al lado que nadie comprobó.

Fuentes

Newcomer AI-Visibility Tracker · known from