Louis Abraham collecte chaque jour 1 000 pull requests sur GitHub et compte les mots. Le corpus à ce jour : 595 jours, 461 121 pull requests, 51 079 244 mots.
Le regroupement du vocabulaire en dix clusters par k-means sur la divergence KL en a fait apparaître un qui n’existait pas avant 2026. Le mois dernier, il couvrait 40 % de toutes les pull requests attribuées à des humains.
À l’intérieur de ce cluster, « load-bearing » revient 39,47 fois plus souvent que dans l’ensemble du corpus : 95 par million de mots au sommet, contre 20 sur la totalité.
Le mot qui porte tout le constat
Attribuées à des humains.
Ce n’est pas un synonyme d’écrites par des humains. C’est un classement au niveau du compte : les pull requests venant de comptes qui ne se déclarent pas comme des bots. Qui utilise un agent de codage depuis son propre compte entre dans cette catégorie. Qui colle la sortie d’un modèle dans la description d’une PR aussi.
L’étude elle-même est prudente là-dessus. Elle présente une tendance lexicale et ne prétend pas détecter du texte écrit par une IA. « 40 % des pull requests sont écrites par une IA » ne figure pas dans la source, et c’est la phrase que la plupart des lecteurs retiendront.
Un détail mérite d’être signalé à qui ira vérifier : la page principale emploie le terme « human-attributed » sans le définir à cet endroit. Nous y avons compté le mot « bot » : zéro occurrence. Le fonctionnement de l’attribution se trouve dans le dépôt de méthodologie, à un lien de distance. Qui s’arrête au graphique repart avec un chiffre précis accroché à un terme dont le sens ne figure pas sur la page.
Ce que cela montre bel et bien
Un vocabulaire est apparu en 2026 alors qu’il n’existait pas avant, et il occupe aujourd’hui une large part du corpus. Les mots qui le composent parleront à quiconque lit des sorties de modèles pour gagner sa vie : load-bearing, plainly, quietly, deliberately, genuinely, premise, outright, asserted, re-derived, byte-identical.
C’est un glissement réel, mesuré et daté dans la façon dont on décrit les logiciels, sur un demi-million de pull requests. Il dit que quelque chose a changé en 2026, et à peu près quand. Il ne dit pas qui a tapé le texte.
Ce sont deux affirmations différentes, et une seule est étayée.
Pourquoi nous avons mesuré nos propres textes
Le réflexe suivant est de prendre la liste de mots et de fouiller ses propres textes. Nous l’avons fait, et le résultat montre bien pourquoi cela ne marche pas.
Sur 21 de nos articles en anglais, 20 651 mots :
marqueurs spécifiques du cluster (load-bearing, re-derived, byte-identical, …) 0 occurrence
mots courants du cluster (nobody, plainly, quietly, deliberately, …) 38 occurrences
Zéro sur les termes distinctifs. Mais « nobody » à 920 par million et « plainly » à 387 par million, ce qui a l’air alarmant et ne veut rien dire. Ce sont des mots anglais ordinaires qui se trouvent dans le cluster, et un décompte à plat de la liste entière signalera n’importe quelle prose suffisamment sobre. Un collègue qui a fait le même test naïf a vu des mentions légales en allemand obtenir un score tout aussi élevé.
L’étude ne compte pas les mots à plat. Elle utilise la divergence KL contre un corpus de référence, et c’est précisément ce qui sépare un mot caractéristique d’un cluster d’un mot qui y est seulement présent. Reproduire le titre avec une recherche textuelle reproduit le chiffre et perd la méthode.
Notre résultat honnête est donc : aucun marqueur distinctif, un peu de vocabulaire courant partagé, et aucune conclusion à tirer de l’un ni de l’autre.
La même erreur, une semaine plus tôt
C’est la deuxième fois ce mois-ci qu’un chiffre juste voyage avec le mauvais substantif à côté.
Le 14 août, une douzaine de médias spécialisés ont annoncé que Google avait ouvert le code de HEIR, son compilateur de chiffrement homomorphe. Le dépôt est public depuis le 17 avril 2023, compte 880 étoiles, produit des nightlies chaque jour et n’a connu aucune publication le 14 août. Le billet de Google dit lui-même : « Depuis que nous avons annoncé nos intentions en 2023 ». La nouveauté était une extension et quatre cas d’usage démontrés. Rien n’a été ouvert cette semaine-là.
Les deux cas ont la même forme. La mesure est solide, le chiffre est réel, et le mot posé à côté est faux. Dans l’un c’est « a ouvert le code », dans l’autre « humain ». Une vérification des faits qui contrôle le chiffre laisse passer les deux.
Quoi en faire
Ne vous en servez pas pour contrôler votre équipe. L’étude ne le permet pas, et son auteur le dit.
Si vous passez la liste sur vos propres textes, prenez les termes distinctifs, pas les courants. Et sachez qu’une occurrence vous dit qu’un mot est apparu, pas qui l’a écrit.
Regardez le substantif, pas le chiffre. Le signal d’alerte le plus fiable dans une statistique n’est pas un chiffre invraisemblable. C’est un chiffre crédible avec, à côté, un mot que personne n’a vérifié.
Sources
- Louis Abraham, “The load-bearing vocabulary of Claude” : https://louisabraham.github.io/load-bearing/ (consulté le 28 août 2026). Origine de la taille du corpus (595 jours, 461 121 pull requests, 51 079 244 mots), des dix clusters obtenus par k-means sur la divergence KL, du cluster apparu en 2026 couvrant 40 % des pull requests attribuées à des humains, du facteur 39,47 pour « load-bearing » avec 95 par million au sommet contre 20 sur le corpus, ainsi que de la liste des mots représentatifs. La page est rendue côté client et ne renvoie presque aucun texte à une requête HTTP simple ; elle a été lue dans sa version entièrement rendue, avec « load-bearing » et « cluster » comme termes de contrôle. Le terme « human-attributed » est employé sur cette page sans y être défini ; le mot « bot » n’y figure pas. Méthodologie et code : https://github.com/louisabraham/load-bearing
- Google, “How Google is making private AI practical with homomorphic encryption”, 14 août 2026 : https://blog.google/security/how-google-is-making-private-ai-practical-with-homomorphic-encryption/ et le dépôt HEIR https://github.com/google/heir (métadonnées du dépôt vérifiées le 28 août 2026 via l’API GitHub : créé le 17 avril 2023, 880 étoiles, builds nightly, aucune publication datée du 14 août 2026).
- La mesure de nos propres articles en anglais a été effectuée le 28 août 2026 sur 21 fichiers et 20 651 mots, en comptant les occurrences en mot entier des termes cités.
- Les sources n’existent qu’en anglais : les citations de cet article sont une traduction propre de l’original, non des citations littérales en français.
