Prenota una demo →
← Tutti gli insights AI News

Una parola è diventata 39 volte più frequente. Cosa dimostra e cosa no.

Una parola è diventata 39 volte più frequente. Cosa dimostra e cosa no.

Louis Abraham raccoglie ogni giorno 1.000 pull request da GitHub e conta le parole. Il corpus finora: 595 giorni, 461.121 pull request, 51.079.244 parole.

Raggruppando il vocabolario in dieci cluster con k-means sulla divergenza KL ne è emerso uno che prima del 2026 non esisteva. Il mese scorso copriva il 40% di tutte le pull request attribuite a umani.

Dentro quel cluster «load-bearing» ricorre 39,47 volte più spesso che nell’intero corpus: 95 per milione di parole al picco, contro 20 sul totale.

La parola che regge tutto il risultato

Attribuite a umani.

Non è un sinonimo di scritte da umani. È una classificazione a livello di account: pull request da account che non si dichiarano bot. Chi usa un agente di coding dal proprio account rientra qui. Chi incolla l’output di un modello nella descrizione di una PR pure.

Lo studio stesso è prudente su questo. Presenta un andamento lessicale e non pretende di riconoscere testo scritto da un’IA. «Il 40% delle pull request è scritto da un’IA» non c’è nella fonte, ed è la frase che quasi tutti si porteranno via.

Un dettaglio va segnalato a chi andrà a verificare: la pagina principale usa il termine «human-attributed» senza definirlo lì. Ci abbiamo contato la parola «bot»: zero occorrenze. Come funzioni l’attribuzione sta nel repository della metodologia, a un link di distanza. Chi si ferma al grafico porta a casa un numero preciso agganciato a un termine il cui significato non è sulla pagina.

Cosa dimostra invece per davvero

Nel 2026 è comparso un vocabolario che prima non esisteva, e oggi occupa una fetta ampia del corpus. Le parole che lo compongono suoneranno familiari a chiunque legga output di modelli per mestiere: load-bearing, plainly, quietly, deliberately, genuinely, premise, outright, asserted, re-derived, byte-identical.

È uno spostamento reale, misurato e datato nel modo in cui si descrive il software, su mezzo milione di pull request. Dice che nel 2026 qualcosa è cambiato, e all’incirca quando. Non dice chi lo ha scritto.

Sono due affermazioni diverse, e solo una è sostenuta.

Perché abbiamo misurato i nostri testi

La mossa ovvia successiva è prendere l’elenco di parole e cercarle nei propri testi. L’abbiamo fatto, e il risultato mostra bene perché non funziona.

Su 21 nostri articoli in inglese, 20.651 parole:

marcatori specifici del cluster   (load-bearing, re-derived, byte-identical, …)     0 occorrenze
parole comuni del cluster         (nobody, plainly, quietly, deliberately, …)      38 occorrenze

Zero sui termini distintivi. Ma «nobody» a 920 per milione e «plainly» a 387 per milione, che suona allarmante e non significa nulla. Sono normali parole inglesi che per caso stanno nel cluster, e un conteggio piatto dell’intero elenco segnala qualsiasi prosa abbastanza sobria. Un collega che ha fatto la stessa prova ingenua ha visto delle note legali in tedesco ottenere un punteggio altrettanto alto.

Lo studio non conta le parole in modo piatto. Usa la divergenza KL contro un corpus di riferimento, ed è proprio questo a separare una parola caratteristica di un cluster da una che vi è soltanto presente. Riprodurre il titolo con una ricerca testuale riproduce il numero e perde il metodo.

Il nostro risultato onesto è quindi: nessun marcatore distintivo, un po’ di vocabolario quotidiano condiviso, e da nessuno dei due si ricava una conclusione.

Lo stesso errore, una settimana prima

È la seconda volta questo mese che un numero giusto viaggia con il sostantivo sbagliato accanto.

Il 14 agosto una dozzina di testate specializzate ha riferito che Google aveva aperto il codice di HEIR, il suo compilatore per la crittografia omomorfica. Il repository è pubblico dal 17 aprile 2023, ha 880 stelle, produce nightly ogni giorno e il 14 agosto non ha avuto alcun rilascio. Il post di Google dice: «Da quando nel 2023 abbiamo annunciato le nostre intenzioni». La novità era un’estensione e quattro casi d’uso dimostrati. Quella settimana non è stato aperto nulla.

I due casi hanno la stessa forma. La misurazione è solida, la cifra è reale, e la parola accanto è sbagliata. In un caso è «ha aperto il codice», nell’altro «umano». Un fact-checking che verifica il numero li lascia passare entrambi.

Cosa farne

Non usatelo per controllare il vostro team. Lo studio non lo consente, e lo dice l’autore stesso.

Se passate l’elenco sui vostri testi, prendete i termini distintivi, non quelli comuni. E sappiate che un’occorrenza vi dice che una parola è comparsa, non chi l’ha scritta.

Guardate il sostantivo, non il numero. Il segnale d’allarme più affidabile in una statistica non è una cifra implausibile. È una cifra credibile con accanto una parola che nessuno ha verificato.

Fonti

Newcomer AI-Visibility Tracker · known from