L’AI ha inventato 146.932 citazioni nel 2025: lo studio

L'AI ha inventato 146.932 citazioni nel 2025 | Massimiliano Pioli

Tabella dei Contenuti

Canale WhatsApp Facile.AI
4 mini-lezioni a settimana, gratis
Ti guido passo dopo passo se l’AI ti sembra ancora difficile.
Unisciti al canale →

Nel 2025, secondo una stima conservativa, 146.932 citazioni scientifiche inventate dall’AI sono finite in paper accademici reali. Il numero arriva da uno studio pubblicato l’8 maggio 2026 su arXiv, firmato tra gli altri da Paul Ginsparg, fondatore di arXiv stesso. Il team ha analizzato 111 milioni di riferimenti bibliografici su 2,5 milioni di paper estratti da arXiv, bioRxiv, SSRN e PubMed Central. Ogni citazione è stata controllata contro database verificabili: se non puntava a nessun documento reale, finiva nel conteggio.

Per chi usa ChatGPT, Claude, Gemini o Perplexity ogni giorno il dato è importante ma il messaggio fondamentale è un altro: le hallucination non sono errori rari da power user, sono un fenomeno sistemico, documentato con numeri pubblici, in crescita dopo l’adozione di massa degli LLM. Lo stesso pattern che inquina i paper accademici lo trovi nelle tue email, nei report ai clienti, nei post LinkedIn scritti con l’AI. Vediamo cosa dice esattamente lo studio, come riconoscere una citazione inventata in trenta secondi, e come difendere il tuo lavoro professionale.

Come hanno fatto a contare le citazioni inventate?

Il metodo è elegante. I sei autori (Zhenyue Zhao, Yihe Wang, Toby Stuart, Mathijs De Vaan, Paul Ginsparg, Yian Yin) hanno sfruttato il fatto che una citazione scientifica è verificabile in modo binario: o il paper esiste in un database accademico, o non esiste. Niente sfumature interpretative.

Hanno aggregato 111 milioni di riferimenti bibliografici da quattro grandi repository:

  • arXiv (fisica, matematica, computer science)
  • bioRxiv (biologia, scienze della vita)
  • SSRN (scienze sociali, economia, management)
  • PubMed Central (medicina, biomedicina)

Per ogni riferimento hanno verificato l’esistenza del paper citato controllando contro tutti i principali database accademici. Le citazioni che non trovavano riscontro venivano classificate come “non-existent”. Lo studio ha poi misurato come il fenomeno è cambiato nel tempo, mostrando un netto aumento dopo l’adozione di massa degli LLM rispetto ai livelli precedenti.

Il numero 146.932 è esplicitamente dichiarato come “stima conservativa”. Più importante: secondo gli autori, “preprint moderation and journal publication processes capture only a fraction of these errors, suggesting that the spread of hallucinated content has outpaced existing safeguards”. In altre parole, i processi editoriali attuali non stanno tenendo il passo. Il vero conteggio è probabilmente più alto perché molti errori sfuggono ai sistemi di controllo esistenti.

Quante sono davvero e quanto è grave?

Il dato 146.932 è il picco del solo anno 2025. La curva delle citazioni inesistenti era molto bassa nei livelli pre-LLM (dominata da rari errori tipografici) e mostra un netto aumento dopo l’adozione di massa di ChatGPT e degli altri LLM, secondo lo studio. Il fenomeno è quindi correlato all’arrivo degli strumenti generativi, non a un trend pre-esistente.

La timeline che cambia tutto

Per dimensionare il salto, vale la pena fissare la sequenza temporale.

AnnoEventoStato citazioni hallucinated
2022Pre-ChatGPT mass adoptionBaseline: errori di battitura, scarsa rilevanza statistica
nov 2022Lancio di ChatGPT al pubblicoCurva inizia a salire
2023Diffusione GPT-4 e ClaudePrimi casi documentati di citazioni inventate
2024Adozione di massa LLM in ricercaCrescita accelerata, prime ritrattazioni segnalate per citazioni AI-generate (Retraction Watch, Futurism)
2025146.932 citazioni inventate (stima conservativa Zhao et al.)Picco rilevato, fenomeno sistemico
mag 2026Pubblicazione studio Zhao et al.Prima quantificazione su larga scala

In quattro anni si passa da “errore raro e per lo più tipografico” a “146.932 errori sistemici documentati in un solo anno”. Non è un cambiamento di grado, è un cambiamento di natura del problema.

Tre aspetti rendono il dato preoccupante:

1. Sono errori embedded. Lo studio sottolinea che le hallucination sono “diffusely embedded across many papers”: non sono interi paper falsi, sono singole citazioni perse dentro lavori altrimenti legittimi. Una mia interpretazione plausibile è che un autore reale abbia chiesto all’AI di “trovare le fonti” e ne abbia incollate una manciata senza verificare. In ogni caso, è molto più difficile beccare un errore che si nasconde in mezzo a 40 riferimenti veri.

2. Sono concentrati nei campi con adozione AI rapida. Lo studio segnala letteralmente che le hallucination sono “especially pronounced in fields with rapid AI uptake”. Significa che proprio le discipline più aperte all’innovazione tecnologica sono quelle più contaminate.

3. Possono auto-rafforzarsi. Questo è un rischio noto del settore, non un risultato diretto di Zhao et al.: quando una citazione inventata finisce in un paper pubblicato, i futuri modelli di AI vengono addestrati anche su quel paper e possono ripetere o amplificare lo stesso errore. È un loop di feedback che, senza interventi, rischia di accelerare. Lo studio è esplicito su quanto sia urgente intervenire: “la diffusione di contenuti hallucinated ha superato i sistemi di controllo esistenti” (traduzione dell’abstract).

Quali settori e che tipo di paper sono più colpiti?

Lo studio identifica tre pattern ricorrenti.

Pattern 1: linguistic signatures of AI-assisted writing

Lo studio rileva che i paper con “linguistic signatures of AI-assisted writing” hanno una densità di citazioni hallucinated significativamente più alta rispetto agli altri. Il paper non elenca esempi specifici, ma nella letteratura adiacente questi segnali includono frasi standardizzate, transizioni meccaniche, lessico ridondante. È un indicatore indiretto ma efficace.

Pattern 2: team piccoli e early-career

Gli autori al primo o secondo paper, e i team di una o due persone, sono più colpiti rispetto a gruppi grandi e senior. La spiegazione plausibile: meno revisori interni, meno tempo dedicato al fact-check, maggiore pressione a pubblicare velocemente. Esattamente la situazione di tanti professionisti italiani che scrivono articoli/report da soli.

Pattern 3: il bias di prominenza e di genere

Questo è il dato che colpisce di più. Le citazioni inventate non sono distribuite uniformemente rispetto agli autori “fittizi” a cui vengono attribuite. Le citazioni hallucinated assegnano credito in modo sproporzionato a ricercatori già prominenti e a uomini. Quando l’AI “inventa” un autore plausibile, sceglie statisticamente di più nomi maschili famosi piuttosto che donne o ricercatori meno noti.

La conseguenza pratica: gli LLM, anche quando sbagliano, rinforzano le disuguaglianze esistenti nel riconoscimento scientifico. Non è solo un problema di accuratezza, è anche un problema strutturale.

Perché l’AI inventa proprio citazioni così credibili?

Il meccanismo tecnico è noto da tempo ma vale la pena spiegarlo per capire come difendersi.

Un LLM come ChatGPT o Claude non ha un database di paper a cui attingere quando rispondi. Quando gli chiedi “dammi delle fonti su X”, il modello genera una stringa di testo che ha l’aspetto statistico di una citazione: nome di un autore plausibile, anno plausibile, titolo plausibile, rivista esistente. Tutto plausibile, niente verificato.

Questo è il motivo per cui le citazioni inventate sono così difficili da riconoscere a colpo d’occhio:

  • L’autore spesso esiste davvero (è una persona reale che lavora in quel campo)
  • La rivista è quasi sempre reale (Nature, Science, JAMA, ecc.)
  • L’anno è coerente con il periodo plausibile
  • Il titolo suona come un paper che potrebbe esistere

Quello che non esiste è la combinazione specifica autore + titolo + anno + rivista. Quel paper non è mai stato scritto da quella persona in quell’anno su quella rivista. È un Frankenstein di pezzi reali, assemblato dall’AI a partire dalle correlazioni statistiche viste in training.

Per questo non basta “fidarsi del nome conosciuto”. Per questo i tool generalisti di ricerca AI sono fragili sulle citazioni. E per questo lo studio Zhao et al. ha potuto contare 146.932 errori in un solo anno: la fabbricazione è strutturale, non un bug.

Come riconosci una citazione AI in 30 secondi?

Ecco un protocollo operativo che chiunque può applicare prima di citare una fonte suggerita dall’AI. Funziona in 4 passaggi.

Passo 1: cerca il titolo esatto su Google Scholar

Google Scholar indicizza praticamente tutta la letteratura accademica. Copia il titolo tra virgolette e cercalo. Se non trovi nessun risultato esatto, è quasi certamente una hallucination. Tempo: 10 secondi.

Passo 2: verifica il DOI

Se la citazione include un DOI (digital object identifier, formato 10.xxxx/yyyy), incollalo su doi.org. Se il DOI non risolve a un paper reale, è inventato. Se l’AI non ha fornito un DOI, sospetto attivo. Tempo: 10 secondi.

Passo 3: controlla l’autore reale

Cerca l’autore nominato su Google Scholar o sulla sua pagina universitaria. Vai alla sua lista pubblicazioni. Il paper che ti è stato citato deve essere nella sua lista. Se non c’è, l’AI ha messo il suo nome su un paper che lui non ha mai scritto. Tempo: 30 secondi.

Passo 4: verifica la coerenza temporale e tematica

Quando l’autore esiste ma il paper non è nella sua lista, controlla anche se: a) lavorava su quel tema in quell’anno (un fisico delle particelle che cita un suo paper sul machine learning del 2010 è sospetto), b) la rivista è coerente con il suo curriculum. Tempo: 30 secondi.

In totale: un minuto e mezzo per verificare una citazione. È il prezzo che paghi per non finire nelle statistiche del prossimo Zhao et al. del 2027.

Quali tool AI inventano più citazioni? Tabella comparativa

Non tutti i tool LLM sbagliano allo stesso modo. La differenza tra chi pesca da memoria pre-training e chi pesca da documenti caricati è enorme. Ecco una mappa pratica del 2026 basata sulle architetture pubbliche dei tool e sull’esperienza di chi li usa quotidianamente in ambito professionale. Lo studio Zhao et al. non distingue per tool nei suoi numeri: la categorizzazione che segue è una sintesi divulgativa, utile per scegliere lo strumento giusto.

ToolModalità di accesso alle fontiPropensione a inventare citazioniComportamento tipico
ChatGPT (chat standard)Memoria pre-trainingAltaGenera citazioni con autore reale + rivista vera + titolo plausibile, ma combinazione inesistente
ChatGPT con browsingWeb search in tempo realeMediaPuò mal-attribuire frasi a fonti reali (la pagina esiste ma il dato non è dentro)
Claude (chat standard)Memoria pre-trainingAltaComportamento analogo a ChatGPT, può inventare DOI plausibili
Claude Projects (con knowledge)Documenti caricati dall’utenteMolto bassaCita testualmente dal materiale caricato con riferimento al passaggio
Gemini (standard)Memoria pre-training + GoogleMedia-altaPuò inventare citazioni quando il modello prevale sulla ricerca
Gemini Deep ResearchWeb search profonda multi-stepMediaPiù solido sui dati pubblici, fragile sulle citazioni accademiche
NotebookLMSolo documenti caricati dall’utentePraticamente nullaSe la risposta non è nelle fonti, dichiara di non sapere
PerplexityWeb search in tempo reale con citazioniMediaCita sempre fonti reali ma può attribuire male il passaggio specifico
Custom GPT con fileKnowledge base caricataBassaComportamento simile a NotebookLM se ben configurato

La regola implicita è semplice: i tool che pescano da “memoria del modello” sono fragili sulle citazioni, i tool che pescano da “file caricati dall’utente” sono solidi. Per qualsiasi lavoro professionale che cita fonti, la scelta tecnica è strategica, non estetica.

Lo studio Zhao et al., con i suoi 146.932 errori documentati, non distingue per tool. Ma la composizione del campione (paper accademici) suggerisce che la maggior parte degli errori arrivi da ChatGPT e Claude usati in modalità chat libera, perché sono i tool più diffusi tra ricercatori e professionisti che non hanno configurato una knowledge base controllata.

Come ti difendi se usi l’AI per scrivere?

Quattro pratiche concrete che cambiano il modo di lavorare con l’AI, ridotte a regole operative.

Regola 1: NotebookLM al posto di ChatGPT per il lavoro con fonti

NotebookLM di Google ha una proprietà fondamentale: cita solo da fonti che tu hai caricato. Se carichi 20 PDF, ti dà risposte basate su quei 20 PDF, con riferimento puntuale alla pagina. Non può inventare fonti perché non ha permesso di pescare fuori dal tuo materiale.

Per qualsiasi lavoro di sintesi documentale (ricerca di mercato, analisi normativa, summary di paper), NotebookLM elimina alla radice il problema delle citazioni inventate. È diverso da ChatGPT, che attinge alla propria memoria pre-training (dove può confondersi).

Mio approfondimento: guida completa a NotebookLM.

Regola 2: Claude Projects con knowledge base controllata

Claude con la feature “Project knowledge” funziona come NotebookLM: carichi i documenti, e l’AI risponde solo basandosi su quelli. Lo stesso vale per i Custom GPT di ChatGPT con file caricati. La regola universale è: se serve una citazione, l’AI deve poterla pescare da un documento che hai caricato tu, non dalla sua memoria.

Regola 3: lista fonti separata, mai chiedere “trovami delle fonti”

Il prompt killer è: “trovami 5 fonti accademiche su X”. È esattamente il modo in cui ottieni 5 citazioni hallucinated. Sostituiscilo con: “ho letto questi 3 paper [allegati], aiutami a costruire l’argomentazione”. Le fonti le porti tu, l’AI le orchestra.

Regola 4: fact-check rigoroso prima della pubblicazione

Se devi pubblicare un articolo, un report, un white paper che cita fonti, applica il protocollo in 4 passi del capitolo precedente a ogni singola citazione. Non a campione. Una citazione inventata in un report di consulenza ti distrugge la credibilità con un cliente. Una citazione inventata in un articolo blog ti distrugge la credibilità nel mercato.

Mio approfondimento sull’uso di Claude Cowork per gestire fonti e knowledge base: guida pratica a Claude Cowork.

Quanto inventa l’AI nelle email, nei post LinkedIn e nei report professionali?

Il paper Zhao et al. parla di paper scientifici perché lì le citazioni sono verificabili in modo binario e ti permettono di fare audit di massa. Ma il fenomeno è generale, anzi nelle comunicazioni professionali è quasi certamente peggio.

Quando chiedi a ChatGPT, Claude o Gemini di scrivere senza una knowledge base controllata:

  • Un’email che cita “una ricerca di McKinsey del 2023” → l’AI può inventare la ricerca
  • Un post LinkedIn che cita “uno studio Harvard Business Review” → l’AI può inventare lo studio
  • Un report cliente che cita “il dato Gartner sul cloud computing” → l’AI può inventare il dato
  • Una slide aziendale con bullet point del tipo “secondo Forrester il 67% delle aziende ha adottato X” (numero ipotetico a scopo esemplificativo) → l’AI può inventare la statistica
  • Un articolo blog che cita “secondo l’Osservatorio Politecnico Milano” → l’AI può inventare il riferimento

In tutti questi casi nessuno fa audit di massa, perché non esiste un database tipo arXiv per email aziendali, post LinkedIn o slide PowerPoint. Quindi il problema esiste ma è invisibile. Lo studio Zhao et al. è importante anche per questo: ci dà un proxy quantitativo. Se nei paper scientifici, dove la pressione al rigore è massima, i numeri sono 146.932 errori in un anno, nelle comunicazioni professionali quotidiane il fenomeno è verosimilmente più ampio.

Gli errori comuni di ChatGPT che il professionista italiano incontra più spesso ricadono quasi tutti in questa categoria: dati inventati con struttura plausibile, attribuiti a fonti reali ma a documenti inesistenti. È il motivo per cui un consulente serio non incolla mai un output AI in un report senza fact-check.

La buona notizia: gli stessi 4 passi di fact-check (Scholar / DOI / autore / coerenza) funzionano anche per dati di consulenza, con piccoli adattamenti.

  • Per un dato McKinsey, cerca il report originale su mckinsey.com/insights
  • Per uno studio Harvard Business Review, cerca l’articolo su hbr.org
  • Per un dato Gartner, cerca il press release o il report su gartner.com
  • Per un dato Osservatorio del Politecnico di Milano, cerca su osservatori.net
  • Per un dato ISTAT, cerca su istat.it/dati

Se l’AI ti ha dato un numero senza specificare il documento esatto, è quasi certamente inventato. La regola universale è la stessa che vale per i 146.932 errori scientifici di Zhao et al.: nessuna citazione senza verifica.

FAQ

Quante citazioni AI inventate ci sono nei paper scientifici nel 2025?

Secondo lo studio Zhao et al. (arXiv:2605.07723) pubblicato l’8 maggio 2026, la stima conservativa è di 146.932 citazioni hallucinated nel solo 2025, rilevate analizzando 111 milioni di riferimenti su 2,5 milioni di paper nei database arXiv, bioRxiv, SSRN e PubMed Central. Il numero reale è verosimilmente più alto perché la stima non include la letteratura grigia.

Come capisco se una citazione viene dall’AI?

Quattro check rapidi: 1) cerca il titolo esatto su Google Scholar tra virgolette, 2) verifica il DOI su doi.org, 3) controlla la pagina pubblicazioni dell’autore citato, 4) verifica coerenza temporale e tematica. Se uno dei quattro fallisce, la citazione è probabilmente inventata. Tempo totale: 1 minuto e mezzo per citazione.

Quali strumenti AI sbagliano più spesso le citazioni?

I tool LLM generalisti (ChatGPT senza browsing, Claude in modalità chat, Gemini standard) sono i più esposti perché generano citazioni a partire dalla loro memoria pre-training. I tool che ricavano risposte da documenti caricati (NotebookLM, Claude Projects, Custom GPT con knowledge) hanno tassi di hallucination molto più bassi sulle citazioni. Perplexity sta nel mezzo: ricerca su web in tempo reale ma può comunque mal-attribuire frasi a fonti errate.

NotebookLM inventa citazioni?

Praticamente no, per design. NotebookLM cita solo dalle fonti che l’utente ha caricato e fornisce link puntuali al passaggio specifico. Se in un documento caricato non c’è la risposta, NotebookLM dice che non sa, invece di inventare. È la ragione per cui è diventato lo strumento di riferimento per la sintesi documentale professionale.

ChatGPT inventa citazioni?

Sì, ChatGPT senza strumenti aggiuntivi può inventare citazioni con struttura plausibile (autore reale, rivista vera, titolo verosimile) che però non corrispondono a nessun documento esistente. ChatGPT con la modalità browsing attiva o con file caricati come knowledge base ha tassi di errore molto più bassi.

Perché l’AI inventa citazioni così credibili?

Gli LLM generano testo che somiglia statisticamente a quello visto in training. Una citazione è un pattern statistico molto regolare (autore, anno, titolo, rivista, pagina). Il modello produce un mix plausibile di questi elementi senza un controllo di esistenza reale. Il risultato è un Frankenstein: autore reale, rivista reale, anno reale, ma la combinazione specifica non corrisponde a nessun paper.

Esiste un tool per fact-check automatico delle citazioni?

Sì, alcuni esistono: Scite, Consensus, Elicit fanno controlli su citazioni accademiche. Tuttavia il modo più efficace nel 2026 resta il protocollo manuale a 4 passi (Scholar / DOI / autore / coerenza) perché si applica anche a fonti non accademiche (report McKinsey, articoli HBR, dati Gartner) che gli strumenti automatici non coprono bene.

Cosa rischio se pubblico un articolo con una citazione inventata dall’AI?

Dipende dal contesto. In ambito accademico stai parlando di possibili ritrattazioni del paper, danno alla reputazione professionale, problemi con i co-autori. In ambito professionale (consulenza, formazione, contenuti aziendali) il danno è reputazionale: una citazione inventata scoperta da un cliente ti fa perdere credibilità immediatamente. Il costo del fact-check è sempre minore del costo della scoperta.

Fonti

Continua altrove


Articolo scritto con il supporto dell’intelligenza artificiale, sotto la mia supervisione. La responsabilità di quello che leggi è mia.

Massimiliano Pioli, AI Strategist e formatore
Massimiliano Pioli
Divulgatore di Intelligenza Artificiale

Divulgo l’intelligenza artificiale con un approccio pragmatico. Su questo blog, su Substack, YouTube, WhatsApp e nel mio podcast Cronache di Intelligenza Artificiale racconto come uso davvero l’AI nel lavoro quotidiano: produttività per professionisti, ecosistema Google AI (Gemini, NotebookLM, AI Studio), Claude Cowork e Claude Code. Non racconto l’AI come magia: non ti dà il talento che non hai, ma può moltiplicare quello che sai già fare.