Allucinazioni nell’intelligenza artificiale: che cosa sono, perché accadono e come prevenirle

La nostra risposta operativa alle allucinazioni

In Impulsa3 abbiamo imparato a trattare le allucinazioni come un problema di processo e supervisione, non solo di modello. I3OS definisce quali fonti consultare, come presentare il risultato e che cosa deve verificare una persona prima di consegnarlo. La regola è semplice: un risultato non è finito perché l’ha generato l’IA; è finito quando il responsabile ha validato i dati, il contesto e l’azione che viene proposta. Questa pratica riduce il rischio e rende visibile dove dobbiamo migliorare il metodo.

La tua IA può inventare dati, citare leggi inesistenti e fabbricare statistiche con la massima sicurezza. Le allucinazioni sono il rischio reputazionale più sottovalutato dell’IA generativa. Ti spieghiamo perché accadono e le 7 tecniche per ridurle drasticamente

Nel marzo del 2023 un avvocato di New York ha depositato un atto giudiziario che citava sei casi come precedenti. Il problema: tutti e sei erano inventati. Li aveva generati ChatGPT con nomi di giudici reali, tribunali reali e numeri di fascicolo plausibili. L’avvocato è stato sanzionato dalla corte.

Questa è un’allucinazione dell’IA: un’informazione generata da un modello linguistico che è falsa ma sembra autentica. Non è un errore isolato né un bug. È una caratteristica strutturale del funzionamento degli LLM (Large Language Models). Ed è il rischio reputazionale e operativo più sottovalutato dalle aziende che adottano l’IA generativa.

Il caso dell’avvocato non è un aneddoto. Ogni settimana emergono nuovi esempi: chatbot di compagnie aeree che inventano politiche di rimborso, assistenti sanitari che suggeriscono dosaggi errati di farmaci, strumenti di ricerca che citano paper accademici inesistenti. In tutti i casi lo schema è lo stesso: l’IA genera informazioni false con la stessa scioltezza e sicurezza di quelle vere.

In questo articolo ti spieghiamo perché l’IA allucina, quali tipi di allucinazione possono colpire la tua azienda e le 7 tecniche collaudate per ridurle a livelli operativamente accettabili.

Perché l’IA allucina (e perché non può smettere del tutto)

Un LLM non «sa» le cose. Prevede la parola successiva più probabile in una sequenza. Ha imparato schemi statistici da miliardi di testi, ma non ha un modello del mondo, non distingue tra verità e finzione e non può verificare le proprie affermazioni.

Le cause principali delle allucinazioni:

  • Lacune nell’addestramento: Se il modello non ha informazioni su un tema specifico, non dice «non lo so». Genera una risposta plausibile basata su schemi simili. Se gli chiedi della tua politica di reso e non la conosce, ne inventerà una che «suona» ragionevole.
  • Eccesso di sicurezza: Gli LLM sono ottimizzati per generare testo fluido e sicuro di sé. Non hanno un meccanismo interno di dubbio. Quando non sono sicuri non lo dicono: generano la risposta più probabile con la stessa sicurezza che avrebbero se ne fossero certi.
  • Compiacenza (sycophancy): I modelli tendono a dire all’utente quello che vuole sentirsi dire. Se formuli la domanda in modo tendenzioso («vero che X è meglio di Y?»), il modello tenderà a confermare la tua premessa invece di metterla in discussione.
  • Confusione di contesto: Nelle conversazioni lunghe il modello può mescolare informazioni provenienti da parti diverse della conversazione o confondere i dati del contesto con la conoscenza generale.

L’IA non mente. Non sa di star dicendo qualcosa di falso. Semplicemente non distingue tra verità e finzione.

Tipi di allucinazione e relativo rischio per la tua azienda

  • Dati inventati: Statistiche, percentuali, cifre di vendita, dati di mercato che sembrano reali ma sono fabbricati. Rischio: inserire dati falsi in report, proposte commerciali o comunicazioni pubbliche.
  • Fonti inesistenti: Citazioni di articoli, leggi, sentenze o studi che non esistono. Rischio: citare normativa inesistente in documenti legali o di compliance.
  • Attribuzione falsa: Attribuire dichiarazioni a persone reali che non le hanno mai fatte. Rischio: problemi di diffamazione o di credibilità in caso di pubblicazione.
  • Informazioni superate presentate come attuali: Il modello ha una data di taglio della conoscenza e può presentare dati di anni fa come se fossero attuali. Rischio: decisioni basate su informazioni obsolete.
  • Confabulazione di prodotto: In un chatbot di ecommerce, inventare caratteristiche, prezzi o disponibilità dei prodotti. Rischio: reclami dei clienti, perdita di fiducia, problemi legali.

Il rischio varia a seconda del caso d’uso. In un chatbot di supporto interno, un’allucinazione sulla procedura per le ferie è fastidiosa ma correggibile. In un chatbot di ecommerce che inventa prezzi o disponibilità è un problema legale. In un sistema di IA che genera report finanziari con dati falsi può essere devastante. La gravità dell’allucinazione dipende dal contesto, e per questo la strategia di mitigazione deve essere proporzionata al rischio.

I settori più vulnerabili alle allucinazioni sono quelli che trattano informazioni regolamentate: sanità (diagnosi false), legale (giurisprudenza inesistente), finanza (dati di mercato inventati) ed ecommerce (caratteristiche di prodotto false). In questi settori un sistema di IA senza controlli sulle allucinazioni non è solo imprudente: è potenzialmente illegale.

Dato: Alcuni studi collocano il tasso di allucinazioni degli LLM più avanzati tra il 3% e il 15% nelle richieste generiche. In domini specialistici senza RAG, il tasso può superare il 25%. Con un RAG ben implementato scende al 2-5%.

Le 7 tecniche per ridurre le allucinazioni

  1. RAG (Retrieval-Augmented Generation). La tecnica più efficace. Invece di dipendere dalla conoscenza generale del modello, il RAG cerca l’informazione nella tua base documentale e la fornisce come contesto. Riduce le allucinazioni dal 15-25% al 2-5%. (Vedi l’Articolo 19 per una spiegazione dettagliata del RAG.)
  2. Grounding con istruzioni esplicite. Inserisci nel prompt di sistema istruzioni come: «rispondi SOLO con informazioni presenti nel contesto fornito. Se l’informazione non è nel contesto, rispondi: non ho informazioni sufficienti per rispondere a questa domanda». Semplice ma efficace.
  3. Temperatura bassa. Il parametro di temperatura controlla la creatività del modello. Una temperatura alta (0,8-1,0) genera risposte più varie ma con più rischio di allucinazione. Per usi aziendali, una temperatura di 0,1-0,3 riduce drasticamente l’invenzione.
  4. Verifica incrociata (cross-check). Per i dati critici, fai in modo che l’IA verifichi le proprie risposte: genera la risposta, poi chiedile di individuare quali affermazioni può sostenere con il contesto e quali no. Quelle che non può sostenere vanno eliminate o segnalate.
  5. Citazione delle fonti. Configura il sistema perché citi la fonte di ogni affermazione. Se non riesce a citare una fonte, è il segnale che sta generando informazioni senza supporto. È particolarmente utile in combinazione con il RAG.
  6. Supervisione umana (HITL). Per gli output ad alto impatto (comunicazioni al cliente, documenti legali, report finanziari) richiedi una revisione umana prima della pubblicazione. La persona non deve rivedere tutto: solo gli output che escono dal sistema per un uso esterno.
  7. Valutazione continua. Monitora il tasso di allucinazioni con valutazioni periodiche: campione casuale di risposte, verifica manuale dell’accuratezza, metrica di fedeltà (faithfulness) se usi il RAG. Se il tasso sale, indaga e correggi prima che diventi un incidente.

Semaforo delle allucinazioni: quando intervenire

  • Verde (GO): Tasso di allucinazioni < 3% nelle valutazioni periodiche. Il sistema è affidabile per un uso generale con supervisione standard.
  • Giallo (FIX): Tasso tra il 3% e il 10%. Rivedi la base di conoscenza (se usi il RAG), aggiusta il prompt di sistema e abbassa la temperatura. Aumenta la supervisione umana per gli output critici.
  • Rosso (KILL): Tasso > 10% o allucinazione grave rilevata (dato falso in una comunicazione pubblica). Fermare il sistema per l’uso esterno, indagare sulla causa e non riattivarlo finché non è corretto.

La frequenza di valutazione consigliata: settimanale durante il primo mese di rilascio, quindicinale nei mesi 2-3 e mensile da lì in avanti se il sistema resta in verde.

Allucinazioni e conformità normativa

Le allucinazioni non sono solo un problema di qualità. Hanno implicazioni regolatorie dirette:

  • AI Act: Il regolamento richiede che i sistemi di IA siano robusti e accurati. Un sistema che genera regolarmente informazioni false non rispetta i requisiti di affidabilità. Per i sistemi ad alto rischio, il tasso di allucinazioni deve essere documentato nella documentazione tecnica.
  • GDPR: Se il tuo chatbot fornisce informazioni false su come tratti i dati personali dei clienti, stai violando il principio di trasparenza.
  • Tutela del consumatore: Se il tuo chatbot di ecommerce dice che un prodotto ha una caratteristica che non ha, o che è disponibile quando non lo è, puoi trovarti di fronte a reclami ai sensi della normativa sui consumatori.

Consiglio legale: Inserisci un disclaimer visibile in qualsiasi interfaccia in cui l’IA interagisce con i clienti: «Questo assistente usa l’intelligenza artificiale. Le informazioni possono contenere errori. Per una conferma, contatta il nostro team». Non elimina la responsabilità, ma dimostra diligenza.

Le allucinazioni non si eliminano, si gestiscono

Pretendere che la tua IA non allucini mai è ingenuo. La domanda non è se allucinerà, ma con quale frequenza, in quali contesti e con quali conseguenze. La combinazione di RAG, grounding, temperatura bassa, citazione delle fonti e supervisione umana può ridurre il tasso a livelli operativamente accettabili.

L’importante è misurare, monitorare e agire. Se tratti le allucinazioni come un KPI di qualità (con semaforo, soglie e revisioni periodiche), da rischio incontrollato diventano un rischio gestito.

Se vuoi valutare il tasso di allucinazioni del tuo sistema di IA, implementare un RAG affidabile o impostare un programma di valutazione continua, in Impulsa3 realizziamo audit di affidabilità dei sistemi di IA.

impulsa3.com · Trasformazione Digitale e IA per PMI ed ecommerce · servicios@impulsa3.com

Il controllo di questi rischi deve integrarsi con il piano di incidenti dell’IA e gli agenti di IA.