Che cosa ci ha insegnato I3OS sulla qualità del dato
Nella nostra esperienza il collo di bottiglia è di solito il contesto, non il modello. Prima di chiedere all’IA di produrre un’analisi dobbiamo sapere su quale cliente stiamo lavorando, quali fonti sono autorizzate, quali dati hanno una data e quale procedura va seguita. Per questo I3OS mette insieme i Project di cliente, i connettori, la documentazione delle skill e la revisione umana. Il risultato non dipende solo dallo scegliere un modello migliore, ma dal fornire informazioni sufficientemente complete, coerenti e tracciabili.
L’80% del tempo di un progetto di IA se ne va nella preparazione dei dati. Se i tuoi dati sono incompleti, incoerenti o superati, nessun modello di machine learning produrrà risultati affidabili. Ti spieghiamo i 6 criteri di qualità, come fare la diagnosi della tua situazione e come costruire un programma di data quality che funzioni
C’è una frase che ogni professionista dei dati conosce: garbage in, garbage out. Se alimenti un modello di intelligenza artificiale con dati sporchi, il modello produrrà risultati sporchi. Con molta sicurezza, con bei grafici e con l’apparenza della precisione tecnica, ma comunque sporchi.
Il problema è che la maggior parte delle aziende sottovaluta lo stato reale dei propri dati. Uno studio di Gartner stima che il costo medio della cattiva qualità dei dati per un’organizzazione sia di 12,9 milioni di dollari all’anno. E non è solo un problema delle grandi aziende: un ecommerce con schede prodotto incomplete, prezzi non aggiornati e anagrafiche clienti duplicate ha lo stesso problema alla sua scala.
Il peggio è che questo problema resta invisibile finché non provi a fare qualcosa di intelligente con i tuoi dati. Un ERP funziona ragionevolmente bene con dati mediocri, perché le persone compensano gli errori a mano. Ma un modello di machine learning non compensa: impara gli errori, li amplifica e li riproduce su scala.
In questo articolo ti spieghiamo che cosa significa davvero «qualità dei dati» nel contesto dell’IA, i 6 criteri che devi valutare, come fare la diagnosi della tua situazione attuale e come costruire un programma di data quality che funzioni senza bisogno di un team di 20 data engineer.
I 6 criteri di qualità dei dati per l’IA
La qualità dei dati non è un concetto astratto. Si misura con criteri specifici. Questi sono i sei fondamentali che incidono direttamente sulle prestazioni di un modello di IA:
1. Completezza
Tutti i campi necessari sono compilati? Un dataset di clienti in cui il 30% non ha l’email, il 15% non ha il CAP e il 40% non ha la data dell’ultimo acquisto è un dataset incompleto che limiterà gravemente qualsiasi modello di segmentazione o previsione.
Semaforo: Verde >95% di completezza nei campi critici. Giallo 80-95%. Rosso <80%.
2. Esattezza
I dati riflettono la realtà? Un prezzo di 0,01€ in una scheda prodotto, una data di nascita del 1900 in un profilo cliente, un indirizzo di consegna che non esiste. I dati inesatti non solo distorcono il modello: possono generare decisioni operative sbagliate.
3. Coerenza
Gli stessi dati significano la stessa cosa in tutti i sistemi? Se il tuo CRM salva i paesi con i codici ISO (ES, FR, DE) ma il tuo ecommerce usa i nomi per esteso (Spagna, Francia, Germania) e il tuo ERP usa codici numerici (034, 033, 049), hai un problema di coerenza che renderà impossibile incrociare i dati senza un livello di trasformazione.
4. Aggiornamento (Timeliness)
I dati sono aggiornati? Un modello di previsione della domanda addestrato con dati di 3 anni fa che non tengono conto dell’impatto post-COVID produrrà previsioni fuori tempo. La frequenza di aggiornamento deve essere coerente con la velocità di cambiamento del business.
5. Univocità
Ci sono record duplicati? Un cliente che compare tre volte con varianti del nome (Juan Pérez, J. Pérez, Juan Pérez López) distorce le analisi di frequenza d’acquisto, lifetime value e segmentazione. Nei database delle PMI i tassi di duplicati tipici stanno tra il 5% e il 15%.
6. Validità
I dati rispettano le regole di formato e di dominio attese? Un campo email senza @, un telefono con 5 cifre, un CAP alfanumerico dove dovrebbe essere numerico. La validità si può verificare automaticamente con regole di business.
Senza dati di qualità non c’è IA che funzioni. Fai l’audit prima di modellare.
Come fare la diagnosi della salute dei tuoi dati in una settimana
Non ti serve un progetto di 6 mesi per sapere se i tuoi dati sono pronti per l’IA. Puoi fare una diagnosi rapida in una settimana seguendo questi passaggi:
- Giorni 1-2: individua le fonti critiche. Quali database alimenteranno il tuo progetto di IA? Di norma: CRM (clienti), ERP (transazioni), piattaforma ecommerce (prodotti, ordini), strumenti di marketing (campagne, lead). Fanne un elenco.
- Giorni 2-3: estrai campioni rappresentativi. Non devi analizzare milioni di record. Un campione di 1.000-5.000 record per ciascuna fonte basta per una diagnosi. Esporta in CSV e carica in un foglio di calcolo o in uno strumento di profilazione.
- Giorni 3-4: applica i 6 criteri. Per ogni fonte misura: % di campi vuoti (completezza), % di valori fuori intervallo (validità), numero di duplicati rilevati (univocità), data del record più vecchio e del più recente (aggiornamento). Strumenti gratuiti come OpenRefine o pandas (Python) permettono di farlo in poche ore.
- Giorni 4-5: classifica con il semaforo. Per ogni fonte e ogni criterio assegna verde, giallo o rosso. Il risultato è una matrice di salute del dato che ti dice esattamente dove sono i problemi e quali sono critici.
Strumenti consigliati: Per le PMI senza team dati: OpenRefine (gratuito, ottimo per pulizia e deduplicazione), Google Sheets con formule di validazione, o uno script di base in Python con pandas. Per le medie imprese: Great Expectations (open source) o Talend Data Quality.
Il costo reale dei dati cattivi: esempi concreti
Per dare una misura dell’impatto, questi sono esempi reali di come la cattiva qualità dei dati colpisce progetti di IA specifici:
- Chatbot con dati di prodotto incompleti: Un chatbot RAG che risponde a domande sui prodotti ha bisogno di schede complete e aggiornate. Se il 20% dei tuoi prodotti non ha una descrizione dettagliata, il chatbot risponderà «non ho informazioni su questo prodotto» in 1 richiesta su 5. Il tasso di risoluzione (FCR) cala del 20% e il CSAT crolla.
- Motore di raccomandazione con categorie incoerenti: Se i tuoi prodotti sono categorizzati in modo diverso sul sito, nell’ERP e nel marketplace, il motore di raccomandazione non riesce a individuare gli schemi di acquisto incrociato. L’AOV che dovrebbe salire del 15% si muove a malapena del 3%.
- Previsione della domanda con storico contaminato: Se non distingui tra vendite reali e resi, o se i periodi di rottura di stock non sono contrassegnati, il modello impara schemi falsi. Il MAPE che dovrebbe stare al 15-20% resta al 35-40%, peggio di una semplice media mobile.
- Selezione del personale con dati storici distorti: Se il tuo dataset di assunzioni contiene 10 anni di decisioni in cui il 90% dei selezionati per ruoli tecnici erano uomini, il modello codificherà quella distorsione. La regola dei 4/5 non passerà il primo audit.
In tutti questi casi la soluzione non è un modello più potente. È migliorare i dati prima di modellare. E questo comincia da una diagnosi onesta della situazione attuale.
I cinque errori più comuni nella data quality per l’IA
- Pulire una volta e dimenticarsene. La qualità dei dati non è un progetto una tantum. È un processo continuo. Se pulisci oggi la tua base clienti ma non stabilisci regole di validazione all’ingresso dei dati, tra 6 mesi sarai al punto di partenza. La pulizia senza prevenzione è un ciclo infinito.
- Non coinvolgere il business. Solo il team di business sa che cosa significa «un dato corretto» nel suo contesto. Un data engineer può rilevare che un campo ha il 20% di valori nulli, ma solo il commerciale sa se quei nulli sono un problema reale o una situazione attesa.
- Sottovalutare il costo della preparazione. L’80% del tempo di un progetto di IA tipico se ne va nella preparazione dei dati. Se metti a budget solo il modello e lo strumento ma ignori pulizia, trasformazione e validazione dei dati, il tuo progetto slitterà e costerà più del previsto.
- Non definire un Data Owner. Ogni fonte di dati critica ha bisogno di un responsabile (Data Owner) che risponda della sua qualità. Se nessuno è responsabile, nessuno migliora la qualità. Il Data Owner non deve pulire i dati di persona: deve garantire che gli standard vengano rispettati.
- Ignorare i bias nei dati. I dati storici riflettono decisioni passate, comprese quelle distorte. Se il tuo modello di selezione viene addestrato con dati di assunzioni in cui l’85% erano uomini, il modello imparerà a dare priorità ai profili maschili. La qualità del dato non è solo tecnica: è anche etica.
Programma di data quality minimo funzionante
Non ti serve un reparto di data governance per migliorare la qualità dei tuoi dati. Un programma minimo funzionante comprende:
- Data Owner designati. Assegna un responsabile a ciascuna fonte di dati critica. In una PMI di solito è il responsabile dell’area che genera quei dati (il commerciale per il CRM, le operation per l’ERP, il marketing per il CMS).
- Regole di validazione in ingresso. Configura controlli automatici nei moduli e nei sistemi in cui si inseriscono i dati: campi obbligatori, formati standard (email, telefono, CAP), intervalli validi (prezzo >0, quantità intero positivo). È la misura con il ROI più alto: prevenire gli errori costa 10 volte meno che correggerli.
- Deduplicazione periodica. Programma una revisione mensile o trimestrale dei duplicati nei tuoi database principali. Strumenti come OpenRefine possono individuare duplicati fuzzy (varianti dello stesso nome o indirizzo) in pochi minuti.
- Dashboard di salute del dato. Crea un pannello semplice con gli indicatori chiave per fonte: % di completezza, % di duplicati, data dell’ultimo aggiornamento. Guardalo ogni mese. Se un indicatore supera la soglia gialla, intervieni prima che arrivi al rosso.
- Documentazione del dizionario dei dati. Un documento semplice che definisca che cosa significa ogni campo, che formato ha, quali valori sono validi e chi è il Data Owner. Senza dizionario dei dati ognuno interpreta i campi a modo suo e l’incoerenza cresce.
Qualità dei dati e AI Act: un obbligo normativo
L’AI Act non regola solo i modelli di IA. Stabilisce anche requisiti sui dati che li alimentano. Per i sistemi ad alto rischio il regolamento richiede che i set di dati di addestramento siano rappresentativi, privi di errori (per quanto possibile) e adeguati alla finalità del sistema.
Questo significa che la qualità dei dati smette di essere una buona pratica e diventa un obbligo documentabile. Se un auditor ti chiede con quali dati hai addestrato il tuo modello di selezione del personale, devi poter dimostrare di averne valutato la rappresentatività, individuato i bias e corretto gli errori di qualità.
Le aziende che hanno già un programma di data quality sono in posizione migliore per rispettare l’AI Act. Quelle che non ce l’hanno dovranno investire in governance dei dati prima di poter rilasciare sistemi ad alto rischio con garanzie.
Consiglio: Inserisci la valutazione della qualità dei dati come passaggio obbligatorio nel Gate 0 di qualsiasi progetto di IA. Se i dati non passano il semaforo (verde nei criteri critici), il progetto non arriva al pilota. Meglio scoprirlo prima che dopo.
I dati sono il vero carburante dell’IA
Puoi avere il modello migliore, la piattaforma più avanzata e il team più capace. Se i tuoi dati sono mediocri, i tuoi risultati saranno mediocri. La qualità dei dati non è affascinante, non fa notizia e raramente compare nelle presentazioni di strategia. Ma è la variabile che ha la correlazione più forte con il successo di un progetto di IA.
La buona notizia: non ti servono dati perfetti per cominciare. Ti servono dati abbastanza buoni per il tuo caso d’uso specifico, un processo di miglioramento continuo e la disciplina di misurare la qualità e agire su di essa prima di ogni progetto.
Se vuoi fare un audit della qualità dei tuoi dati, definire un programma di data quality minimo funzionante o preparare i tuoi dati per un progetto di IA, in Impulsa3 realizziamo audit di qualità dei dati e ti accompagniamo nella preparazione.
impulsa3.com · Trasformazione Digitale e IA per PMI ed ecommerce · servicios@impulsa3.com
Questi dati sono anche la base di GDPR e intelligenza artificiale, IA generativa e IA predittiva, agenti di IA.