Se il sistema risponde non vuol dire che stia ancora funzionando bene
Un’applicazione tradizionale di solito si guasta in modo visibile. Un sistema di IA può continuare a consegnare risultati mentre perde precisione, usa dati diversi, fa salire il proprio costo o penalizza un segmento. Il monitoraggio deve osservare sia l’infrastruttura sia la qualità delle decisioni.
Il cruscotto dipende dal caso, ma ha sempre bisogno di proprietari, soglie e azioni. Un alert senza una persona che possa interpretarlo e intervenire è solo rumore.
Non monitorare soltanto se l’IA è disponibile. Monitora se è ancora utile, sicura ed economicamente difendibile.
I sei livelli di osservabilità
- Servizio: disponibilità, latenza, errori, code e dipendenze.
- Dati: volume, completezza, validità, aggiornamento e cambiamenti di distribuzione.
- Modello o istruzioni: precisione, qualità, stabilità, versione e tasso di rifiuto.
- Business: risultato incrementale, risparmio, conversione, risoluzione o rischio evitato.
- Persone: adozione, correzioni, escalation e soddisfazione.
- Rischio: bias, privacy, sicurezza, contenuti dannosi e incidenti.
Aggiungi il costo per operazione, per utente attivo e per risultato ottenuto. Nell’IA generativa conviene registrare token, tentativi ripetuti, uso degli strumenti, cache e revisione umana. La fattura tecnica non rappresenta il costo totale.
Che cos’è il drift
Il drift è un cambiamento che riduce la validità del sistema. Può riguardare i dati in ingresso, la relazione tra variabili e risultato o il comportamento degli utenti. Per esempio, una nuova campagna cambia il profilo dei lead e degrada un modello di scoring anche se il codice non è cambiato.
Per individuarlo bisogna confrontare finestre temporali, segmenti e baseline. Non ogni cambiamento impone di riaddestrare: prima individua la causa e verifica se l’obiettivo di business è rimasto lo stesso.
Valuta per campioni e per segmenti
Crea un insieme di casi di riferimento con i risultati attesi ed eseguilo dopo ogni cambio di modello, prompt, dati o fornitore. Combina metriche automatiche e revisione umana, perché scioltezza ed esattezza non sono la stessa cosa.
Scomponi per canale, tipo di cliente, lingua, complessità e gruppo interessato. Una media stabile può nascondere un peggioramento nei casi rari ma critici. Registra anche i falsi positivi e i falsi negativi in base al loro costo reale.
Progetta alert su cui si possa agire
- Indicatore e fonte esatta.
- Soglia di attenzione e soglia critica.
- Finestra temporale per evitare reazioni al rumore.
- Persona responsabile e sostituto.
- Azione immediata: limitare, rivedere, tornare alla versione precedente o disattivare.
- Evidenza che permette di chiudere l’alert.
Usa più livelli di gravità. Un aumento moderato della latenza può aspettare; una fuga di dati o una decisione dannosa richiede di attivare il piano di risposta agli incidenti.
Tieni sotto controllo modifiche e versioni
Registra modello, istruzioni, fonti RAG, parametri, regole, dati e data di rilascio. Collega ogni risultato alla sua configurazione. Senza versionamento sarà impossibile indagare perché il comportamento è cambiato o riprodurre una decisione.
Fai rilasci progressivi e confronta la nuova versione con la precedente. Tieni pronto un percorso di rollback. Modifiche apparentemente minori nei prompt o nei documenti possono alterare i risultati in aree non previste.
Revisione operativa e revisione di business
Il team operativo può rivedere gli alert ogni settimana; il business deve valutare ogni mese valore, adozione e costo; l’organo di governance dovrebbe rivedere ogni trimestre rischi, fornitori e continuità. Adegua la frequenza all’impatto del sistema.
Conserva la documentazione nella documentazione tecnica dell’IA: metriche, versioni, incidenti, valutazioni e decisioni. La tracciabilità migliora l’operatività e rende più facile dimostrare di avere il controllo.
Quando correggere, riaddestrare o ritirare
Correggi l’integrazione quando il problema è nei dati o nel flusso. Riaddestra o cambia le istruzioni quando la relazione appresa non rappresenta più la realtà. Ritira il sistema quando non porta più valore, il rischio non è mitigabile o esiste un’alternativa più semplice. Anche tenerlo in piedi per inerzia ha un costo.
Esempio di cruscotto minimo
- Servizio: disponibilità, p95 della latenza ed errori.
- Dati: record validi, campi critici e ritardo.
- Qualità: accettazione, correzione e guasti critici.
- Business: risultato rispetto alla baseline.
- Costo: costo per attività utile e per cliente.
- Rischio: incidenti, reclami e differenze per segmento.
Per ogni indicatore documenta definizione, formula, fonte, frequenza, soglia e proprietario. Non cambiare una definizione senza versionarla. Se “risposta corretta” dipende da una valutazione umana, scrivi una guida e verifica l’accordo tra i revisori.
Domande frequenti sul monitoraggio
Quanti indicatori servono?
Comincia dal minimo che rileva la perdita di servizio, di qualità, di valore e di controllo. Aggiungi metriche quando una decisione le richiede; un pannello enorme può nascondere ciò che è critico.
Ogni peggioramento impone di riaddestrare?
No. Può dipendere dall’integrazione, dai dati, dalle istruzioni, dal comportamento dell’utente o da un cambio di obiettivo. Indaga la causa prima di modificare il modello.
Per quanto tempo conservare i log?
Dipende dal rischio, dagli obblighi e dalla necessità di indagare. Definisci conservazione, accesso e minimizzazione; registrare tutto per sempre aumenta esposizione e costi.
Come stiamo osservando la qualità e il valore di I3OS
In I3OS non consideriamo finito un risultato quando il modello risponde. Stiamo osservando tempo di esecuzione, correzioni, interventi umani, qualità ed effetto sul cliente per capire quali capacità si possono ampliare e quali hanno bisogno di aggiustamenti. Questa disciplina ci aiuta a non confondere l’attività generata con il valore creato e a mantenere l’autonomia proporzionata alle evidenze disponibili.
Se hai bisogno di attivare osservabilità e controlli per i tuoi sistemi di IA, in Impulsa3 ti aiutiamo a definire metriche, alert e processi di miglioramento continuo.