Dizionario AI › Fondamenti AI
Imbalanced data
I dati sbilanciati si hanno quando, in un problema di classificazione, le classi da prevedere non sono rappresentate in proporzioni simili nel dataset: le frodi rispetto alle transazioni legittime sono tipicamente meno dell'uno per cento, i guasti di un macchinario rispetto al normale funzionamento sono rari, le malattie rare rispetto ai casi sani sono una minoranza netta. È una situazione estremamente comune nei problemi reali e rappresenta una delle insidie più frequenti nella pratica del machine learning.
Il problema principale è che un modello addestrato ingenuamente su dati sbilanciati tende a favorire la classe maggioritaria, perché farlo minimizza l'errore complessivo: un classificatore che prevede sempre non è una frode raggiungerebbe il 99 per cento di accuratezza su un dataset con l'1 per cento di frodi, pur essendo completamente inutile per lo scopo per cui è stato costruito. Per questo, con dati sbilanciati, l'accuratezza da sola è una metrica fuorviante, e si preferiscono precisione, richiamo, F1-score o l'area sotto la curva ROC, che riflettono meglio le prestazioni sulla classe minoritaria, quella quasi sempre più interessante da individuare correttamente.
Le tecniche per affrontare lo sbilanciamento agiscono su due fronti: a livello di dati, attraverso l'oversampling, che duplica o genera artificialmente nuovi esempi della classe minoritaria, tecniche come SMOTE ne sono un esempio noto, o l'undersampling, che riduce gli esempi della classe maggioritaria; a livello di algoritmo, assegnando pesi diversi agli errori commessi sulle diverse classi durante l'addestramento, in modo da penalizzare più severamente gli errori sulla classe rara. È un tema centrale in rilevamento frodi, diagnostica medica, manutenzione predittiva e moderazione dei contenuti, dove l'evento da individuare è quasi sempre raro rispetto alla normalità.
La consapevolezza del problema dello sbilanciamento delle classi appartiene alla statistica applicata e al pattern recognition di lunga data, ma diventa un tema di ricerca sistematico nella comunità del machine learning a partire dalla fine degli anni '90 e dai primi anni 2000, quando la crescente applicazione di modelli predittivi a problemi reali con classi fortemente rare, come la rilevazione di frodi bancarie, rese evidente quanto le metriche tradizionali potessero ingannare senza un trattamento specifico dello sbilanciamento.
Dalla nostra rete
AGORÀ Intelligence: Enterprise AI Governance Platform
Govern AI at scale: policies, adoption and measurable results on your data. Built for boards and C-suite.
Vai su agora-intelligence.com →Dal blog di Agora Intelligence
📱 Scarica l'app Android (beta) iOS in arrivo
Dì quello che intendi. Ottieni quello che ti serve.
Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.