AI Dictionary › Fondamenti AI

Imbalanced data

Dati sbilanciati (Class Imbalance)

Imbalanced data occurs when, in a classification problem, the classes to be predicted are not represented in similar proportions within the dataset: fraud compared to legitimate transactions is typically less than one percent, equipment failures compared to normal operation are rare, rare diseases compared to healthy cases are a clear minority. It is an extremely common situation in real-world problems, and it represents one of the most frequent pitfalls in machine learning practice.

Definition

What it is

Imbalanced data occurs when, in a classification problem, the classes to be predicted are not represented in similar proportions within the dataset: fraud compared to legitimate transactions is typically less than one percent, equipment failures compared to normal operation are rare, rare diseases compared to healthy cases are a clear minority. It is an extremely common situation in real-world problems, and it represents one of the most frequent pitfalls in machine learning practice.

How it works

The main problem is that a model naively trained on imbalanced data tends to favor the majority class, because doing so minimizes overall error: a classifier that always predicts not fraud would achieve 99 percent accuracy on a dataset with 1 percent fraud, while being completely useless for the purpose it was built for. Because of this, with imbalanced data, accuracy alone is a misleading metric, and precision, recall, F1-score or area under the ROC curve are preferred, as they better reflect performance on the minority class, the one almost always more interesting to correctly identify.

Applications

Techniques for addressing imbalance act on two fronts: at the data level, through oversampling, which duplicates or artificially generates new examples of the minority class, techniques like SMOTE being a well-known example, or undersampling, which reduces examples of the majority class; at the algorithm level, by assigning different weights to errors made on different classes during training, so as to penalize errors on the rare class more heavily. It is a central topic in fraud detection, medical diagnostics, predictive maintenance and content moderation, where the event to be identified is almost always rare compared to normality.

History & etymology

Awareness of the class imbalance problem belongs to long-standing applied statistics and pattern recognition, but it became a systematic research topic in the machine learning community starting in the late 1990s and early 2000s, when the growing application of predictive models to real problems with strongly rare classes, such as bank fraud detection, made clear how misleading traditional metrics could be without specific treatment of imbalance.

Definizione (italiano)

I dati sbilanciati si hanno quando, in un problema di classificazione, le classi da prevedere non sono rappresentate in proporzioni simili nel dataset: le frodi rispetto alle transazioni legittime sono tipicamente meno dell'uno per cento, i guasti di un macchinario rispetto al normale funzionamento sono rari, le malattie rare rispetto ai casi sani sono una minoranza netta. È una situazione estremamente comune nei problemi reali, e rappresenta una delle insidie più frequenti nella pratica del machine learning.

Il problema principale è che un modello addestrato ingenuamente su dati sbilanciati tende a favorire la classe maggioritaria, perché farlo minimizza l'errore complessivo: un classificatore che prevede sempre non è una frode raggiungerebbe il 99 per cento di accuratezza su un dataset con l'1 per cento di frodi, pur essendo completamente inutile per lo scopo per cui è stato costruito. Per questo, con dati sbilanciati, l'accuratezza da sola è una metrica fuorviante, e si preferiscono precisione, richiamo, F1-score o l'area sotto la curva ROC, che riflettono meglio le prestazioni sulla classe minoritaria, quella quasi sempre più interessante da individuare correttamente.

Le tecniche per affrontare lo sbilanciamento agiscono su due fronti: a livello di dati, attraverso l'oversampling, che duplica o genera artificialmente nuovi esempi della classe minoritaria, tecniche come SMOTE ne sono un esempio noto, o l'undersampling, che riduce gli esempi della classe maggioritaria; a livello di algoritmo, assegnando pesi diversi agli errori commessi sulle diverse classi durante l'addestramento, in modo da penalizzare più severamente gli errori sulla classe rara. È un tema centrale in rilevamento frodi, diagnostica medica, manutenzione predittiva e moderazione dei contenuti, dove l'evento da individuare è quasi sempre raro rispetto alla normalità.

La consapevolezza del problema dello sbilanciamento delle classi appartiene alla statistica applicata e al pattern recognition di lunga data, ma diventa un tema di ricerca sistematico nella comunità del machine learning a partire dalla fine degli anni '90 e dai primi anni 2000, quando la crescente applicazione di modelli predittivi a problemi reali con classi fortemente rare, come la rilevazione di frodi bancarie, rese evidente quanto le metriche tradizionali potessero ingannare senza un trattamento specifico dello sbilanciamento.

Related terms

More in Fondamenti AI

Put it into practice

From our network

AGORÀ Intelligence — Enterprise AI Governance Platform

Govern AI at scale: policies, adoption and measurable results on your data. Built for boards and C-suite.

Visit agora-intelligence.com →

From the Agora Intelligence blog

More on agora-intelligence.com →

📱 Download the Android app (beta) iOS coming soon

Say what you mean. Get what you need.

Grace Certified — the AI coach that trains and certifies your prompt engineering — by Agora Intelligence.