AI Dictionary › Fondamenti AI

Missing values

Valori mancanti (Missing Values)

Missing values are the empty or absent cells in a dataset, points where an observation has no recorded data for a particular feature: a customer who did not report their age, a sensor that stopped working for a few minutes, a field left blank on a form. They are one of the most common and insidious problems in real-world machine learning practice, because most algorithms do not know how to handle them directly.

Definition

What it is

Missing values are the empty or absent cells in a dataset, points where an observation has no recorded data for a particular feature: a customer who did not report their age, a sensor that stopped working for a few minutes, a field left blank on a form. They are one of the most common and insidious problems in real-world machine learning practice, because most algorithms do not know how to handle them directly.

How it works

Before even deciding how to treat them, it is important to understand why they are missing: a value can be missing completely at random, or its absence can depend on other observed variables, or even on the value itself that is missing, for example people with very high incomes who tend not to report it. The most common handling strategies are removing rows or columns with too many missing values, when they are few and not systematic, and imputation, replacing absent values with plausible estimates, ranging from the simple mean or median of the variable to more sophisticated predictive models that estimate the missing value based on other available features.

Applications

In applied AI, handling missing values is an almost mandatory step before training: many algorithms, like neural networks and support vector machines, simply fail if given incomplete data, while some tree-based models, like certain gradient boosting implementations, can handle them natively. It is a particularly delicate issue in healthcare, where a missing data point may hide a relevant clinical pattern, and in surveys, where the non-response rate always needs careful assessment.

History & etymology

The systematic study of missing data belongs to late twentieth-century statistics, with a foundational contribution from the work of Donald Rubin, who in 1976 formalized the distinction between the different mechanisms by which data can be missing, a classification still at the basis of how statisticians and data scientists reason about the problem today. With the spread of machine learning on real, often incomplete data collected under uncontrolled conditions, handling missing values became an essential practical skill for anyone working with data.

Definizione (italiano)

I valori mancanti sono le celle vuote o assenti in un dataset, punti in cui un'osservazione non ha un dato registrato per una particolare caratteristica: un cliente che non ha indicato l'età, un sensore che ha smesso di funzionare per qualche minuto, un campo lasciato vuoto in un modulo. Sono uno dei problemi più comuni e più insidiosi nella pratica reale del machine learning, perché la maggior parte degli algoritmi non sa come gestirli direttamente.

Prima ancora di decidere come trattarli, è importante capire perché mancano: un valore può mancare in modo completamente casuale, oppure la sua assenza può dipendere da altre variabili osservate, o persino dal valore stesso che manca, per esempio le persone con redditi molto alti che tendono a non dichiararlo. Le strategie di gestione più comuni sono l'eliminazione delle righe o colonne con troppi valori mancanti, quando sono poche e non sistematiche, e l'imputazione, cioè la sostituzione dei valori assenti con stime plausibili, che vanno dalla semplice media o mediana della variabile a modelli predittivi più sofisticati che stimano il valore mancante sulla base delle altre caratteristiche disponibili.

Nell'AI applicata la gestione dei valori mancanti è un passaggio quasi obbligato prima dell'addestramento: molti algoritmi, come le reti neurali e le support vector machine, falliscono semplicemente se ricevono dati incompleti, mentre alcuni modelli basati su alberi, come alcune implementazioni di gradient boosting, sanno gestirli nativamente. È un tema particolarmente delicato in ambito sanitario, dove un dato mancante può nascondere un pattern clinico rilevante, e in survey e sondaggi, dove il tasso di mancata risposta va sempre valutato con attenzione.

Lo studio sistematico dei dati mancanti appartiene alla statistica del secondo Novecento, con un contributo fondamentale del lavoro di Donald Rubin, che nel 1976 formalizzò la distinzione tra i diversi meccanismi con cui i dati possono mancare, una classificazione ancora oggi alla base di come statistici e data scientist ragionano sul problema. Con la diffusione del machine learning su dati reali, spesso incompleti e raccolti in condizioni non controllate, la gestione dei valori mancanti è diventata una competenza pratica indispensabile per chiunque lavori con i dati.

Related terms

More in Fondamenti AI

Put it into practice

From our network

INDACO TMS — Transport Management for European Logistics

Shipment tracking, multi-carrier EDI and automated invoicing in one cloud platform. Invoices generated in under 10 seconds.

Visit indacotms.com →

From the Agora Intelligence blog

More on agora-intelligence.com →

📱 Download the Android app (beta) iOS coming soon

Say what you mean. Get what you need.

Grace Certified — the AI coach that trains and certifies your prompt engineering — by Agora Intelligence.