Dizionario AI › Fondamenti AI

Outlier (Valore anomalo)

Outlier

Un outlier, o valore anomalo, è un'osservazione che si discosta in modo marcato dal comportamento tipico del resto del dataset: una transazione di importo mille volte superiore alla media, un'età registrata come 150 anni, un sensore che per un istante segnala un valore fisicamente impossibile. Può essere un errore di misurazione o inserimento dati, oppure un evento raro ma reale e potenzialmente molto informativo.

Definizione

Come funziona

Esistono diversi metodi per individuare gli outlier, e la scelta dipende da quanto si conosce della distribuzione dei dati. I metodi statistici classici usano soglie basate sulla deviazione standard o sull'intervallo interquartile, segnalando come anomalo tutto ciò che si trova troppo lontano dal centro della distribuzione. I metodi basati sulla densità o sulla distanza, come l'isolation forest o il local outlier factor, individuano i punti che si trovano in regioni scarsamente popolate dello spazio delle caratteristiche rispetto ai loro vicini. La decisione su cosa fare una volta individuato un outlier, se rimuoverlo, correggerlo o studiarlo a parte, dipende sempre dal contesto: in un dataset di prezzi immobiliari un valore estremo può essere un errore, in un sistema antifrode è spesso proprio ciò che si sta cercando.

Applicazioni

Nell'AI applicata la gestione degli outlier è cruciale per due ragioni opposte: da un lato molti algoritmi, come la regressione lineare o il k-means, sono sensibili ai valori estremi e possono essere distorti significativamente da pochi outlier non trattati; dall'altro, in ambiti come il rilevamento frodi, la sicurezza informatica e il controllo qualità industriale, l'obiettivo primario del sistema è proprio identificare gli outlier, che rappresentano l'evento raro da catturare.

Storia ed etimologia

Il termine outlier, letteralmente ciò che giace fuori, out-lier, entra nel vocabolario statistico nell'Ottocento, quando matematici e astronomi iniziarono a occuparsi sistematicamente di come trattare osservazioni sperimentali che si discostavano nettamente dalle altre misurazioni. La statistica del Novecento ha poi sviluppato criteri formali sempre più raffinati per distinguere un vero errore di misurazione da un'osservazione rara ma genuina, una distinzione che resta al cuore della pratica del machine learning ancora oggi.

Termini correlati

Altri termini in Fondamenti AI

Mettilo alla prova

Dalla nostra rete

Kaimaki Web: Websites That Win Customers

Custom websites, web apps and digital marketing for growing businesses.

Vai su kaimakiweb.com →

Dal blog di Agora Intelligence

Altro su agora-intelligence.com →

📱 Scarica l'app Android (beta) iOS in arrivo

Dì quello che intendi. Ottieni quello che ti serve.

Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.