Dizionario AI › Fondamenti AI
Outlier
Un outlier, o valore anomalo, è un'osservazione che si discosta in modo marcato dal comportamento tipico del resto del dataset: una transazione di importo mille volte superiore alla media, un'età registrata come 150 anni, un sensore che per un istante segnala un valore fisicamente impossibile. Può essere un errore di misurazione o inserimento dati, oppure un evento raro ma reale e potenzialmente molto informativo.
Esistono diversi metodi per individuare gli outlier, e la scelta dipende da quanto si conosce della distribuzione dei dati. I metodi statistici classici usano soglie basate sulla deviazione standard o sull'intervallo interquartile, segnalando come anomalo tutto ciò che si trova troppo lontano dal centro della distribuzione. I metodi basati sulla densità o sulla distanza, come l'isolation forest o il local outlier factor, individuano i punti che si trovano in regioni scarsamente popolate dello spazio delle caratteristiche rispetto ai loro vicini. La decisione su cosa fare una volta individuato un outlier, se rimuoverlo, correggerlo o studiarlo a parte, dipende sempre dal contesto: in un dataset di prezzi immobiliari un valore estremo può essere un errore, in un sistema antifrode è spesso proprio ciò che si sta cercando.
Nell'AI applicata la gestione degli outlier è cruciale per due ragioni opposte: da un lato molti algoritmi, come la regressione lineare o il k-means, sono sensibili ai valori estremi e possono essere distorti significativamente da pochi outlier non trattati; dall'altro, in ambiti come il rilevamento frodi, la sicurezza informatica e il controllo qualità industriale, l'obiettivo primario del sistema è proprio identificare gli outlier, che rappresentano l'evento raro da catturare.
Il termine outlier, letteralmente ciò che giace fuori, out-lier, entra nel vocabolario statistico nell'Ottocento, quando matematici e astronomi iniziarono a occuparsi sistematicamente di come trattare osservazioni sperimentali che si discostavano nettamente dalle altre misurazioni. La statistica del Novecento ha poi sviluppato criteri formali sempre più raffinati per distinguere un vero errore di misurazione da un'osservazione rara ma genuina, una distinzione che resta al cuore della pratica del machine learning ancora oggi.
Dalla nostra rete
Kaimaki Web: Websites That Win Customers
Custom websites, web apps and digital marketing for growing businesses.
Vai su kaimakiweb.com →Dal blog di Agora Intelligence
📱 Scarica l'app Android (beta) iOS in arrivo
Dì quello che intendi. Ottieni quello che ti serve.
Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.