Dizionario AI › Fondamenti AI
Data labeling
Il data labeling, o etichettatura dei dati, è il processo di assegnare a ciascun esempio di un dataset l'informazione che un modello di apprendimento supervisionato dovrà imparare a prevedere: la categoria corretta di un'immagine, il sentimento espresso in una recensione, i confini di un oggetto in una fotografia, la trascrizione corretta di un audio. È il lavoro che rende possibile l'apprendimento supervisionato: senza etichette affidabili, un algoritmo non ha nulla da cui imparare in modo mirato.
L'etichettatura può essere svolta da persone, spesso attraverso piattaforme dedicate che distribuiscono piccoli compiti a grandi gruppi di annotatori, da esperti di dominio quando servono competenze specialistiche, come nella diagnostica medica, o parzialmente automatizzata con tecniche di pre-etichettatura assistita da modelli già esistenti, che un umano poi corregge invece di annotare da zero. La qualità delle etichette è tanto importante quanto la quantità: istruzioni ambigue o annotatori poco formati producono etichette incoerenti, che si traducono direttamente in un modello meno accurato, per quanto sofisticato sia l'algoritmo scelto.
È un passaggio essenziale in computer vision, dove serve etichettare milioni di immagini per addestrare sistemi di riconoscimento, in elaborazione del linguaggio naturale, dove servono testi classificati per sentiment, intento o categoria, e nell'addestramento di sistemi di guida autonoma, dove ogni fotogramma video richiede l'identificazione precisa di veicoli, pedoni e segnaletica. È spesso il collo di bottiglia più costoso e lento di un intero progetto di machine learning supervisionato, tanto che si stima rappresenti una quota significativa del budget complessivo di molti progetti di AI applicata.
Il termine descrive letteralmente l'operazione: apporre un'etichetta, label, a ciascun dato. La pratica di annotare manualmente dati per l'addestramento di sistemi di riconoscimento risale ai primi esperimenti di pattern recognition della seconda metà del Novecento, ma diventa un'industria vera e propria con l'esplosione del deep learning a partire dagli anni 2010, quando la disponibilità di dataset enormi e accuratamente etichettati, come ImageNet, si rivelò determinante quanto la potenza di calcolo per i progressi della visione artificiale.
Ogni scenario professionale di Grace è etichettato con dettaglio, settore, difficoltà e competenze coinvolte, un lavoro editoriale che ricorda da vicino il data labeling: solo con etichette accurate il sistema può proporti scenari davvero pertinenti al tuo percorso.
Dalla nostra rete
INDACO TMS: Transport Management for European Logistics
Shipment tracking, multi-carrier EDI and automated invoicing in one cloud platform. Invoices generated in under 10 seconds.
Vai su indacotms.com →Dal blog di Agora Intelligence
📱 Scarica l'app Android (beta) iOS in arrivo
Dì quello che intendi. Ottieni quello che ti serve.
Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.