Dizionario AI › Fondamenti AI
Evaluation metrics
Le metriche di valutazione sono le misure numeriche usate per quantificare quanto bene un modello di machine learning svolge il proprio compito, permettendo di confrontare modelli diversi, scegliere il migliore e decidere se le prestazioni raggiunte sono sufficienti per un uso reale. Senza una metrica condivisa, dire che un modello funziona bene è un'affermazione vaga e non verificabile.
La scelta della metrica dipende dal tipo di problema. Per la regressione si usano misure come l'errore quadratico medio o l'errore assoluto medio, che quantificano quanto le previsioni si discostano dai valori reali. Per la classificazione si usano accuratezza, precisione, richiamo, F1-score e area sotto la curva ROC, ciascuna sensibile a un aspetto diverso degli errori commessi. Non esiste una metrica universalmente migliore: la scelta dipende da cosa conta davvero per il problema specifico, per esempio se è peggio un falso positivo o un falso negativo.
Nell'AI applicata le metriche guidano ogni decisione tecnica: quale modello mettere in produzione, quando un aggiornamento rappresenta davvero un miglioramento, quando un sistema si è degradato nel tempo e va riaddestrato. Sono anche uno strumento di comunicazione tra i team tecnici e chi prende decisioni di business, che raramente comprende i dettagli dell'algoritmo ma può capire se la precisione è salita dall'80 al 90 per cento.
L'uso sistematico di misure quantitative per valutare la qualità di previsioni statistiche appartiene alla statistica del primo Novecento, ma la formalizzazione delle metriche oggi standard nel machine learning si consolida a partire dagli anni '60 e '70, in ambiti come il riconoscimento di pattern e la teoria dell'informazione, per poi diffondersi ampiamente con la crescita della disciplina negli anni '90 e 2000.
Le 7 dimensioni di valutazione e il punteggio 0-100 di Grace sono, a tutti gli effetti, metriche di valutazione applicate alla qualità dei tuoi prompt: gli stessi principi di misurazione oggettiva usati per valutare un modello di machine learning.
Dalla nostra rete
AGORÀ Intelligence: Enterprise AI Governance Platform
Govern AI at scale: policies, adoption and measurable results on your data. Built for boards and C-suite.
Vai su agora-intelligence.com →Dal blog di Agora Intelligence
📱 Scarica l'app Android (beta) iOS in arrivo
Dì quello che intendi. Ottieni quello che ti serve.
Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.