Dizionario AI › Fondamenti AI
Un benchmark è un test standardizzato usato per misurare e confrontare le prestazioni dei modelli di intelligenza artificiale. Esempi noti includono MMLU (conoscenza generale multidisciplinare), HumanEval (scrittura di codice), GSM8K (matematica) e SWE-bench (bug reali di ingegneria del software).
I benchmark permettono confronti oggettivi tra modelli, ma vanno letti con senso critico: un modello può essere ottimizzato per "vincere" i benchmark senza essere realmente migliore nell'uso quotidiano (fenomeno detto benchmark contamination, quando i test finiscono nei dati di addestramento). Le classifiche cambiano a ogni rilascio.
Per chi sceglie un modello per uso aziendale, i benchmark sono un punto di partenza, ma la prova sul proprio caso d'uso reale, con i propri prompt e dati, resta l'unico test decisivo.
Dalla nostra rete
AGORÀ Intelligence: Enterprise AI Governance Platform
Govern AI at scale: policies, adoption and measurable results on your data. Built for boards and C-suite.
Vai su agora-intelligence.com →Dal blog di Agora Intelligence
📱 Scarica l'app Android (beta) iOS in arrivo
Dì quello che intendi. Ottieni quello che ti serve.
Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.