Dizionario AI › Fondamenti AI

Benchmark

Un benchmark è un test standardizzato usato per misurare e confrontare le prestazioni dei modelli di intelligenza artificiale. Esempi noti includono MMLU (conoscenza generale multidisciplinare), HumanEval (scrittura di codice), GSM8K (matematica) e SWE-bench (bug reali di ingegneria del software).

Definizione

I benchmark permettono confronti oggettivi tra modelli, ma vanno letti con senso critico: un modello può essere ottimizzato per "vincere" i benchmark senza essere realmente migliore nell'uso quotidiano (fenomeno detto benchmark contamination, quando i test finiscono nei dati di addestramento). Le classifiche cambiano a ogni rilascio.

Per chi sceglie un modello per uso aziendale, i benchmark sono un punto di partenza, ma la prova sul proprio caso d'uso reale, con i propri prompt e dati, resta l'unico test decisivo.

Termini correlati

Altri termini in Fondamenti AI

Mettilo alla prova

Dalla nostra rete

AGORÀ Intelligence: Enterprise AI Governance Platform

Govern AI at scale: policies, adoption and measurable results on your data. Built for boards and C-suite.

Vai su agora-intelligence.com →

Dal blog di Agora Intelligence

Altro su agora-intelligence.com →

📱 Scarica l'app Android (beta) iOS in arrivo

Dì quello che intendi. Ottieni quello che ti serve.

Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.