Dizionario AI › Fondamenti AI
Test Set Contamination
La contaminazione dei dati di test si verifica quando i contenuti usati per valutare un modello AI erano già presenti, in tutto o in parte, nei dati con cui il modello è stato addestrato. In questo caso il modello non sta dimostrando una vera capacità di generalizzazione, ma sta semplicemente riproducendo informazioni già viste, gonfiando artificialmente il punteggio ottenuto. È uno dei problemi più insidiosi nella valutazione dei modelli linguistici di grande scala.
Può accadere perché i dati di addestramento, raccolti da fonti pubbliche molto ampie come il web, includono involontariamente gli stessi testi usati come benchmark. Per individuarla si confrontano i testi del set di valutazione con quelli del set di addestramento cercando sovrapposizioni dirette o parziali. Quando la contaminazione viene rilevata, i punteggi ottenuti su quel benchmark vengono considerati inaffidabili.
È un tema centrale quando si pubblicano nuovi modelli e si comunicano i loro risultati sui benchmark pubblici, perché un punteggio gonfiato dalla contaminazione può indurre a scelte sbagliate su quale modello adottare. Per questo motivo si stanno diffondendo benchmark tenuti privati o rinnovati periodicamente, proprio per ridurre il rischio che finiscano nei dati di addestramento futuri.
È un problema emerso con la crescita smisurata dei dataset usati per addestrare i modelli linguistici, quando è diventato difficile garantire che i testi di valutazione restassero completamente separati da quelli di addestramento.
Dalla nostra rete
Kaimaki Web: Websites That Win Customers
Custom websites, web apps and digital marketing for growing businesses.
Vai su kaimakiweb.com →Dal blog di Agora Intelligence
📱 Scarica l'app Android (beta) iOS in arrivo
Dì quello che intendi. Ottieni quello che ti serve.
Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.