Dizionario AI › Fondamenti AI

Interpretabilità

Interpretability

L'interpretabilità è la misura in cui è possibile capire, a livello meccanico e interno, perché un modello AI produce un determinato output, osservando cosa accade dentro la rete neurale durante il calcolo. Va distinta dalla explainability, che si concentra piuttosto sul fornire una spiegazione comprensibile all'utente finale del risultato: l'interpretabilità guarda dentro il modello, la explainability guarda al risultato che il modello espone verso l'esterno.

Definizione

Come funziona

Le tecniche di interpretabilità cercano di mappare il comportamento dei singoli neuroni, strati o gruppi di parametri a concetti riconoscibili: quali circuiti interni si attivano per un certo tipo di input, quali componenti contribuiscono maggiormente a una decisione specifica, se esistono rappresentazioni interne che corrispondono a idee o fatti verificabili dall'esterno. È un'area di ricerca tecnicamente molto più complessa della explainability, perché i modelli moderni hanno miliardi di parametri le cui interazioni non sono progettate per essere leggibili dall'uomo.

Applicazioni

Nell'AI moderna l'interpretabilità è centrale per la ricerca sulla sicurezza dei modelli di frontiera: capire i meccanismi interni permette di individuare comportamenti latenti prima che si manifestino in produzione, verificare se un modello sta effettivamente ragionando o semplicemente memorizzando pattern, e intervenire chirurgicamente su specifiche capacità senza dover riaddestrare l'intero sistema. È anche uno strumento diagnostico per il debug di comportamenti anomali nei grandi modelli linguistici.

Storia ed etimologia

Il termine ha una storia più lunga della explainability nel campo del machine learning classico, ma ha acquisito un significato più specifico e tecnico con la nascita del filone di ricerca noto come mechanistic interpretability, sviluppatosi in modo intensivo a partire dai primi anni 2020 attorno ai grandi modelli transformer.

Termini correlati

Altri termini in Fondamenti AI

Mettilo alla prova

Dalla nostra rete

HSE Genius: AI for Safety Data Sheets

Extract SDS data, H phrases and ECHA compliance checks in seconds, powered by AI.

Vai su hsegenius.com →

Dal blog di Agora Intelligence

Altro su agora-intelligence.com →

📱 Scarica l'app Android (beta) iOS in arrivo

Dì quello che intendi. Ottieni quello che ti serve.

Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.