Dizionario AI › Modelli AI
Il multi-head attention è una versione potenziata del meccanismo di attenzione in cui il calcolo non viene eseguito una sola volta, ma in parallelo su più "teste" indipendenti, ciascuna con i propri parametri. Ogni testa può imparare a concentrarsi su un tipo diverso di relazione tra i token: una testa può specializzarsi su legami sintattici, un'altra su riferimenti a lunga distanza, un'altra ancora su pattern locali.
Il vettore di rappresentazione di ogni token viene suddiviso in più sottospazi, uno per testa; ciascuna testa esegue il proprio calcolo di attenzione in quel sottospazio ridotto, e i risultati delle diverse teste vengono poi concatenati e proiettati nuovamente nello spazio originale tramite una trasformazione lineare. Il costo computazionale complessivo resta paragonabile a quello di una singola testa a piena dimensione, ma la capacità rappresentativa del modello aumenta.
È una componente presente in praticamente tutte le architetture moderne basate su attenzione, dai modelli linguistici ai sistemi di visione artificiale che elaborano immagini suddivise in patch. Avere più teste consente al modello di catturare simultaneamente diversi tipi di dipendenze nello stesso strato, invece di doverle apprendere in sequenza su strati separati.
Il concetto è stato introdotto insieme al meccanismo di self-attention nell'ambito delle architetture sequence-to-sequence basate solo su attenzione, proposte nella seconda metà degli anni 2010 come alternativa ai modelli ricorrenti e convoluzionali.
Dalla nostra rete
INDACO TMS: Transport Management for European Logistics
Shipment tracking, multi-carrier EDI and automated invoicing in one cloud platform. Invoices generated in under 10 seconds.
Vai su indacotms.com →Dal blog di Agora Intelligence
📱 Scarica l'app Android (beta) iOS in arrivo
Dì quello che intendi. Ottieni quello che ti serve.
Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.