Dizionario AI › Modelli AI
La KV cache è una tecnica di ottimizzazione usata durante la generazione di testo con modelli basati su attenzione, che consiste nel salvare e riutilizzare i vettori chiave (key) e valore (value) calcolati per i token già elaborati, invece di ricalcolarli ogni volta che si genera un nuovo token. Riduce drasticamente la quantità di calcolo ripetuto necessario durante la generazione sequenziale del testo.
Quando un modello genera testo un token alla volta, per calcolare il nuovo token deve far interagire, tramite attenzione, la sua rappresentazione con quella di tutti i token precedenti nella sequenza. Senza memorizzazione, questo richiederebbe di ricalcolare da zero le chiavi e i valori di tutti i token già generati a ogni singolo nuovo token prodotto. Con la KV cache, questi vettori vengono calcolati una sola volta per ciascun token e conservati in memoria, permettendo di riutilizzarli direttamente nei passi successivi.
È una componente essenziale di ogni sistema di inferenza efficiente per modelli linguistici di grandi dimensioni: determina in larga parte la quantità di memoria necessaria per servire richieste con contesti lunghi e influenza direttamente la latenza e il throughput dei sistemi di generazione di testo. Tecniche come la condivisione delle chiavi e dei valori tra più teste di attenzione sono state sviluppate proprio per ridurre l'impronta di memoria della KV cache nei modelli più recenti.
Il nome deriva direttamente dagli elementi che vengono memorizzati, le chiavi (key) e i valori (value) del meccanismo di attenzione, ed è un accorgimento diventato centrale con la diffusione su larga scala dei modelli linguistici generativi basati su architetture ad attenzione.
Dalla nostra rete
Magellano GPS: Fleet Tracking Made Simple
Real-time GPS tracking, remote engine lock, fuel and CO₂ reporting for your fleet.
Vai su magellanogps.com →Dal blog di Agora Intelligence
📱 Scarica l'app Android (beta) iOS in arrivo
Dì quello che intendi. Ottieni quello che ti serve.
Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.