Dizionario AI › Fondamenti AI

Latenza (Latency)

Latency

La latenza è il tempo che intercorre tra l'invio di un prompt e la ricezione della risposta del modello. Si misura tipicamente in due modi: il tempo al primo token (quanto aspetti prima che la risposta inizi ad apparire) e il tempo totale di generazione.

Definizione

La latenza dipende da più fattori: dimensione del modello (i modelli grandi sono più lenti), lunghezza del prompt e della risposta, carico dei server e tecniche di ottimizzazione dell'inferenza. Per questo i provider offrono spesso più versioni: un modello potente ma lento per i compiti complessi, uno rapido per le interazioni in tempo reale.

Nella progettazione di prodotti AI, la latenza è un fattore di UX decisivo: un chatbot per il customer service deve rispondere in 1-2 secondi, un'analisi documentale può permettersi 30 secondi. Anche l'efficienza del prompt aiuta: prompt più densi generano risposte più rapide.

Termini correlati

Altri termini in Fondamenti AI

Mettilo alla prova

Dalla nostra rete

Magellano GPS: Fleet Tracking Made Simple

Real-time GPS tracking, remote engine lock, fuel and CO₂ reporting for your fleet.

Vai su magellanogps.com →

Dal blog di Agora Intelligence

Altro su agora-intelligence.com →

📱 Scarica l'app Android (beta) iOS in arrivo

Dì quello che intendi. Ottieni quello che ti serve.

Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.