Dizionario AI › Fondamenti AI
Latency
La latenza è il tempo che intercorre tra l'invio di un prompt e la ricezione della risposta del modello. Si misura tipicamente in due modi: il tempo al primo token (quanto aspetti prima che la risposta inizi ad apparire) e il tempo totale di generazione.
La latenza dipende da più fattori: dimensione del modello (i modelli grandi sono più lenti), lunghezza del prompt e della risposta, carico dei server e tecniche di ottimizzazione dell'inferenza. Per questo i provider offrono spesso più versioni: un modello potente ma lento per i compiti complessi, uno rapido per le interazioni in tempo reale.
Nella progettazione di prodotti AI, la latenza è un fattore di UX decisivo: un chatbot per il customer service deve rispondere in 1-2 secondi, un'analisi documentale può permettersi 30 secondi. Anche l'efficienza del prompt aiuta: prompt più densi generano risposte più rapide.
Dalla nostra rete
Magellano GPS: Fleet Tracking Made Simple
Real-time GPS tracking, remote engine lock, fuel and CO₂ reporting for your fleet.
Vai su magellanogps.com →Dal blog di Agora Intelligence
📱 Scarica l'app Android (beta) iOS in arrivo
Dì quello che intendi. Ottieni quello che ti serve.
Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.