Dizionario AI › Prompting
Il prompt caching è una funzionalità offerta da diverse API che memorizza la porzione iniziale e stabile di un prompt, istruzioni di sistema, documenti di riferimento, esempi, così che nelle chiamate successive non venga rielaborata da zero, riducendo drasticamente costo e latenza. Esempio: un assistente di supporto ha 5.000 token di istruzioni e knowledge base identici a ogni richiesta; con il caching, quella parte viene elaborata una volta e riutilizzata, e paghi a tariffa ridotta solo la parte variabile (la domanda dell'utente). Il risparmio può superare il 90% sui token in cache.
Usalo quando molte chiamate condividono un prefisso lungo e invariato: chatbot con lunghe istruzioni, elaborazione di documenti ripetuta, few-shot con molti esempi fissi. Struttura il prompt mettendo la parte stabile all'inizio e quella variabile alla fine, per massimizzare la porzione cacheabile.
Dalla nostra rete
Magellano GPS: Fleet Tracking Made Simple
Real-time GPS tracking, remote engine lock, fuel and CO₂ reporting for your fleet.
Vai su magellanogps.com →Dal blog di Agora Intelligence
📱 Scarica l'app Android (beta) iOS in arrivo
Dì quello che intendi. Ottieni quello che ti serve.
Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.