Dizionario AI › Fondamenti AI
Tokenization
La tokenizzazione è il processo con cui un testo viene spezzato in unità minime, chiamate token, che il modello può elaborare numericamente. Un token non coincide sempre con una parola: può essere una parola intera, una sillaba, un singolo carattere o un frammento come un suffisso. Immagina di tagliare una collana in tante perline: ogni perlina è un token, e il modello lavora contando e ordinando queste perline anziché leggere il filo continuo. Algoritmi diffusi come Byte-Pair Encoding costruiscono un vocabolario di frammenti ricorrenti, così da rappresentare anche parole rare o inventate componendole da pezzi noti. Ogni token viene poi convertito in un numero identificativo, il ponte tra linguaggio umano e calcolo.
Capire la tokenizzazione è pratico: il costo delle API e i limiti di contesto si misurano in token, non in parole. Una lingua ricca di parole lunghe o composte consuma più token, e testi con molti simboli o codice possono frammentarsi in modo inatteso, influenzando prezzo e prestazioni.
Dalla nostra rete
AGORÀ Intelligence: Enterprise AI Governance Platform
Govern AI at scale: policies, adoption and measurable results on your data. Built for boards and C-suite.
Vai su agora-intelligence.com →Dal blog di Agora Intelligence
📱 Scarica l'app Android (beta) iOS in arrivo
Dì quello che intendi. Ottieni quello che ti serve.
Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.