Dizionario AI › Fondamenti AI

Speech-to-Text (e Text-to-Speech)

Speech-to-Text (and Text-to-Speech)

Lo speech-to-text (STT) è la tecnologia che converte il parlato in testo scritto; il text-to-speech (TTS) fa il percorso inverso, generando voce sintetica dal testo. Insieme costituiscono l'interfaccia vocale dell'intelligenza artificiale.

Definizione

I sistemi moderni, Whisper di OpenAI per la trascrizione, le voci neurali di ElevenLabs e dei grandi provider per la sintesi, hanno raggiunto qualità quasi umana: trascrivono riunioni con punteggiatura corretta, riconoscono decine di lingue e producono voci naturali con intonazione ed emozione.

Gli usi professionali sono immediati: verbalizzazione automatica di riunioni, sottotitolazione, dettatura di documenti, assistenti vocali, doppiaggio multilingua e accessibilità. Combinati con un LLM, permettono conversazioni interamente vocali con l'AI, parli, il modello capisce, risponde a voce.

Termini correlati

Altri termini in Fondamenti AI

Mettilo alla prova

Dalla nostra rete

AGORÀ Intelligence: Enterprise AI Governance Platform

Govern AI at scale: policies, adoption and measurable results on your data. Built for boards and C-suite.

Vai su agora-intelligence.com →

Dal blog di Agora Intelligence

Altro su agora-intelligence.com →

📱 Scarica l'app Android (beta) iOS in arrivo

Dì quello che intendi. Ottieni quello che ti serve.

Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.