Dizionario AI › Fondamenti AI
Speech-to-Text (and Text-to-Speech)
Lo speech-to-text (STT) è la tecnologia che converte il parlato in testo scritto; il text-to-speech (TTS) fa il percorso inverso, generando voce sintetica dal testo. Insieme costituiscono l'interfaccia vocale dell'intelligenza artificiale.
I sistemi moderni, Whisper di OpenAI per la trascrizione, le voci neurali di ElevenLabs e dei grandi provider per la sintesi, hanno raggiunto qualità quasi umana: trascrivono riunioni con punteggiatura corretta, riconoscono decine di lingue e producono voci naturali con intonazione ed emozione.
Gli usi professionali sono immediati: verbalizzazione automatica di riunioni, sottotitolazione, dettatura di documenti, assistenti vocali, doppiaggio multilingua e accessibilità. Combinati con un LLM, permettono conversazioni interamente vocali con l'AI, parli, il modello capisce, risponde a voce.
Dalla nostra rete
AGORÀ Intelligence: Enterprise AI Governance Platform
Govern AI at scale: policies, adoption and measurable results on your data. Built for boards and C-suite.
Vai su agora-intelligence.com →Dal blog di Agora Intelligence
📱 Scarica l'app Android (beta) iOS in arrivo
Dì quello che intendi. Ottieni quello che ti serve.
Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.