Prevod reči na text (STT)
Speech-to-Text (STT), tiež známe ako Automatic Speech Recognition (ASR), prevádza audio s rečou na textový prepis. Moderné STT systémy používajú neurónové siete – najvýznamnejším je Whisper od OpenAI, ktorý podporuje 99 jazykov s vysokou presnosťou pri náročných podmienkach, akcenty aj technickú terminológiu.
Komerčné služby ponúkajú Amazon Transcribe, Google Speech-to-Text, Azure Cognitive Services a DeepSpeech. Enterprise use cases zahŕňajú prepis stretnutí, call-center analýzy a prístupnostné funkcie.
Prevod textu na reč (TTS)
Text-to-Speech (TTS) syntetizuje prirodzene znejúcu reč z textu. Moderné neural TTS systémy ako ElevenLabs, OpenAI TTS, Google WaveNet a Microsoft Neural TTS produkujú reč, ktorá je často nerozoznateľná od ľudskej.
Voice cloning je pokročilá funkcia, ktorá vytvára syntetickú reč so špecifickým hlasovým odtlačkom konkrétnej osoby – a s tým súvisiace etické a bezpečnostné otázky ohľadne možnosti zneužitia (hlasové deepfake).
Multimodálne aplikácie
Kombinovanie STT a TTS umožňuje plnohodnotné hlasové rozhrania pre AI asistentov. Voice AI agenti používajú STT na porozumenie používateľom, LLM na generovanie odpovede a TTS na hlasové doručenie odpovede, čím dosahujú latenciu pod 1 sekundu v realtimových konverzáciách.