Časť obsahu tejto stránky bola vytvorená s pomocou AI
Späť na slovník Umelá inteligencia

Prevod reci na text a textu na rec

Technológie prevodu reči na text (STT) a textu na reč (TTS) umožňujú AI systémom rozumieť hovorenému jazyku a syntetizovať prirodzene znejúcu reč.

Prevod reči na text (STT)

Speech-to-Text (STT), tiež známe ako Automatic Speech Recognition (ASR), prevádza audio s rečou na textový prepis. Moderné STT systémy používajú neurónové siete – najvýznamnejším je Whisper od OpenAI, ktorý podporuje 99 jazykov s vysokou presnosťou pri náročných podmienkach, akcenty aj technickú terminológiu.

Komerčné služby ponúkajú Amazon Transcribe, Google Speech-to-Text, Azure Cognitive Services a DeepSpeech. Enterprise use cases zahŕňajú prepis stretnutí, call-center analýzy a prístupnostné funkcie.

Prevod textu na reč (TTS)

Text-to-Speech (TTS) syntetizuje prirodzene znejúcu reč z textu. Moderné neural TTS systémy ako ElevenLabs, OpenAI TTS, Google WaveNet a Microsoft Neural TTS produkujú reč, ktorá je často nerozoznateľná od ľudskej.

Voice cloning je pokročilá funkcia, ktorá vytvára syntetickú reč so špecifickým hlasovým odtlačkom konkrétnej osoby – a s tým súvisiace etické a bezpečnostné otázky ohľadne možnosti zneužitia (hlasové deepfake).

Multimodálne aplikácie

Kombinovanie STT a TTS umožňuje plnohodnotné hlasové rozhrania pre AI asistentov. Voice AI agenti používajú STT na porozumenie používateľom, LLM na generovanie odpovede a TTS na hlasové doručenie odpovede, čím dosahujú latenciu pod 1 sekundu v realtimových konverzáciách.