语音转文本speech-to-text
语音转文本是把人说的话转换成文字的技术,也称自动语音识别。
3篇文章
最近提及 语音转文本是分析录制或实时输入的语音并将其转写成文字的技术,也称自动语音识别(ASR),与把文字转换成语音的文本转语音技术方向相反。
该技术主要使用以大量语音及对应转写文本训练的神经网络模型,用于会议记录、字幕生成、语音助手和语音命令等场景,部分模型还能输出逐词时间戳。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
涉及该条目的文章
输入方面,这套方案使用在Mac上本地运行的Whisper语音识别,并借助Metal加速。
训练数据是用于开发模型的材料;语音识别将口语转换为文字,其错误率反映系统在这一转换过程中出错的频率。