语音转文本speech-to-text

语音转文本是把人说的话转换成文字的技术,也称自动语音识别。

3篇文章
最近提及

语音转文本是分析录制或实时输入的语音并将其转写成文字的技术,也称自动语音识别(ASR),与把文字转换成语音的文本转语音技术方向相反。

该技术主要使用以大量语音及对应转写文本训练的神经网络模型,用于会议记录、字幕生成、语音助手和语音命令等场景,部分模型还能输出逐词时间戳。

本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。

涉及该条目的文章

按住一键通按键说话,语音转文本功能会把命令转成文字。

输入方面,这套方案使用在Mac上本地运行的Whisper语音识别,并借助Metal加速。

训练数据是用于开发模型的材料;语音识别将口语转换为文字,其错误率反映系统在这一转换过程中出错的频率。


© 2026 AIPOST. All rights reserved.

AIPOST是一家报道AI应用方法、AI安全、性能、创业、健康、伦理与行业资讯的AI专业媒体。无需注册即可使用,个人信息的处理方式请参阅隐私政策。