音声認識speech-to-text
音声認識は、人の話し声を文字に変換する技術で、自動音声認識とも呼ばれる。
記事4本
最終言及 音声認識は、録音された音声やリアルタイムの音声を解析して文字に起こす技術である。自動音声認識(ASR)とも呼ばれ、文字を音声に変える音声合成とは逆方向の技術にあたる。
大量の音声と書き起こしのデータで学習したニューラルネットワークのモデルが主に使われる。議事録の作成、字幕生成、音声アシスタント、音声コマンドなどに使われ、単語ごとのタイムスタンプを出力するモデルもある。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。
この項目を扱った記事
音声認識エンジンが言い間違いのないテイクを探し、レンダリングエンジンがモーショングラフィックスを作り、ブラウザーが根拠となる画面を集め、音楽ライブラリーが曲を提供し、FFmpegが最終版を組み立てて検査します。
入力には、Mac上でローカルに動くWhisperの音声認識を使います。
音声認識は話された言葉を文字に変換する技術で、その誤り率はシステムが変換をどの程度間違えるかを示します。