Whisper
Whisperは、OpenAIが2022年に公開した、音声の文字起こしや英語への翻訳を行う音声認識モデルである。
記事5本
最終言及 Whisperは、OpenAIが2022年に公開した音声認識モデルである。複数の言語の音声を文字に起こし、音声を英語に翻訳できる。large-v3や、文字起こしを高速化したturboなどのモデルがある。
モデルの重みとコードが公開されており、手元のコンピューターでも実行できる。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。
この項目を扱った記事
入力には、Mac上でローカルに動くWhisperの音声認識を使います。
リポジトリは、音声を文字に変換するWhisperまたはFaster-Whisperと、文ごとに行うJevの判定を組み合わせます。
Google AI Studioには、Whisper、Friendly、Narration、Promote、Podcastなどのスタイルがあります。
音声の文字起こしでは、Apple Silicon上でモデルを動かすために使用したフレームワーク、MLXを通じてWhisperを実行しました。