Whisper

Whisperは、OpenAIが2022年に公開した、音声の文字起こしや英語への翻訳を行う音声認識モデルである。

記事5本
最終言及

Whisperは、OpenAIが2022年に公開した音声認識モデルである。複数の言語の音声を文字に起こし、音声を英語に翻訳できる。large-v3や、文字起こしを高速化したturboなどのモデルがある。

モデルの重みとコードが公開されており、手元のコンピューターでも実行できる。

この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。

この項目を扱った記事

Whisper-1がタイムスタンプ付きで音声を書き起こし、書き起こしを文ごとに分け、各行を言い間違い、言い出しの失敗、言い直し、編集の合図、採用のいずれかに分類します。

入力には、Mac上でローカルに動くWhisperの音声認識を使います。

リポジトリは、音声を文字に変換するWhisperまたはFaster-Whisperと、文ごとに行うJevの判定を組み合わせます。

Google AI Studioには、Whisper、Friendly、Narration、Promote、Podcastなどのスタイルがあります。

音声の文字起こしでは、Apple Silicon上でモデルを動かすために使用したフレームワーク、MLXを通じてWhisperを実行しました。


© 2026 AIPOST. All rights reserved.

AIPOSTは、AIの活用法、AIセキュリティ、性能、起業、ヘルスケア、倫理、業界ニュースを扱うAI専門メディアです。会員登録なしで利用でき、個人情報の取り扱いはプライバシーポリシーで確認できます。