マルチモーダルmultimodal

マルチモーダルは、AIがテキスト・画像・音声など異なる種類のデータを組み合わせて処理する性質を指す。

記事2本
最終言及

マルチモーダルは、AIモデルがテキスト、画像、音声など、2種類以上のデータを入力または生成する性質を指す。テキストなど1種類のデータだけを扱う単一モダリティーのモデルとは異なる。

2023年ごろ、GPT-4やGeminiなど主要な大規模言語モデルが画像入力に対応したことで広く使われる言葉になった。画面を認識してマウスやキーボードでコンピューターを操作するコンピューター操作モデルも、画面画像とテキストの指示を併せて処理する。

この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。

この項目を扱った記事

2つのモデルの間でプレーンテキストだけをやり取りすると空間的な情報が失われるおそれがあるため、両者の間をマルチモーダルな豊かなインターフェースでつなぐことが目標です。

マルチモーダルのレスポンスは、入れ子のパスをハードコードせず を確認して処理する。


© 2026 AIPOST. All rights reserved.

AIPOSTは、AIの活用法、AIセキュリティ、性能、起業、ヘルスケア、倫理、業界ニュースを扱うAI専門メディアです。会員登録なしで利用でき、個人情報の取り扱いはプライバシーポリシーで確認できます。