マルチモーダルmultimodal
マルチモーダルは、AIがテキスト・画像・音声など異なる種類のデータを組み合わせて処理する性質を指す。
記事2本
最終言及 マルチモーダルは、AIモデルがテキスト、画像、音声など、2種類以上のデータを入力または生成する性質を指す。テキストなど1種類のデータだけを扱う単一モダリティーのモデルとは異なる。
2023年ごろ、GPT-4やGeminiなど主要な大規模言語モデルが画像入力に対応したことで広く使われる言葉になった。画面を認識してマウスやキーボードでコンピューターを操作するコンピューター操作モデルも、画面画像とテキストの指示を併せて処理する。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。
この項目を扱った記事
マルチモーダルのレスポンスは、入れ子のパスをハードコードせず を確認して処理する。