多模态multimodal
多模态指 AI 结合处理文本、图像、音频等不同类型数据的能力。
3篇文章
最近提及 多模态指 AI 模型接收或生成文本、图像、音频等两种及以上类型的数据。它与只处理文本等单一类型数据的单模态模型相区别。
2023 年前后,GPT-4、Gemini 等主要大语言模型开始支持图像输入,这一概念随之普及。通过识别屏幕并操控鼠标和键盘来使用计算机的模型,也需要同时处理屏幕图像和文字指令。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
涉及该条目的文章
如果两个模型之间只传递纯文本,空间细节可能会丢失,因此目标是在两者之间建立丰富的多模态接口。
处理多模态响应时检查 ,不要硬编码嵌套路径。