切换·Esc 返回

多模态Multimodal AI

多模态 AI 能在同一个任务里结合文字、图片、音频或视频等不同形式的信息。例如,把手机结账页的截图和“付款按钮为什么不见了”一起发给 AI,它可以把画面里的布局和文字里的问题放在一起判断。
也常被叫作多模态 AI多模态模型Multimodality
输入模态和输出模态要分开看
当前案例:用截图排查付款按钮为什么消失主题色表示本次实际使用
输入模态交给 AI 的内容
  • 文字
  • 图片
  • 语音 / 音频语音属于音频
  • 视频
AI 模型 / 系统按实际能力处理
输出模态AI 返回的结果
  • 文字
  • 图片
  • 语音 / 音频语音属于音频
  • 视频

这次是文字和图片输入、文字输出;支持图片输入,不等于支持图片输出。

不同模态分别负责什么

模态就是信息形式文字、图片、音频和视频是常见模态,语音属于音频中的一种内容。多模态表示一个模型或系统能结合至少两种形式,不代表它一定支持全部形式。

同一种模态可以出现在两边语音可以作为输入被转成文字,也可以作为输出把文字回答读出来。判断时要看它是交给 AI 的内容,还是 AI 返回的结果。

能力要看具体模型和产品不同模型支持的输入、输出和文件类型不同,使用前要分别确认,不能从产品名称或一个上传按钮推断全部能力。

选择题选择一个你认为最合适的答案

你想让 AI 判断手机结账页里的付款按钮为什么看不见,怎样做最合适?

你可以这样告诉 AI Agent

这张截图是手机上的结账页,付款按钮应该在底部,但现在看不见。先只根据截图告诉我你能确认的遮挡或布局线索,不能从画面确认的地方直接说不确定。然后再检查项目里的手机布局,找到原因后修改,并用同样的屏幕尺寸确认按钮能看到、能点击。

接下来学什么
延伸阅读 · 权威出处
多模态 Multimodal AI|AI术语 · VibeHub