返回文章列表

多模态 AI 产品模式:图片输入到底该放在哪一层

从图片输入、文本推理和结构化输出三个层次,整理多模态 AI 应用的产品与工程拆分方式。

多模态能力让模型能处理图片、截图、文档扫描件和界面状态。但产品设计上不能简单理解为“把图片丢给模型”。OpenAI 的图片输入文档说明模型可以基于图像进行理解,Anthropic 也提供了视觉输入相关说明。[vision-001][vision-002]

图片输入适合三类任务

第一类是观察:识别截图、票据、图表、页面状态。第二类是定位:找出图中某个区域、异常或差异。第三类是解释:把视觉信息转成面向用户的说明。

不建议一开始就让模型直接执行动作。更稳的流程是:

图片输入 -> 视觉描述 -> 结构化抽取 -> 人类确认 -> 后续动作

多模态不是让模型替代界面状态管理,而是让模型成为视觉信息到结构化语义之间的桥。

输出必须结构化

如果图片用于业务流程,输出最好不是一段自由文本,而是可验证对象:

{
  "document_type": "invoice",
  "fields": {
    "vendor": "unknown",
    "total": null
  },
  "uncertain_regions": ["右下角金额模糊"],
  "needs_human_review": true
}

OpenAI 结构化输出文档适合约束这类结果,让后端能检查字段、缺失值和人工复核标记。[vision-003]

产品上要暴露不确定性

多模态系统的风险在于用户容易相信“模型看见了”。所以界面应该展示:

  • 原图预览。
  • 模型抽取字段。
  • 不确定区域。
  • 用户可编辑入口。
  • 继续执行前的确认按钮。

综合这些资料可以推断:多模态 AI 的可用性来自“视觉理解 + 结构化输出 + 人工校正”的组合,而不是单纯把图片能力接到聊天框里。

参考资料

  1. [vision-001] OpenAI Developers, “Images and vision”, https://developers.openai.com/api/docs/guides/images-vision
  2. [vision-002] Anthropic Docs, “Vision”, https://docs.anthropic.com/en/docs/build-with-claude/vision
  3. [vision-003] OpenAI Developers, “Structured Outputs”, https://developers.openai.com/api/docs/guides/structured-outputs