多模态 AI 产品模式:图片输入到底该放在哪一层
从图片输入、文本推理和结构化输出三个层次,整理多模态 AI 应用的产品与工程拆分方式。
多模态能力让模型能处理图片、截图、文档扫描件和界面状态。但产品设计上不能简单理解为“把图片丢给模型”。OpenAI 的图片输入文档说明模型可以基于图像进行理解,Anthropic 也提供了视觉输入相关说明。[vision-001][vision-002]
图片输入适合三类任务
第一类是观察:识别截图、票据、图表、页面状态。第二类是定位:找出图中某个区域、异常或差异。第三类是解释:把视觉信息转成面向用户的说明。
不建议一开始就让模型直接执行动作。更稳的流程是:
图片输入 -> 视觉描述 -> 结构化抽取 -> 人类确认 -> 后续动作多模态不是让模型替代界面状态管理,而是让模型成为视觉信息到结构化语义之间的桥。
输出必须结构化
如果图片用于业务流程,输出最好不是一段自由文本,而是可验证对象:
{
"document_type": "invoice",
"fields": {
"vendor": "unknown",
"total": null
},
"uncertain_regions": ["右下角金额模糊"],
"needs_human_review": true
}OpenAI 结构化输出文档适合约束这类结果,让后端能检查字段、缺失值和人工复核标记。[vision-003]
产品上要暴露不确定性
多模态系统的风险在于用户容易相信“模型看见了”。所以界面应该展示:
- 原图预览。
- 模型抽取字段。
- 不确定区域。
- 用户可编辑入口。
- 继续执行前的确认按钮。
综合这些资料可以推断:多模态 AI 的可用性来自“视觉理解 + 结构化输出 + 人工校正”的组合,而不是单纯把图片能力接到聊天框里。
参考资料
- [vision-001] OpenAI Developers, “Images and vision”, https://developers.openai.com/api/docs/guides/images-vision
- [vision-002] Anthropic Docs, “Vision”, https://docs.anthropic.com/en/docs/build-with-claude/vision
- [vision-003] OpenAI Developers, “Structured Outputs”, https://developers.openai.com/api/docs/guides/structured-outputs