项目背景
项目探索多模态大模型如何帮助无法直接获取图像信息的用户。本案例聚焦产品体验和风险边界,不声称未完成验证的模型效果或用户数据。
核心问题
图像描述不是罗列所有物体。系统需要根据使用场景组织重点、控制推断,并让用户能够方便地收听和再次确认。
我的角色
参与场景定义、信息层级和描述—播报链路设计,重点关注输出是否真正服务用户任务。
用户与业务痛点
- 通用描述可能过长、缺少重点,或忽略用户当下最关心的信息。
- 模型可能把不确定的视觉线索表达成确定事实。
- 文本生成后仍需要适配语音节奏、重复收听和操作可达性。
产品方案
- 按整体概览、关键对象、关系与可选细节组织描述层级。
- 设计简洁播报、再次收听和获取更多细节的可达操作路径。
- 对推测性信息使用不确定表达,避免把视觉推断当作事实。
AI 方案
- 使用多模态模型理解图像内容,并通过结构化提示约束描述顺序和信息重点。
- 在生成结果中区分可观察事实与推断,优先保留与安全和任务相关的信息。
- 将文本结果交给语音播报层,并保留用户重新请求或缩短描述的控制权。
遇到的困难与解决方式
遇到的困难
- 不同图像和使用目标需要不同描述粒度,固定模板难以覆盖所有场景。
- 无障碍体验需要从真实使用路径验证,而不能只评价文本是否通顺。
解决方式
- 用场景化任务定义描述重点,并把输出拆成可逐层展开的信息。
- 将准确性、相关性、可听性和不确定性表达作为独立检查维度。
项目结果
- 形成了从图像理解、分层描述到语音播报的无障碍产品框架。
- 当前不提供未经确认的模型指标,后续可补充真实用户测试与量化评价。
面试官可能追问的问题
怎样判断一段图像描述是否有用?
我会这样回答
不能只看语句流畅度。我会结合具体任务检查事实准确、重点相关、播报可理解,以及用户能否继续获取所需细节。
如何降低多模态模型的幻觉风险?
我会这样回答
限制输出结构,区分观察与推断,并对关键事实保留不确定表达;高风险场景不能只依赖模型生成结果。