← 返回项目列表

研究实践 · 项目案例

基于多模态大模型的无障碍图像描述生成与播报

把视觉信息转译成可理解、可收听的内容体验

从无障碍使用场景出发,探索多模态描述生成、信息优先级与语音播报的产品闭环。

无障碍科技多模态语音播报用户研究

项目背景

项目探索多模态大模型如何帮助无法直接获取图像信息的用户。本案例聚焦产品体验和风险边界,不声称未完成验证的模型效果或用户数据。

核心问题

图像描述不是罗列所有物体。系统需要根据使用场景组织重点、控制推断,并让用户能够方便地收听和再次确认。

我的角色

参与场景定义、信息层级和描述—播报链路设计,重点关注输出是否真正服务用户任务。

用户与业务痛点

  • 通用描述可能过长、缺少重点,或忽略用户当下最关心的信息。
  • 模型可能把不确定的视觉线索表达成确定事实。
  • 文本生成后仍需要适配语音节奏、重复收听和操作可达性。

产品方案

  • 按整体概览、关键对象、关系与可选细节组织描述层级。
  • 设计简洁播报、再次收听和获取更多细节的可达操作路径。
  • 对推测性信息使用不确定表达,避免把视觉推断当作事实。

AI 方案

  • 使用多模态模型理解图像内容,并通过结构化提示约束描述顺序和信息重点。
  • 在生成结果中区分可观察事实与推断,优先保留与安全和任务相关的信息。
  • 将文本结果交给语音播报层,并保留用户重新请求或缩短描述的控制权。

遇到的困难与解决方式

遇到的困难

  • 不同图像和使用目标需要不同描述粒度,固定模板难以覆盖所有场景。
  • 无障碍体验需要从真实使用路径验证,而不能只评价文本是否通顺。

解决方式

  • 用场景化任务定义描述重点,并把输出拆成可逐层展开的信息。
  • 将准确性、相关性、可听性和不确定性表达作为独立检查维度。

项目结果

  • 形成了从图像理解、分层描述到语音播报的无障碍产品框架。
  • 当前不提供未经确认的模型指标,后续可补充真实用户测试与量化评价。

面试官可能追问的问题

怎样判断一段图像描述是否有用?

我会这样回答

不能只看语句流畅度。我会结合具体任务检查事实准确、重点相关、播报可理解,以及用户能否继续获取所需细节。

如何降低多模态模型的幻觉风险?

我会这样回答

限制输出结构,区分观察与推断,并对关键事实保留不确定表达;高风险场景不能只依赖模型生成结果。