返回项目
开源项目
相关仓库
硕士研究 · 可靠性导向的无障碍视觉理解
多模态大模型在智能眼镜中的应用
从视障用户的真实任务出发,把目标检测、场景理解和语音反馈做进可穿戴原型。
- 角色
- 产品 / 算法 / 开发
- 时间
- 2025.08—2026.06
多模态YOLO智能眼镜无障碍嵌入式原型
一句话问题
辅助视觉系统不仅要描述看见了什么,还要判断何时可信、如何简短播报,以及不确定时怎样保护用户。
路径阶段 01
从真实任务定义问题
把识别、导航、问答与风险提示放进用户旅程。
- 问题
- 单一图像描述指标无法代表视障用户在移动场景中的实际需求。
- 判断
- 研究问题要从任务、环境与反馈负担共同定义。
- 行动
- 梳理拍摄、识别、语音、导航与复核节点。
- 结果
- 形成产品路径与研究问题的共同框架。
路径阶段 02
让系统理解并表达不确定性
把场景理解、RAG 与置信度转成可听懂的反馈。
- 问题
- 模型可能生成流畅但错误的描述,听觉界面又缺少视觉核对。
- 判断
- 系统需要区分事实、推断和低置信内容。
- 行动
- 设计检索增强、置信度分层与语音提示。
- 结果
- 用户能知道哪些信息可依赖、哪些需要再次确认。
路径阶段 03
构建端到端系统架构
连接眼镜、移动端、云端模型与反馈模块。
- 问题
- 模型、设备和网络约束会共同影响端到端体验。
- 判断
- 评估必须覆盖设备输入、推理、传输与反馈。
- 行动
- 拆分边缘设备、移动端、AI 服务和数据记录。
- 结果
- 建立可用于原型开发与实验设计的系统边界。
路径阶段 04
把原型交给用户控制
在结果页保留置信度、重新识别与历史记录。
- 问题
- 一次播报如果错误,用户需要明确的恢复方式。
- 判断
- 可访问体验必须提供重试、纠错与历史回看。
- 行动
- 设计拍摄、进度、结果、低置信提示和再次识别。
- 结果
- 系统从单向播报变成可控制的辅助工具。
路径阶段 05
用可靠性闭环评估
分别观察描述质量、系统表现与用户任务结果。
- 问题
- 只看 BLEU 等文本指标无法反映幻觉、安全与实际可用性。
- 判断
- 评估需要模型、系统和用户三层证据。
- 行动
- 组织事实性、置信度、时延、任务完成与主观负担指标。
- 结果
- 形成不夸大生产落地、可继续验证的研究框架。
结果与证据边界
已验证
用户调研
20 余名视障用户
已验证
厂商调研
3 家辅助器具厂商
阶段成果
原型状态
完成智能眼镜原型
辅助产品需要把模型看见的内容翻译成用户此刻最需要听到的信息。取舍发生在准确、及时、简短和可负担之间。