返回项目

开源项目

硕士研究 · 可靠性导向的无障碍视觉理解

多模态大模型在智能眼镜中的应用

从视障用户的真实任务出发,把目标检测、场景理解和语音反馈做进可穿戴原型。

角色
产品 / 算法 / 开发
时间
2025.08—2026.06
多模态YOLO智能眼镜无障碍嵌入式原型

一句话问题

辅助视觉系统不仅要描述看见了什么,还要判断何时可信、如何简短播报,以及不确定时怎样保护用户。

路径阶段 01

从真实任务定义问题

把识别、导航、问答与风险提示放进用户旅程。

问题
单一图像描述指标无法代表视障用户在移动场景中的实际需求。
判断
研究问题要从任务、环境与反馈负担共同定义。
行动
梳理拍摄、识别、语音、导航与复核节点。
结果
形成产品路径与研究问题的共同框架。

路径阶段 02

让系统理解并表达不确定性

把场景理解、RAG 与置信度转成可听懂的反馈。

问题
模型可能生成流畅但错误的描述,听觉界面又缺少视觉核对。
判断
系统需要区分事实、推断和低置信内容。
行动
设计检索增强、置信度分层与语音提示。
结果
用户能知道哪些信息可依赖、哪些需要再次确认。

路径阶段 03

构建端到端系统架构

连接眼镜、移动端、云端模型与反馈模块。

问题
模型、设备和网络约束会共同影响端到端体验。
判断
评估必须覆盖设备输入、推理、传输与反馈。
行动
拆分边缘设备、移动端、AI 服务和数据记录。
结果
建立可用于原型开发与实验设计的系统边界。

路径阶段 04

把原型交给用户控制

在结果页保留置信度、重新识别与历史记录。

问题
一次播报如果错误,用户需要明确的恢复方式。
判断
可访问体验必须提供重试、纠错与历史回看。
行动
设计拍摄、进度、结果、低置信提示和再次识别。
结果
系统从单向播报变成可控制的辅助工具。

路径阶段 05

用可靠性闭环评估

分别观察描述质量、系统表现与用户任务结果。

问题
只看 BLEU 等文本指标无法反映幻觉、安全与实际可用性。
判断
评估需要模型、系统和用户三层证据。
行动
组织事实性、置信度、时延、任务完成与主观负担指标。
结果
形成不夸大生产落地、可继续验证的研究框架。

结果与证据边界

已验证

用户调研

20 余名视障用户

已验证

厂商调研

3 家辅助器具厂商

阶段成果

原型状态

完成智能眼镜原型

辅助产品需要把模型看见的内容翻译成用户此刻最需要听到的信息。取舍发生在准确、及时、简短和可负担之间。