多模态驾驶员状态监测
多模态驾驶员状态监测指用多源信号共同判断驾驶员状态,而不是只依赖单个近红外摄像头。
可能的信号源
视觉信号
- 人脸、眼睛、头姿、视线。
- 上半身姿态、手部动作。
- 多摄像头视角,例如前视、侧视、over-shoulder。
优点是与现有 DMS 能力接近;缺点是对认知分心和生理疲劳的表达有限。
车辆信号
- 方向盘角度和微调频率。
- 车道偏移。
- 车速、加速度、横摆角速度。
- 油门和制动。
- ADAS 状态、接管请求、驾驶时长。
优点是不新增座舱硬件;缺点是依赖 OEM 数据开放程度,并且容易受道路、车速、ADAS 控制状态影响。
生理信号
- GSR / 皮电 / 肤电反应。
- HR / HRV。
- PPG。
- EEG / Ear-EEG。
- 呼吸、心跳等非接触生命体征。
- 毫米波雷达呼吸节律,用于观察 microsleep 前可能出现的呼吸变化。
优点是可能更接近疲劳、压力、认知负荷等内隐状态;缺点是硬件形态、噪声、用户接受度和量产集成难度较高。
座舱与接触信号
- 方向盘电极。
- 方向盘/座椅压力。
- 柔性压力传感器。
- 座椅姿态。
- 语音助手交互中的声纹、语速、吐字清晰度和声带震动变化。
这些信号可能比穿戴式传感器更接近车载无感集成,但需要核验硬件成熟度、成本、车规可靠性和长期稳定性。
HMI 与干预反馈信号
2026-内部-未来新方向调研 底部画板提醒,多模态不应只停在输入侧。疲劳识别后的策略也需要被记录和验证:
- 空调、香氛、座椅震动、声音报警等座舱唤醒动作。
- AI 语音助手主动搭话、认知唤醒和用户回应。
- UI/HMI 降级、接管预热和提醒强度变化。
- ACC / AEB / LKA 灵敏度调整、路线重规划和建议停车。
这些不是新的“传感器”,但如果不记录触发时机、驾驶员反应和后续驾驶质量,就无法判断干预是否有效。
当前资料支持的判断
会议中最重要的判断不是“GSR 一定要做”,而是“不能过早把非视觉传感器排除”。这要求研发先了解外部硬件生态和学术结论,再判断哪些信号值得纳入。
研究报告则把多模态作为下一代 DMS 的核心趋势之一,尤其强调:
- 生理信号可能先于视觉表象反映压力或接管能力变化。
- 车辆动力学信号能反映驾驶操控退化。
- 多任务学习可以同时预测接管意图、时间和质量。
- 多摄像头可以缓解单视角遮挡问题。
- VLM / LoRA / 多任务领域泛化可能用于跨车型、跨光照、跨任务适配,但目前更适合放在技术雷达和离线核验。
- 多模态模型如果涉及多摄、雷达、Transformer 或 VLM,必须同步评估车端内存、功耗、延迟和 NPU/DSP 部署。
这些判断都需要继续做一手来源核验。
对 MINIEYE 的实用拆分
多模态不应被理解成“一次性加很多传感器”。更合理的拆分是:
- 先做人车浅融合:camera + vehicle signals。
- 再评估个体
baseline:同一驾驶员的长期和短期状态偏移。 - 再做生理与行为信号增益评估:GSR / HR / 呼吸 / 语音 / 座椅 / 踏板 / steering 是否真的提升预测。
- 同步做干预策略日志:状态识别后触发了什么动作,驾驶员是否被唤醒,接管或控制质量是否改善。
- 最后再考虑新硬件或座舱闭环联动。
2026-06-03 画板补充:从信号池到采集字段
2026-内部-未来新方向调研 的画板把疲劳监测候选信号拆为四类:
| 类别 | 画板中的候选字段 | 当前建议 |
|---|---|---|
| DMS 模态 | PERCLOS、心率/呼吸、注视熵 | 作为现有 DMS 能力和认知负荷扩展的基础字段 |
| 附加传感器 | 方向盘皮电、毫米波呼吸、声纹与语速、座椅体态负荷 | 作为 P2 增益验证,不直接假设量产 |
| 驾驶模态 | 刹车、方向盘扭矩/转向熵、车速/加减速、踏板非线性、前车距离、车道居中、反应潜伏期 | 最适合与 P1b 人车浅融合和 ADAS 时序对齐合并推进 |
| 实验验证 | DMS 搭载舱外 L2 车辆、试验场测试、DMS/ADAS 时序对齐、疲劳真值/脑电待讨论 | 先做只读硬采和试验场/模拟器方案,不直接进入闭环控制 |
这带来的关键变化是:多模态验证不再只是“加 GSR/HR 看指标”,而是要建立一个同步采集 schema,把 DMS、CAN、ADAS、语音、座椅、呼吸、干预动作和真值来源全部按时间线对齐。
2026-07-16 收敛:从信号池到多源标签模型
2026-07-16-ENCAP-roadmap同步深度解读 对本页的核心校正是:多模态研究不能只回答“还能接入什么信号”,还必须回答“目标状态是什么、标签由什么证据组成、何时可信”。如果疲劳、困倦、警觉度、微睡眠和广义 impairment 没有分开定义,再丰富的信号池也无法证明模型学到了预期状态。
本次内部解读建议把疲劳视为潜变量,而不是把任一传感器直接叫作真值:
| 观测类别 | 候选输入 | 当前边界 |
|---|---|---|
| 生理观测 | EEG/EOG、HR/HRV、GSR、PPG | 可以辅助观察内隐状态,但需要设备、个体、伪迹和标定评估 |
| 主观/任务观测 | KSS、KDS、PVT、实验任务表现 | 能补充状态体验和反应能力,但存在主观性、时间粒度和任务依赖 |
| 视觉行为观测 | PERCLOS、眼睑、头姿、面部视频、专家评分 | 最接近现有 DMS,但不能单独代表全部生理或认知状态 |
| 驾驶表现观测 | CAN、反应潜伏期、横纵向控制、踏板和转向行为 | 能连接驾驶安全结果,但强依赖道路、车辆和 AD 状态 |
更稳妥的输出不是一个来源不明的轻中重标签,而是:
- 连续状态分值。
- 为产品或状态机离散化后的状态。
- 标签置信度。
- 每个标签的证据组成和时间窗口。
- 标签不适用的场景和设备条件。
在进入模型 POC 前,应依次通过五道门禁:
- 构念定义:明确 drowsiness、vigilance、fatigue、microsleep 或 impairment。
- 标签可靠性:比较多源观测的重复性、专家一致性、设备一致性和时间对齐。
- 极端状态可分性:先验证清醒与明显困倦,不急于人为切出轻中重。
- 环境迁移:静态、模拟器、封闭场地和实车逐层验证。
- 产品相关性:证明标签能改善接管准备度、无响应识别或其他明确决策,而不只提升离线分类准确率。
因此,EEG 当前应被称为候选观测或辅助标签来源。是否能形成 truth-assisted label model,需要先完成 来源核验 中的外部资料归档和小样本 protocol 评审,不能从会议讨论直接推出。
关键问题
- 现有量产项目能拿到哪些车辆信号?
- 哪些信号在法规和客户场景里最有价值?
- GSR 的价值是否足以覆盖接触式硬件的落地成本?
- 非接触生命体征相比接触式 GSR 是否更有车载落地希望?
- 多模态融合的增益能否用小规模数据先验证?
- 多摄像头或 VLM 方案是否真的能在目标 J3/J6 平台上部署?
- 语音、座椅、毫米波呼吸和反应潜伏期哪些能以低成本同步采集?
- 干预动作触发后,如何度量驾驶员状态恢复、接管质量或误触发体验?
- 疲劳、困倦、警觉度下降、微睡眠和 impairment 的目标定义由谁确认?
- 多源观测如何融合成带置信度和证据组成的标签,而不是单一设备阈值?
- EEG 辅助标签在跨设备、跨被试和静态到驾驶迁移时是否仍稳定?
相关页: