多模态驾驶员状态监测

多模态驾驶员状态监测指用多源信号共同判断驾驶员状态,而不是只依赖单个近红外摄像头。

可能的信号源

视觉信号

  • 人脸、眼睛、头姿、视线。
  • 上半身姿态、手部动作。
  • 多摄像头视角,例如前视、侧视、over-shoulder。

优点是与现有 DMS 能力接近;缺点是对认知分心和生理疲劳的表达有限。

车辆信号

  • 方向盘角度和微调频率。
  • 车道偏移。
  • 车速、加速度、横摆角速度。
  • 油门和制动。
  • ADAS 状态、接管请求、驾驶时长。

优点是不新增座舱硬件;缺点是依赖 OEM 数据开放程度,并且容易受道路、车速、ADAS 控制状态影响。

生理信号

  • GSR / 皮电 / 肤电反应。
  • HR / HRV。
  • PPG。
  • EEG / Ear-EEG。
  • 呼吸、心跳等非接触生命体征。
  • 毫米波雷达呼吸节律,用于观察 microsleep 前可能出现的呼吸变化。

优点是可能更接近疲劳、压力、认知负荷等内隐状态;缺点是硬件形态、噪声、用户接受度和量产集成难度较高。

座舱与接触信号

  • 方向盘电极。
  • 方向盘/座椅压力。
  • 柔性压力传感器。
  • 座椅姿态。
  • 语音助手交互中的声纹、语速、吐字清晰度和声带震动变化。

这些信号可能比穿戴式传感器更接近车载无感集成,但需要核验硬件成熟度、成本、车规可靠性和长期稳定性。

HMI 与干预反馈信号

2026-内部-未来新方向调研 底部画板提醒,多模态不应只停在输入侧。疲劳识别后的策略也需要被记录和验证:

  • 空调、香氛、座椅震动、声音报警等座舱唤醒动作。
  • AI 语音助手主动搭话、认知唤醒和用户回应。
  • UI/HMI 降级、接管预热和提醒强度变化。
  • ACC / AEB / LKA 灵敏度调整、路线重规划和建议停车。

这些不是新的“传感器”,但如果不记录触发时机、驾驶员反应和后续驾驶质量,就无法判断干预是否有效。

当前资料支持的判断

会议中最重要的判断不是“GSR 一定要做”,而是“不能过早把非视觉传感器排除”。这要求研发先了解外部硬件生态和学术结论,再判断哪些信号值得纳入。

研究报告则把多模态作为下一代 DMS 的核心趋势之一,尤其强调:

  • 生理信号可能先于视觉表象反映压力或接管能力变化。
  • 车辆动力学信号能反映驾驶操控退化。
  • 多任务学习可以同时预测接管意图、时间和质量。
  • 多摄像头可以缓解单视角遮挡问题。
  • VLM / LoRA / 多任务领域泛化可能用于跨车型、跨光照、跨任务适配,但目前更适合放在技术雷达和离线核验。
  • 多模态模型如果涉及多摄、雷达、Transformer 或 VLM,必须同步评估车端内存、功耗、延迟和 NPU/DSP 部署。

这些判断都需要继续做一手来源核验。

对 MINIEYE 的实用拆分

多模态不应被理解成“一次性加很多传感器”。更合理的拆分是:

  1. 先做人车浅融合:camera + vehicle signals。
  2. 再评估个体 baseline:同一驾驶员的长期和短期状态偏移。
  3. 再做生理与行为信号增益评估:GSR / HR / 呼吸 / 语音 / 座椅 / 踏板 / steering 是否真的提升预测。
  4. 同步做干预策略日志:状态识别后触发了什么动作,驾驶员是否被唤醒,接管或控制质量是否改善。
  5. 最后再考虑新硬件或座舱闭环联动。

2026-06-03 画板补充:从信号池到采集字段

2026-内部-未来新方向调研 的画板把疲劳监测候选信号拆为四类:

类别画板中的候选字段当前建议
DMS 模态PERCLOS、心率/呼吸、注视熵作为现有 DMS 能力和认知负荷扩展的基础字段
附加传感器方向盘皮电、毫米波呼吸、声纹与语速、座椅体态负荷作为 P2 增益验证,不直接假设量产
驾驶模态刹车、方向盘扭矩/转向熵、车速/加减速、踏板非线性、前车距离、车道居中、反应潜伏期最适合与 P1b 人车浅融合和 ADAS 时序对齐合并推进
实验验证DMS 搭载舱外 L2 车辆、试验场测试、DMS/ADAS 时序对齐、疲劳真值/脑电待讨论先做只读硬采和试验场/模拟器方案,不直接进入闭环控制

这带来的关键变化是:多模态验证不再只是“加 GSR/HR 看指标”,而是要建立一个同步采集 schema,把 DMS、CAN、ADAS、语音、座椅、呼吸、干预动作和真值来源全部按时间线对齐。

2026-07-16 收敛:从信号池到多源标签模型

2026-07-16-ENCAP-roadmap同步深度解读 对本页的核心校正是:多模态研究不能只回答“还能接入什么信号”,还必须回答“目标状态是什么、标签由什么证据组成、何时可信”。如果疲劳、困倦、警觉度、微睡眠和广义 impairment 没有分开定义,再丰富的信号池也无法证明模型学到了预期状态。

本次内部解读建议把疲劳视为潜变量,而不是把任一传感器直接叫作真值:

观测类别候选输入当前边界
生理观测EEG/EOG、HR/HRV、GSR、PPG可以辅助观察内隐状态,但需要设备、个体、伪迹和标定评估
主观/任务观测KSS、KDS、PVT、实验任务表现能补充状态体验和反应能力,但存在主观性、时间粒度和任务依赖
视觉行为观测PERCLOS、眼睑、头姿、面部视频、专家评分最接近现有 DMS,但不能单独代表全部生理或认知状态
驾驶表现观测CAN、反应潜伏期、横纵向控制、踏板和转向行为能连接驾驶安全结果,但强依赖道路、车辆和 AD 状态

更稳妥的输出不是一个来源不明的轻中重标签,而是:

  • 连续状态分值。
  • 为产品或状态机离散化后的状态。
  • 标签置信度。
  • 每个标签的证据组成和时间窗口。
  • 标签不适用的场景和设备条件。

在进入模型 POC 前,应依次通过五道门禁:

  1. 构念定义:明确 drowsiness、vigilance、fatigue、microsleep 或 impairment。
  2. 标签可靠性:比较多源观测的重复性、专家一致性、设备一致性和时间对齐。
  3. 极端状态可分性:先验证清醒与明显困倦,不急于人为切出轻中重。
  4. 环境迁移:静态、模拟器、封闭场地和实车逐层验证。
  5. 产品相关性:证明标签能改善接管准备度、无响应识别或其他明确决策,而不只提升离线分类准确率。

因此,EEG 当前应被称为候选观测或辅助标签来源。是否能形成 truth-assisted label model,需要先完成 来源核验 中的外部资料归档和小样本 protocol 评审,不能从会议讨论直接推出。

关键问题

  • 现有量产项目能拿到哪些车辆信号?
  • 哪些信号在法规和客户场景里最有价值?
  • GSR 的价值是否足以覆盖接触式硬件的落地成本?
  • 非接触生命体征相比接触式 GSR 是否更有车载落地希望?
  • 多模态融合的增益能否用小规模数据先验证?
  • 多摄像头或 VLM 方案是否真的能在目标 J3/J6 平台上部署?
  • 语音、座椅、毫米波呼吸和反应潜伏期哪些能以低成本同步采集?
  • 干预动作触发后,如何度量驾驶员状态恢复、接管质量或误触发体验?
  • 疲劳、困倦、警觉度下降、微睡眠和 impairment 的目标定义由谁确认?
  • 多源观测如何融合成带置信度和证据组成的标签,而不是单一设备阈值?
  • EEG 辅助标签在跨设备、跨被试和静态到驾驶迁移时是否仍稳定?

相关页: