Driver-WM: Driver-Centric In-Cabin Dynamics World Model

原始资料:../evidence/papers/2026-driver-wm-incabin-dynamics-world-model.pdf

资料层级:evidence/papers

资料类型:PDF 论文,arXiv 2026。

状态:已用 pdftotext 抽取,已索引模型结构、AIDE 协议、指标和 caveat。

基本信息

  • 标题:Driver-WM: Driver-Centric In-Cabin Dynamics World Model
  • arXiv:2026
  • 主题:driver dynamics / world model / external-to-internal causal conditioning / skeleton rollout
  • 相关实体:Qwen模型族

可直接引用的事实

  • Driver-WM 研究的问题是:现有 in-cabin intelligence 多数只做 recognition,缺少 multi-step rollout,无法预测驾驶员未来几秒如何响应外部交通事件。
  • 模型使用 synchronized out-cabin + in-cabin video。外部视角来自 front/left/right,内部视角来自 in-cabin camera。
  • 使用 frozen Qwen3-VL features 作为 latent state interface,不训练 VLM backbone。
  • 内外双流 latent 通过 gated causal injection 连接,方向是 external -> internal,并强制 rollout 时 zero-lookahead。
  • 输出包含 HALPE-136 2D skeleton rollout,以及 DBR 7-class、DER 5-class、TCR 3-class、VCR 5-class 辅助语义任务。
  • AIDE 协议为 3 秒 clips、10 frames,约 3.3 Hz;采用 5->5 time-causal protocol:观察 5 帧,预测后 5 帧。
  • 官方 split 为 train 1,884 clips、val 405 clips、test 609 clips。

方法细节

Driver-WM 的核心不是生成视频,而是在 compact latent space 中预测驾驶员动态:

  • external stream:对 out-cabin 多视角 latent 做 mean pooling 和时序建模。
  • internal stream:编码驾驶员舱内状态。
  • gated causal injection:用 external latent 生成 gate,控制外部上下文如何扰动 internal next state。
  • ST-GCN skeleton decoder:把 internal latent 解码为 HALPE-136 skeleton。
  • physical priors:使用 bone length、smoothness、可选 seat ROI 等约束。
  • interventions:通过 do(Ext=∅)、swap/shift/drop view、do(lambda=0/1/2) 等 test-time intervention 检查外部上下文是否被模型使用。

关键结果

论文强调一个很重要的评价陷阱:自然驾驶片段中低运动占多数,因此 Zero-Velocity baseline 在 overall d-nMPJPE 上可能看起来很好。这暴露了 “inertia effect” 或 mean regression trap。

主模型多 seed 结果:

  • All MPJPE:71.66±0.3 px。
  • All d-nMPJPE:3.25±0.0%。
  • High-Motion MPJPE:138.34±1.2 px。
  • High-Motion d-nMPJPE:6.28±0.1%。
  • DBR Acc/F1:73.34 / 69.09。
  • DER Acc/F1:80.35 / 73.08。
  • TCR Acc/F1:92.94 / 89.26。
  • VCR Acc/F1:82.81 / 66.54。
  • PCK@0.05 / PCK@0.10:71.40 / 88.21。

外部上下文必要性:

  • w/o external context 时 TCR 降到 65.52 / 26.39,VCR 降到 53.86 / 14.00。
  • averaged MPJPE 仍可能竞争性,是因为低运动片段太多;这说明必须单独看 High-Motion tail。
  • non-causal bidirectional variant 没有稳定超越 causal design,支持部署一致的因果建模。

证据价值

这份资料对 接管准备度与干预策略 的价值很明确:它把“驾驶员当前状态识别”推进到“未来 1-2 秒响应预测”。

对接管/干预策略的启发:

  • 同样的 takeover time 不代表同样的接管准备度;手、头、身体姿态和注意力的未来变化更关键。
  • 外部交通上下文会影响驾驶员内在动态,不能只看舱内相机。
  • 评价不能只看平均误差,必须看 High-Motion / high-risk tail。

不能直接推出的结论

  • 不能把 Driver-WM 视为已可上车的 world model;它是 arXiv research,数据量、帧率和任务都偏离量产闭环。
  • AIDE 约 3.3 Hz、3 秒 clip、5->5 protocol 只覆盖短期低频预测。
  • frozen Qwen3-VL features 的计算成本和车端可部署性没有解决。
  • skeleton rollout 指标与功能安全证据之间仍有很大距离。
  • 该方法更适合作为离线研究和评价框架,而不是近期量产功能。

对 MINIEYE 的启发

短期可吸收三个方法论:

  • 在离线数据中引入 future driver dynamics 标签和评价,而不只做当前帧分类。
  • 把外部 ADAS 风险事件与舱内驾驶员状态对齐,形成接管/干预研究样本。
  • 评价指标要分 overall 和 high-motion/high-risk tail,避免被静态片段平均数误导。

相关页: