DeepTake: Prediction of Driver Takeover Behavior using Multimodal Data

原始资料:../evidence/papers/2012.15441v2.pdf

资料层级:evidence/papers

资料类型:PDF 论文,CHI 2021。

状态:已用 pdftotext 抽取并索引。

基本信息

  • 标题:DeepTake: Prediction of Driver Takeover Behavior using Multimodal Data
  • 作者:Erfan Pakdamanian, Shili Sheng, Sonia Baee, Seongkook Heo, Sarit Kraus, Lu Feng
  • 会议:CHI 2021
  • DOI:https://doi.org/10.1145/3411764.3445563
  • 关键词:Automated driving, Multimodal data, Takeover behavior, Human-automation interaction, Deep neural networks

研究问题

DeepTake 研究的是 L3 自动驾驶场景下,系统发出 takeover request 之前,能否用多模态数据预测驾驶员的接管行为。

论文把接管行为拆成三个分类任务:

  1. takeover intention:驾驶员是否会响应 TOR。
  2. takeover time:驾驶员多久恢复人工控制。
  3. takeover quality:接管后的控制质量。

多模态输入

DeepTake 使用的数据源包括:

  • pre-driving survey:性别、NASA-TLX、PSS-10 等。
  • NDRTs:交谈、使用手机、阅读、算术题。
  • eye movement:gaze position、pupil size、fixation 等。
  • heart rate / PPG:SDNN、RMSSD、pNN50。
  • GSR:peaks number、peaks amplitude。
  • vehicle data:车道距离、障碍距离、方向盘角、油门/制动角、车速。

论文使用 TOR 前固定时间窗做特征聚合。作者从 2 秒到 18 秒探索后,在实验中选择了 TOR 前 10 秒窗口。

实验设置

  • 20 名被试,18-30 岁,平均 23.5 岁。
  • 3 名被试数据因生物信号缺失或大量缺失值被排除。
  • 使用低保真驾驶模拟器:Logitech G29、30 英寸显示器、PreScan、iMotions。
  • 使用 Tobii Pro Glasses 2 采集眼动。
  • 使用 Shimmer3+ wearable device 采集 PPG 和 GSR
  • NDRTs 包括交谈、手机、阅读、算术。

结果

DeepTake 与 Logistic Regression、Gradient Boosting、Random Forest、Naive Bayes、AdaBoost、RGF 等模型比较。

论文报告的 DeepTake 准确率:

  • takeover intention:96%,weighted F1 0.93。
  • takeover time:93%,weighted F1 0.87。
  • takeover quality:83%,weighted F1 0.78。

这能直接支撑四阶段图中“DeepTake(CHI 2021)”“多模态数据”“接管意图/时间/质量”“多任务 DNN”的说法。

局限

论文自己明确指出:

  • 数据来自低保真驾驶模拟器,接管行为可能受设置简化影响。
  • 需要更多真实道路数据。
  • 当前为离线评估,不是在线量产系统。
  • 后续需要更大数据集,尤其是预测连续接管时间。
  • 主观 survey 在真实道路应用中可能带来偏差,未来需要减少或排除。

因此,DeepTake 适合作为“阶段 3:多模态深度融合与学术化突破”的强证据,但不能直接证明该方向已工程量产。

对四阶段图的证据价值

强支持:

  • CHI 2021 学术论文存在。
  • 输入确实包括车辆数据、眼动、生理信号、NDRT 和 subjective measurements。
  • 生理信号确实包括 HR/PPG 和 GSR
  • 输出确实包括接管意图、接管时间和接管质量。
  • 论文确实使用 DNN,并报告 96% / 93% / 83% 准确率。

需要修正:

  • 四阶段图里写“车辆 + GSR + 视线 + 主观调研”基本成立,但更准确应写“pre-driving survey + vehicle data + NDRT information + eye movement + HR/PPG + GSR”。
  • DeepTake 不应被描述成工程化方案;它是受控模拟器里的学术验证。

相关页: