DSBench: VLM Benchmark for External and In-Cabin Safety Risks

原始资料:../evidence/papers/2025-dsbench-vlm-external-incabin-safety-risks.pdf

资料层级:evidence/papers

资料类型:PDF 论文,arXiv 2025。

状态:已用 pdftotext 抽取,已索引 benchmark 构建、模型结果和评价边界。

基本信息

  • 标题:DSBench: How Far Are Data and Models from Real-World Driving Safety?
  • arXiv:2025
  • 主题:Vision-Language Model benchmark / external traffic risk / in-cabin behavior safety / safety QA
  • 相关实体:Qwen模型族

可直接引用的事实

  • DSBench 面向 autonomous driving safety,把 external environmental risks 与 in-cabin behavior safety 放在同一个 VLM benchmark 中。
  • Benchmark taxonomy 包含 10 个 key categories、28 个 sub-categories,覆盖复杂交通、环境条件、driver-related risks、cockpit environment 等。
  • 数据整合了 10+ 公开数据集,包括 MAPLM、Bench2Drive、AIDE、DrivFace、CODA、PIE、nuScenes、LingoQA、JAAD、BDD-X、ONCE 等。
  • 构建了 98K safety-centric QA annotations,并 curated 3K representative scenarios 作为测试集。
  • 论文评测 16 个 VLM,包括 open-source、closed-source 和 domain-specific models;结论是现有模型没有达到 passing standard。
  • 作者 fine-tune Qwen2.5-VL-7B 得到 DSVLM;报告 DSVLM 在 Cockpit Environment category 比第二名高 50.61 分,10 类平均提升 18.88 分。
  • in-cabin 难点中,Cockpit Environment 和 Emotion 尤其弱;DSVLM 在 Coc. 80.1、Emo. 60.23。

数据与标注机制

DSBench 的构建不是单纯拼接数据集,而是把场景转成 safety QA:

  • GPT-4o 用作 pre-annotation engine 和 QA expansion 工具。
  • 8 名 expert human annotators 参与审核。
  • QA generation 结合 expert-designed templates 和 GPT-4o 扩展。
  • Category-level admission criterion 关注 accept + revised pairs 是否达到 80%,低质量或无关样本被 reject。

该流程说明它更像 safety reasoning benchmark,而不是传统 detection / classification 数据集。

评价方法

论文使用 GPT-4o 作为 virtual evaluator,评价模型输出的 semantic coherence、content completeness、与场景的一致性和 safety judgment。

作者同时指出传统文本指标 BLEU、CIDEr、ROUGE L 与安全理解质量相关性不足。

证据价值

这份资料对 接管准备度与干预策略 的价值在于:它把舱内状态和舱外风险放进同一个判断框架。

对 DMS/OMS 的启发不是“用 VLM 上车闭环”,而是:

  • 离线 case review:用 VLM 解释“外部风险 + 驾驶员状态 + cockpit condition”的组合风险。
  • scenario mining:从事故/near-miss/接管失败片段中挖出复杂多因素样本。
  • benchmark design:把 DMS 的输出从单一 fatigue/distraction 标签扩展为 safety judgment。

不能直接推出的结论

  • 不能把 DSBench 等同于实时车载安全系统;它是 QA benchmark,不是功能安全闭环。
  • GPT-4o evaluator 会引入主观性和模型偏置,不能替代人工安全评审。
  • DSVLM 的大幅提升说明 domain fine-tuning 重要,不代表通用 VLM 天然能理解安全风险。
  • 论文指标不能直接映射到 Euro NCAP、ASIL 或 OEM release gate。

对 MINIEYE 的启发

短期可借鉴的是数据和评审范式:

  • 把 DMS/OMS 输出、ADAS 外部风险、车辆状态、HMI 状态组成可审查场景卡。
  • 建立“舱内行为 + 舱外危险”的 case library,而不是只积累单点驾驶员状态样本。
  • 用 VLM 做离线标注辅助、长尾挖掘、case review 初筛;最终判断仍需专家和规则体系闭环。

相关页: