DSBench: VLM Benchmark for External and In-Cabin Safety Risks
原始资料:../evidence/papers/2025-dsbench-vlm-external-incabin-safety-risks.pdf
资料层级:evidence/papers。
资料类型:PDF 论文,arXiv 2025。
状态:已用 pdftotext 抽取,已索引 benchmark 构建、模型结果和评价边界。
基本信息
- 标题:DSBench: How Far Are Data and Models from Real-World Driving Safety?
- arXiv:2025
- 主题:Vision-Language Model benchmark / external traffic risk / in-cabin behavior safety / safety QA
- 相关实体:Qwen模型族
可直接引用的事实
- DSBench 面向 autonomous driving safety,把 external environmental risks 与 in-cabin behavior safety 放在同一个 VLM benchmark 中。
- Benchmark taxonomy 包含 10 个 key categories、28 个 sub-categories,覆盖复杂交通、环境条件、driver-related risks、cockpit environment 等。
- 数据整合了 10+ 公开数据集,包括 MAPLM、Bench2Drive、AIDE、DrivFace、CODA、PIE、nuScenes、LingoQA、JAAD、BDD-X、ONCE 等。
- 构建了 98K safety-centric QA annotations,并 curated 3K representative scenarios 作为测试集。
- 论文评测 16 个 VLM,包括 open-source、closed-source 和 domain-specific models;结论是现有模型没有达到 passing standard。
- 作者 fine-tune Qwen2.5-VL-7B 得到 DSVLM;报告 DSVLM 在 Cockpit Environment category 比第二名高 50.61 分,10 类平均提升 18.88 分。
- in-cabin 难点中,Cockpit Environment 和 Emotion 尤其弱;DSVLM 在 Coc. 80.1、Emo. 60.23。
数据与标注机制
DSBench 的构建不是单纯拼接数据集,而是把场景转成 safety QA:
- GPT-4o 用作 pre-annotation engine 和 QA expansion 工具。
- 8 名 expert human annotators 参与审核。
- QA generation 结合 expert-designed templates 和 GPT-4o 扩展。
- Category-level admission criterion 关注 accept + revised pairs 是否达到 80%,低质量或无关样本被 reject。
该流程说明它更像 safety reasoning benchmark,而不是传统 detection / classification 数据集。
评价方法
论文使用 GPT-4o 作为 virtual evaluator,评价模型输出的 semantic coherence、content completeness、与场景的一致性和 safety judgment。
作者同时指出传统文本指标 BLEU、CIDEr、ROUGE L 与安全理解质量相关性不足。
证据价值
这份资料对 接管准备度与干预策略 的价值在于:它把舱内状态和舱外风险放进同一个判断框架。
对 DMS/OMS 的启发不是“用 VLM 上车闭环”,而是:
- 离线 case review:用 VLM 解释“外部风险 + 驾驶员状态 + cockpit condition”的组合风险。
- scenario mining:从事故/near-miss/接管失败片段中挖出复杂多因素样本。
- benchmark design:把 DMS 的输出从单一 fatigue/distraction 标签扩展为 safety judgment。
不能直接推出的结论
- 不能把 DSBench 等同于实时车载安全系统;它是 QA benchmark,不是功能安全闭环。
- GPT-4o evaluator 会引入主观性和模型偏置,不能替代人工安全评审。
- DSVLM 的大幅提升说明 domain fine-tuning 重要,不代表通用 VLM 天然能理解安全风险。
- 论文指标不能直接映射到 Euro NCAP、ASIL 或 OEM release gate。
对 MINIEYE 的启发
短期可借鉴的是数据和评审范式:
- 把 DMS/OMS 输出、ADAS 外部风险、车辆状态、HMI 状态组成可审查场景卡。
- 建立“舱内行为 + 舱外危险”的 case library,而不是只积累单点驾驶员状态样本。
- 用 VLM 做离线标注辅助、长尾挖掘、case review 初筛;最终判断仍需专家和规则体系闭环。
相关页: