车端 AI 与硬件约束

本页承接 多模态个性化座舱研究报告 第七章,以及 The InCabin Report 2025资料 中关于 model development tools、SoC、edge deployment 的线索。它用于防止预研方向只讨论模型概念,而忽视车端算力、内存、功耗和平台边界。

为什么需要单独成页

多模态 DMS/OMS 的很多前沿方向都隐含更高计算成本:

  • 多摄像头时空融合。
  • radar vital signs 或 radar point cloud。
  • LSTM / Transformer。
  • VLM / multimodal foundation model。
  • 个性化 few-shot adaptation。
  • 车端持续滑动窗口和长期 baseline。

如果不提前定义硬件边界,很容易出现“论文可行、车端不可交付”的方向误判。

关键约束

约束要问的问题
算力J3/J6 或目标 SoC 的 NPU/DSP/CPU 是否能跑?峰值 TOPS 是否等于可用吞吐?
内存模型权重、feature buffer、滑动窗口、multi-camera 输入是否能放下?
延迟DMS/OMS 报警、ADAS 联动、接管策略是否满足实时性?
功耗是否符合座舱域控或独立模组热设计?
带宽多摄像头、radar、IR/NIR 输入是否压垮 ISP/DDR/总线?
隔离DMS 安全相关任务与座舱娱乐/LLM 是否有 mixed criticality 隔离?
隐私面部、生理、身份数据是否只能车端处理?是否能上云?
验证模型压缩、量化、平台迁移后指标是否可复现?

报告中的硬件线索

多模态个性化座舱研究报告 提到四类平台:

厂商报告中的平台可借鉴点需要核验
QualcommSnapdragon Ride Elite / Flex座舱 + ADAS + 自动驾驶融合,mixed criticality平台规格、DMS/OMS 部署案例、成本
AmbarellaCV3-AD / N1高 performance per watt,多摄像头和 radar 前融合LLM 本地推理 claim、功耗和量产状态
RenesasRA8P1 / Ethos-U55 NPU低功耗 MCU / NPU,适合轻量模型是否适合真实 DMS 视频流
NVIDIADrive Orin / Thor大算力、CUDA、Omniverse成本、功耗、是否只适合高端/Robotaxi

这些信息都应作为线索,不应在未核验前作为平台事实使用。

可落地的模型策略

比“直接上 VLM”更现实的策略:

  • INT8 quantization。
  • Quantization-Aware Training (QAT)。
  • early-exit gate。
  • sliding window + lightweight temporal model。
  • feature-level fusion 而不是 raw-sensor 全量融合。
  • prototype head / small adaptation cache。
  • teacher-student distillation。
  • platform-specific profiling。

Foundation model 的合理位置

2025-DSBench-VLM内外安全风险2026-Driver-WM舱内动态世界模型2025-MAC-SLU车内语音理解 说明,大模型/基础模型正在进入 in-cabin 讨论,但当前应把它们放在三个层级里区分:

层级合理用途不宜做的事
离线研发工具scenario mining、case review、自动生成 QA、弱标注、风险解释直接把 VLM 输出作为安全闭环决策
高算力原型验证 external hazard + in-cabin state 联合推理、future driver dynamics在未 profile 前假设可在 J3/J6 实时运行
车端产品化蒸馏成小模型、规则化输出、只保留必要子任务在安全相关链路中部署不可解释开放回答

当前最有价值的是第一层:把 VLM/world model 用作离线分析和 benchmark,而不是上车模型。

与 MINIEYE J3/J6 的关系

当前优先建议:

  1. 为 J3 定义“低成本单摄 DMS/OMS 可承载能力”。
  2. 为 J6 定义“更复杂融合能力”,例如 multi-task、vehicle signal fusion、部分 OMS/CPD 增强。
  3. 对每个预研方向记录模型大小、输入模态、推理频率、latency、memory、功耗。
  4. 对 VLM、multi-camera、radar vital signs 先做离线/高算力验证,不直接假设能上车。

对技术优先级的影响

硬件约束会改变方向排序:

  • 个性化 baseline 如果能在现有视觉/车辆信号上做,优先级高。
  • GSR/HR/radar vital signs 要看硬件和标注成本。
  • VLM-DM、FastKAN-Tiny、Driver-Net 等要先查一手资料和可部署性。
  • 多摄像头路线如果改变硬件 BOM 和安装位置,必须和客户项目机会绑定。
  • Event camera、thermal、Wi-Fi CSI、acoustic、UWB 这类新 sensing 方向,第一步不是模型精度,而是底层信号可得性、采样链路、功耗和车规接口。
  • Cabin VLM / driver world model / LALM 先放在离线工具链和高算力验证层,不直接进入量产优先级。

待补材料

  • J3/J6 平台实际 NPU/DSP/CPU、内存、功耗、模型部署工具链。
  • 当前 DMS/OMS 模型大小、输入分辨率、推理频率、端到端 latency。
  • 已有客户项目对摄像头数量、安装位置和 SoC 的限制。
  • INT8 / QAT / pruning / distillation 在现有模型上的历史结果。

相关页: