车端 AI 与硬件约束
本页承接 多模态个性化座舱研究报告 第七章,以及 The InCabin Report 2025资料 中关于 model development tools、SoC、edge deployment 的线索。它用于防止预研方向只讨论模型概念,而忽视车端算力、内存、功耗和平台边界。
为什么需要单独成页
多模态 DMS/OMS 的很多前沿方向都隐含更高计算成本:
- 多摄像头时空融合。
- radar vital signs 或 radar point cloud。
- LSTM / Transformer。
- VLM / multimodal foundation model。
- 个性化 few-shot adaptation。
- 车端持续滑动窗口和长期 baseline。
如果不提前定义硬件边界,很容易出现“论文可行、车端不可交付”的方向误判。
关键约束
| 约束 | 要问的问题 |
|---|---|
| 算力 | J3/J6 或目标 SoC 的 NPU/DSP/CPU 是否能跑?峰值 TOPS 是否等于可用吞吐? |
| 内存 | 模型权重、feature buffer、滑动窗口、multi-camera 输入是否能放下? |
| 延迟 | DMS/OMS 报警、ADAS 联动、接管策略是否满足实时性? |
| 功耗 | 是否符合座舱域控或独立模组热设计? |
| 带宽 | 多摄像头、radar、IR/NIR 输入是否压垮 ISP/DDR/总线? |
| 隔离 | DMS 安全相关任务与座舱娱乐/LLM 是否有 mixed criticality 隔离? |
| 隐私 | 面部、生理、身份数据是否只能车端处理?是否能上云? |
| 验证 | 模型压缩、量化、平台迁移后指标是否可复现? |
报告中的硬件线索
多模态个性化座舱研究报告 提到四类平台:
| 厂商 | 报告中的平台 | 可借鉴点 | 需要核验 |
|---|---|---|---|
| Qualcomm | Snapdragon Ride Elite / Flex | 座舱 + ADAS + 自动驾驶融合,mixed criticality | 平台规格、DMS/OMS 部署案例、成本 |
| Ambarella | CV3-AD / N1 | 高 performance per watt,多摄像头和 radar 前融合 | LLM 本地推理 claim、功耗和量产状态 |
| Renesas | RA8P1 / Ethos-U55 NPU | 低功耗 MCU / NPU,适合轻量模型 | 是否适合真实 DMS 视频流 |
| NVIDIA | Drive Orin / Thor | 大算力、CUDA、Omniverse | 成本、功耗、是否只适合高端/Robotaxi |
这些信息都应作为线索,不应在未核验前作为平台事实使用。
可落地的模型策略
比“直接上 VLM”更现实的策略:
- INT8 quantization。
- Quantization-Aware Training (QAT)。
- early-exit gate。
- sliding window + lightweight temporal model。
- feature-level fusion 而不是 raw-sensor 全量融合。
- prototype head / small adaptation cache。
- teacher-student distillation。
- platform-specific profiling。
Foundation model 的合理位置
2025-DSBench-VLM内外安全风险、2026-Driver-WM舱内动态世界模型 和 2025-MAC-SLU车内语音理解 说明,大模型/基础模型正在进入 in-cabin 讨论,但当前应把它们放在三个层级里区分:
| 层级 | 合理用途 | 不宜做的事 |
|---|---|---|
| 离线研发工具 | scenario mining、case review、自动生成 QA、弱标注、风险解释 | 直接把 VLM 输出作为安全闭环决策 |
| 高算力原型 | 验证 external hazard + in-cabin state 联合推理、future driver dynamics | 在未 profile 前假设可在 J3/J6 实时运行 |
| 车端产品化 | 蒸馏成小模型、规则化输出、只保留必要子任务 | 在安全相关链路中部署不可解释开放回答 |
当前最有价值的是第一层:把 VLM/world model 用作离线分析和 benchmark,而不是上车模型。
与 MINIEYE J3/J6 的关系
当前优先建议:
- 为 J3 定义“低成本单摄 DMS/OMS 可承载能力”。
- 为 J6 定义“更复杂融合能力”,例如 multi-task、vehicle signal fusion、部分 OMS/CPD 增强。
- 对每个预研方向记录模型大小、输入模态、推理频率、latency、memory、功耗。
- 对 VLM、multi-camera、radar vital signs 先做离线/高算力验证,不直接假设能上车。
对技术优先级的影响
硬件约束会改变方向排序:
- 个性化 baseline 如果能在现有视觉/车辆信号上做,优先级高。
- GSR/HR/radar vital signs 要看硬件和标注成本。
- VLM-DM、FastKAN-Tiny、Driver-Net 等要先查一手资料和可部署性。
- 多摄像头路线如果改变硬件 BOM 和安装位置,必须和客户项目机会绑定。
- Event camera、thermal、Wi-Fi CSI、acoustic、UWB 这类新 sensing 方向,第一步不是模型精度,而是底层信号可得性、采样链路、功耗和车规接口。
- Cabin VLM / driver world model / LALM 先放在离线工具链和高算力验证层,不直接进入量产优先级。
待补材料
- J3/J6 平台实际 NPU/DSP/CPU、内存、功耗、模型部署工具链。
- 当前 DMS/OMS 模型大小、输入分辨率、推理频率、端到端 latency。
- 已有客户项目对摄像头数量、安装位置和 SoC 的限制。
- INT8 / QAT / pruning / distillation 在现有模型上的历史结果。
相关页: