跳到文章正文
报告 编辑推荐

把深度基础模型砍到 6M:DepthART 让深度估计跑进 Jetson,延迟不到 1 毫秒

机器人要抓取物体、手机要拍出景深、AR 眼镜要理解空间——它们都得先回答一个问题:眼前这个东西离…

机器人要抓取物体、手机要拍出景深、AR 眼镜要理解空间——它们都得先回答一个问题:眼前这个东西离我多远?过去几年,单目深度估计一路「基础模型化」,参数从千万飙到上亿,精度是上去了,可算力和成本也跟着上去了,端侧设备根本带不动。一篇被 ACM Multimedia 2026 接收的论文,尝试给出另一种答案。

一分钟速览

  • 论文 DepthART 把单目深度基础模型压缩到约 6M 参数
  • 最小版本 DepthART-S 仅 6.0M 参数,约为 Depth Anything V2-S(24.8M)的四分之一
  • 在 NYUD v2 数据集上 δ1 达 0.964,精度并未因「瘦身」明显塌陷
  • TensorRT FP16 下推理延迟仅 0.918 毫秒,RTX A6000 上达 347 FPS
  • 官方提供 Jetson Orin NX 部署路径,另有面向移动 NPU/BPU 的版本

小模型的老问题:一压缩就「学偏」

单目深度估计领域长期存在一道断层:大模型泛化好但吃资源,小模型跑得快但通常只针对单一数据集训练,换个场景就失灵。论文要回答的核心问题是:如果模型只有约 6M 参数,还能不能保留基础模型的跨场景泛化能力?

作者薛峰指出,小模型在蒸馏大模型时容易「学偏」。为此研究提出两项关键技术:一是抗偏置数据采样(BRDS),改进采样策略以维持跨数据集的泛化性;二是相机条件化微调(CamFT),通过在微调时冻结已完成蒸馏的编码器、只训练一个轻量的相机适配模块,来解决度量深度微调中的灾难性遗忘问题。用作者的话概括就是——先保护已经学会的几何,再学习尺度。

两条路线,覆盖不同硬件

为适配各异的硬件约束,DepthART 提供了两条并行技术路线:路线一以 TinyViM 为骨干,借助 CUDA / TensorRT 的 Selective Scan 插件获得高效率,面向英伟达 GPU 与 Jetson;路线二以 MobileNetV4 为骨干,只依赖标准 ONNX 算子、不含任何自定义算子,面向早期的 BPU、NPU 与移动平台。其中 MobileNetV4-M-slim-SPF 版本把参数量压到约 6.05M、算力降到 3.78 GMAC(较标准版减少超过一半),NYUD δ1 只下降 0.001,KITTI δ1 只下降 0.003。

产品链接

趋势洞察

DepthART 代表的是一个更广泛的转向:从「把基础模型做得更大」,到「如何把基础模型的能力真正带到设备上」。当大模型的能力被蒸馏、被工程化地塞进几兆参数的躯壳里,端侧设备才可能在不上传数据、不依赖云端的条件下完成感知与决策。对于机器人、智能驾驶、可穿戴设备这些「必须实时、必须离线」的场景来说,这条路线的重要性,可能不亚于基础模型本身的一次版本更新。

本文地址:https://www.163264.com/16177