最近我一直很好奇一件事:特斯拉经常强调“纯视觉”,而国内不少车型会把激光雷达、毫米波雷达和高精度定位写进宣传页。它们究竟是在解决同一个问题,还是各自负责不同的事情?

我原先也把它简单理解成“特斯拉靠摄像头,国产车靠雷达和 GPS”。查完资料以后,我发现这个说法不够准确。GPS 不是用来识别前车和行人的;国内智驾也不是只有一条技术路线。 真正的区别,是系统如何组合感知硬件、数据、模型和安全冗余。

本文讨论的是量产乘用车的驾驶辅助与自动驾驶技术路线,不构成购车建议。不同车型、年份、地区和软件版本的硬件能力并不完全相同;截至 2026 年 9 月,消费者日常接触到的大多数产品仍要求驾驶员持续承担责任。

先说结论

如果把智驾系统比作一个正在开车的人,可以先做一个不严谨但好理解的类比:

  • 摄像头像眼睛,擅长识别颜色、文字、车道线、红绿灯和物体语义;
  • 激光雷达像一把高速扫描的三维尺子,直接测量空间几何和距离;
  • 毫米波雷达更像对速度敏感的测距器,擅长判断目标距离和相对速度;
  • GNSS/GPS 告诉车辆“我大概在地图的哪里”;
  • IMU、轮速计等则帮助车辆判断“我刚才怎么动了”。

特斯拉当前量产智驾的核心,是以摄像头和视觉神经网络作为环境感知的主要输入,再依靠大规模车队数据、训练基础设施和车端计算完成预测与规划。国内市场则同时存在多传感器融合、视觉优先以及向端到端模型演进的多条路线。

所以,这并不是“视觉与 GPS”的竞争,也不能简单理解为“谁装的传感器多谁就更先进”。传感器决定系统能获得什么信息,模型和工程能力决定这些信息能不能被稳定地使用。

摄像头、激光雷达、毫米波雷达、GNSS 与 IMU 在智驾系统中的职责

“纯视觉”不等于完全不用 GPS

这是我在查资料时最先修正的一个认识。

“纯视觉”通常是在描述车辆如何感知道路环境:系统主要通过摄像头理解车辆、行人、车道线、交通灯、道路边界和可行驶空间,而不是依赖激光雷达提供三维点云。它并不表示车辆会放弃导航地图、GPS/GNSS 或车身运动信号。

Tesla 的车主手册明确写到,导航系统通过 GPS 信号确定车辆位置,地图也用于规划路线;同时,FSD(Supervised)的说明强调它是需要驾驶员监督的功能,车辆会结合摄像头等输入完成驾驶任务。换句话说:

  • GPS/GNSS 回答“车在哪里、目的地往哪走”;
  • 摄像头和其他环境传感器回答“周围有什么、现在能不能走”。

普通 GPS 的定位误差、遮挡和漂移都决定了它不能代替环境感知。即使高精度定位能够把车辆放到更精细的地图坐标上,它也不会直接告诉系统前方突然出现了一个行人。

五类传感器到底分别解决什么问题

传感器 擅长的信息 主要局限 在系统里的典型作用
摄像头 颜色、纹理、车道线、信号灯、文字和物体语义 受逆光、黑暗、污渍和恶劣天气影响;距离需要估计 目标识别、道路理解、可行驶空间判断
激光雷达 三维几何、距离、轮廓和空间结构 成本、布置、清洁和点云处理复杂;雨雪也会带来干扰 几何测量、障碍物检测、感知冗余
毫米波雷达 距离、方位和相对速度 对物体类别、边界和细节的表达不如视觉 前车测速、碰撞预警、一定条件下的环境补充
GNSS/GPS 车辆的全局位置和时间信息 隧道、楼宇遮挡和多路径反射会造成误差 导航、全局定位、与地图匹配
IMU/轮速计 加速度、角速度和车辆短时运动 会随时间积累误差 组合定位、短时姿态与运动估计

这些传感器不是简单的上下级关系。摄像头可以看到红灯是红色,却需要模型推断距离;激光雷达能精确描述一个三维物体,却未必单独知道它是塑料袋还是石块;毫米波雷达善于看速度,但无法独自完成复杂道路语义理解。

Waymo 在介绍其第五代自动驾驶系统时,就把摄像头、激光雷达和雷达描述为相互补充的传感器组合。多传感器方案的价值,不只是“看得更多”,也是在某一类传感器退化时保留另一种物理测量方式。

特斯拉为什么长期坚持视觉优先

从产品和商业角度看,特斯拉的选择并不难理解。

人类主要依靠双眼理解道路,说明视觉信息本身包含了驾驶所需的大量语义。摄像头便宜、体积小,已经广泛安装在量产车辆上。如果同一套相对统一的硬件可以随着模型和数据更新持续进化,软件能力就更容易覆盖庞大的车队。

Tesla 官方 AI 页面把能力拆成视觉与规划、推理硬件以及训练基础设施。它真正押注的并不是“摄像头比所有传感器都强”,而是下面这条链路:

1
2
3
4
5
6
7
8
9
量产车队采集真实场景
↓
发现失败案例与长尾问题
↓
数据筛选、自动标注与训练
↓
模型更新并回到车端
↓
继续积累新的困难场景

这条路线的优势很明确:

  1. 硬件成本和量产复杂度较低。 不需要为每辆车增加昂贵且布置复杂的传感器组合;
  2. 车队数据规模更容易形成闭环。 大量同构车辆可以持续提供真实道路样本;
  3. 能力提升更多来自软件。 同一硬件平台可以通过模型迭代获得新能力。

它的代价也同样明显。视觉并不会天然给出可靠的绝对距离,模型要从连续图像、车辆运动和历史信息中学习三维结构。在强逆光、黑夜、暴雨、镜头污损、异形障碍物和罕见施工场景里,系统必须用数据与模型能力覆盖非常长的尾部。

因此,“少装一种传感器”并不等于问题消失了。它只是把一部分硬件冗余,转换成了更高的数据、模型、算力和验证要求。

国内智驾并不是一条统一路线

把国内方案概括成“激光雷达加 GPS”同样会丢掉很多信息。

以华为为代表的多传感器融合

华为乾崑 ADS 的公开资料长期强调多传感器融合、端到端架构和安全冗余。不同合作车型的具体配置并不一致,但常见组合包括摄像头、激光雷达、毫米波雷达、超声波雷达以及组合定位。

这条路线的思路是:视觉负责语义,激光雷达提供三维几何,毫米波雷达补充距离和速度,再通过统一模型进行融合。它并不是用雷达替代摄像头,而是让多种信息相互校验。

优势是系统可以获得更直接的空间测量和更多物理冗余;代价则是硬件成本、传感器标定、时间同步、数据融合和售后维护都更复杂。如果不同传感器给出矛盾结果,系统还必须判断应该相信谁。

国内厂商也在向视觉优先演进

另一边,小鹏等厂商近年来持续强调“无高精地图”、端到端和 VLA(Vision-Language-Action,视觉—语言—动作)模型。小鹏在 2025 AI Day 同时展示了 VLA 2.0 与 Robotaxi 方向;2026 年 3 月又公布第二代 VLA 2.0 架构和量产部署计划,试图把视觉输入、语言语义和动作生成放进更统一的模型链路。

这说明国内技术路线正在快速交叉:

  • 多传感器车型也在使用端到端模型;
  • 配备激光雷达,不代表系统仍然依赖传统规则堆叠;
  • 视觉优先,也不代表车辆完全不使用导航和车身状态信号;
  • 同一家厂商,甚至可能为不同价位、车型和使用场景提供不同硬件配置。

Tesla 视觉优先路线与国内典型多传感器融合路线对比

两条路线各自的优势与代价

维度 视觉优先路线 多传感器融合路线
环境感知核心 摄像头与视觉模型 摄像头、激光雷达、毫米波雷达等融合
直接三维测量 更多依赖模型从时序视觉中估计 激光雷达可直接提供几何距离
硬件成本 通常更低,更利于大规模统一部署 通常更高,车型配置差异也更大
系统复杂度 硬件较简洁,但模型和数据压力更大 硬件、标定、同步和融合链路更复杂
冗余方式 更多依赖多摄像头、时序信息与模型能力 可以利用不同物理原理交叉校验
规模化关键 车队数据闭环、训练算力、车端推理 融合算法、供应链、成本控制与工程验证

我不认为这张表能够直接推出“哪条路线一定胜出”。因为最终用户感受到的不是传感器清单,而是系统能否在真实道路上做出稳定、可预测、可接管的行为。

一套配置豪华但融合不好的系统,可能出现不同传感器互相打架;一套纯视觉系统如果缺少足够长尾数据,也可能在罕见场景里失去判断。硬件只决定上限的一部分,产品体验还取决于数据质量、模型架构、算力、控制系统、人机交互以及安全验证。

我对未来智驾的四个判断

1. 软件架构会趋同,硬件配置仍会分层

Tesla、华为和小鹏公开的技术方向虽然命名不同,但都在向更大规模的神经网络、端到端决策、世界模型或生成式方法靠近。过去需要人工编写的大量“如果……那么……”规则,会逐渐被从真实数据中学习到的统一表示替代。

但硬件未必因此完全统一。高端车型、Robotaxi 和限定区域的 L4 运营车辆,更愿意为传感器冗余付费;大众量产车则会持续追求成本、功耗和规模之间的平衡。

2. 未来的竞争重点会从“装了什么”转向“失败时怎么办”

宣传页很容易比较激光雷达数量、摄像头像素和芯片算力,真正困难的是:

  • 镜头被雨水遮住时,系统能否识别自己已经看不清;
  • 道路施工与地图冲突时,系统相信实时环境还是历史信息;
  • 模型不确定时,车辆如何降级、提醒和安全退出;
  • 软件更新以后,旧能力是否发生回退。

一个成熟的系统不仅要在正常场景里“会开”,还要知道自己什么时候不会。

3. 数据闭环会比单次演示更重要

端到端模型并不会自动解决长尾问题。它仍然需要持续发现失败样本、重建场景、训练、仿真、回归测试和小范围验证。真正的壁垒可能不是某一个网络结构,而是企业能否把偶发问题稳定地变成数据,再把数据变成可验证的软件改进。

4. L2/L2+ 与真正的无人驾驶仍有责任边界

NHTSA 对自动化等级的解释很清楚:在 Level 2 中,即使系统同时控制转向、加速和制动,驾驶员仍然需要持续监督。Tesla 也把当前面向消费者的产品称为 FSD(Supervised)。中国的智能网联汽车准入和上路通行试点,则把责任主体、安全监测、数据记录和应急处置纳入了要求。

从“辅助驾驶很好用”走到“驾驶员可以合法、持续地不看路”,中间还有法规、责任划分、系统安全论证和运营设计域等问题。技术进步很快,但命名不能替代责任边界。

最后留下的结论

我最初好奇的是:为什么特斯拉敢不用激光雷达,而国内车型却经常把雷达数量写在最醒目的位置?

现在我的理解是,两条路线在解决同一个目标,却选择了不同的风险分配方式:

  • 视觉优先路线把更多难题交给数据、模型和算力;
  • 多传感器路线用额外硬件获得直接测量和冗余,同时承担融合与成本复杂度。

未来它们可能不会一直泾渭分明。模型架构会相互借鉴,硬件会按车型和场景分层,真正拉开差距的,是系统能否持续处理长尾场景,并在能力边界之外安全地退让。

所以,我之后再看一辆车的智驾能力,不会只问“有没有激光雷达”,也不会只听“是不是端到端”。我更想知道的是:它依靠什么信息做判断,遇到不确定性时怎么处理,出了问题以后能不能通过数据闭环真正改进。

参考资料

以下均为官方或原始资料,访问日期为 2026 年 9 月 16 日:

  1. Tesla AI:Autopilot、视觉与规划、推理硬件和训练基础设施
  2. Tesla:Full Self-Driving(Supervised)说明
  3. Tesla Model Y Owner’s Manual:Full Self-Driving(Supervised)
  4. Tesla Model Y Owner’s Manual:Maps and Navigation
  5. 华为:乾崑智能技术发布,ADS 4 采用全新 WEWA 架构
  6. 华为:乾崑智驾 ADS 5 与自动驾驶网络
  7. XPENG 2025 AI Day:VLA 2.0 与 Robotaxi 方向
  8. XPENG:第二代 VLA 2.0 架构与量产部署计划
  9. Waymo:第五代 Waymo Driver 的摄像头、激光雷达与雷达组合
  10. NHTSA:驾驶自动化等级与驾驶员责任
  11. 工业和信息化部等四部门:开展智能网联汽车准入和上路通行试点