特斯拉纯视觉与国产智驾:传感器不同,终点可能相同
最近我一直很好奇一件事:特斯拉经常强调“纯视觉”,而国内不少车型会把激光雷达、毫米波雷达和高精度定位写进宣传页。它们究竟是在解决同一个问题,还是各自负责不同的事情?
我原先也把它简单理解成“特斯拉靠摄像头,国产车靠雷达和 GPS”。查完资料以后,我发现这个说法不够准确。GPS 不是用来识别前车和行人的;国内智驾也不是只有一条技术路线。 真正的区别,是系统如何组合感知硬件、数据、模型和安全冗余。
本文讨论的是量产乘用车的驾驶辅助与自动驾驶技术路线,不构成购车建议。不同车型、年份、地区和软件版本的硬件能力并不完全相同;截至 2026 年 9 月,消费者日常接触到的大多数产品仍要求驾驶员持续承担责任。
先说结论
如果把智驾系统比作一个正在开车的人,可以先做一个不严谨但好理解的类比:
- 摄像头像眼睛,擅长识别颜色、文字、车道线、红绿灯和物体语义;
- 激光雷达像一把高速扫描的三维尺子,直接测量空间几何和距离;
- 毫米波雷达更像对速度敏感的测距器,擅长判断目标距离和相对速度;
- GNSS/GPS 告诉车辆“我大概在地图的哪里”;
- IMU、轮速计等则帮助车辆判断“我刚才怎么动了”。
特斯拉当前量产智驾的核心,是以摄像头和视觉神经网络作为环境感知的主要输入,再依靠大规模车队数据、训练基础设施和车端计算完成预测与规划。国内市场则同时存在多传感器融合、视觉优先以及向端到端模型演进的多条路线。
所以,这并不是“视觉与 GPS”的竞争,也不能简单理解为“谁装的传感器多谁就更先进”。传感器决定系统能获得什么信息,模型和工程能力决定这些信息能不能被稳定地使用。
“纯视觉”不等于完全不用 GPS
这是我在查资料时最先修正的一个认识。
“纯视觉”通常是在描述车辆如何感知道路环境:系统主要通过摄像头理解车辆、行人、车道线、交通灯、道路边界和可行驶空间,而不是依赖激光雷达提供三维点云。它并不表示车辆会放弃导航地图、GPS/GNSS 或车身运动信号。
Tesla 的车主手册明确写到,导航系统通过 GPS 信号确定车辆位置,地图也用于规划路线;同时,FSD(Supervised)的说明强调它是需要驾驶员监督的功能,车辆会结合摄像头等输入完成驾驶任务。换句话说:
- GPS/GNSS 回答“车在哪里、目的地往哪走”;
- 摄像头和其他环境传感器回答“周围有什么、现在能不能走”。
普通 GPS 的定位误差、遮挡和漂移都决定了它不能代替环境感知。即使高精度定位能够把车辆放到更精细的地图坐标上,它也不会直接告诉系统前方突然出现了一个行人。
五类传感器到底分别解决什么问题
| 传感器 | 擅长的信息 | 主要局限 | 在系统里的典型作用 |
|---|---|---|---|
| 摄像头 | 颜色、纹理、车道线、信号灯、文字和物体语义 | 受逆光、黑暗、污渍和恶劣天气影响;距离需要估计 | 目标识别、道路理解、可行驶空间判断 |
| 激光雷达 | 三维几何、距离、轮廓和空间结构 | 成本、布置、清洁和点云处理复杂;雨雪也会带来干扰 | 几何测量、障碍物检测、感知冗余 |
| 毫米波雷达 | 距离、方位和相对速度 | 对物体类别、边界和细节的表达不如视觉 | 前车测速、碰撞预警、一定条件下的环境补充 |
| GNSS/GPS | 车辆的全局位置和时间信息 | 隧道、楼宇遮挡和多路径反射会造成误差 | 导航、全局定位、与地图匹配 |
| IMU/轮速计 | 加速度、角速度和车辆短时运动 | 会随时间积累误差 | 组合定位、短时姿态与运动估计 |
这些传感器不是简单的上下级关系。摄像头可以看到红灯是红色,却需要模型推断距离;激光雷达能精确描述一个三维物体,却未必单独知道它是塑料袋还是石块;毫米波雷达善于看速度,但无法独自完成复杂道路语义理解。
Waymo 在介绍其第五代自动驾驶系统时,就把摄像头、激光雷达和雷达描述为相互补充的传感器组合。多传感器方案的价值,不只是“看得更多”,也是在某一类传感器退化时保留另一种物理测量方式。
特斯拉为什么长期坚持视觉优先
从产品和商业角度看,特斯拉的选择并不难理解。
人类主要依靠双眼理解道路,说明视觉信息本身包含了驾驶所需的大量语义。摄像头便宜、体积小,已经广泛安装在量产车辆上。如果同一套相对统一的硬件可以随着模型和数据更新持续进化,软件能力就更容易覆盖庞大的车队。
Tesla 官方 AI 页面把能力拆成视觉与规划、推理硬件以及训练基础设施。它真正押注的并不是“摄像头比所有传感器都强”,而是下面这条链路:
1 | 量产车队采集真实场景 |
这条路线的优势很明确:
- 硬件成本和量产复杂度较低。 不需要为每辆车增加昂贵且布置复杂的传感器组合;
- 车队数据规模更容易形成闭环。 大量同构车辆可以持续提供真实道路样本;
- 能力提升更多来自软件。 同一硬件平台可以通过模型迭代获得新能力。
它的代价也同样明显。视觉并不会天然给出可靠的绝对距离,模型要从连续图像、车辆运动和历史信息中学习三维结构。在强逆光、黑夜、暴雨、镜头污损、异形障碍物和罕见施工场景里,系统必须用数据与模型能力覆盖非常长的尾部。
因此,“少装一种传感器”并不等于问题消失了。它只是把一部分硬件冗余,转换成了更高的数据、模型、算力和验证要求。
国内智驾并不是一条统一路线
把国内方案概括成“激光雷达加 GPS”同样会丢掉很多信息。
以华为为代表的多传感器融合
华为乾崑 ADS 的公开资料长期强调多传感器融合、端到端架构和安全冗余。不同合作车型的具体配置并不一致,但常见组合包括摄像头、激光雷达、毫米波雷达、超声波雷达以及组合定位。
这条路线的思路是:视觉负责语义,激光雷达提供三维几何,毫米波雷达补充距离和速度,再通过统一模型进行融合。它并不是用雷达替代摄像头,而是让多种信息相互校验。
优势是系统可以获得更直接的空间测量和更多物理冗余;代价则是硬件成本、传感器标定、时间同步、数据融合和售后维护都更复杂。如果不同传感器给出矛盾结果,系统还必须判断应该相信谁。
国内厂商也在向视觉优先演进
另一边,小鹏等厂商近年来持续强调“无高精地图”、端到端和 VLA(Vision-Language-Action,视觉—语言—动作)模型。小鹏在 2025 AI Day 同时展示了 VLA 2.0 与 Robotaxi 方向;2026 年 3 月又公布第二代 VLA 2.0 架构和量产部署计划,试图把视觉输入、语言语义和动作生成放进更统一的模型链路。
这说明国内技术路线正在快速交叉:
- 多传感器车型也在使用端到端模型;
- 配备激光雷达,不代表系统仍然依赖传统规则堆叠;
- 视觉优先,也不代表车辆完全不使用导航和车身状态信号;
- 同一家厂商,甚至可能为不同价位、车型和使用场景提供不同硬件配置。
两条路线各自的优势与代价
| 维度 | 视觉优先路线 | 多传感器融合路线 |
|---|---|---|
| 环境感知核心 | 摄像头与视觉模型 | 摄像头、激光雷达、毫米波雷达等融合 |
| 直接三维测量 | 更多依赖模型从时序视觉中估计 | 激光雷达可直接提供几何距离 |
| 硬件成本 | 通常更低,更利于大规模统一部署 | 通常更高,车型配置差异也更大 |
| 系统复杂度 | 硬件较简洁,但模型和数据压力更大 | 硬件、标定、同步和融合链路更复杂 |
| 冗余方式 | 更多依赖多摄像头、时序信息与模型能力 | 可以利用不同物理原理交叉校验 |
| 规模化关键 | 车队数据闭环、训练算力、车端推理 | 融合算法、供应链、成本控制与工程验证 |
我不认为这张表能够直接推出“哪条路线一定胜出”。因为最终用户感受到的不是传感器清单,而是系统能否在真实道路上做出稳定、可预测、可接管的行为。
一套配置豪华但融合不好的系统,可能出现不同传感器互相打架;一套纯视觉系统如果缺少足够长尾数据,也可能在罕见场景里失去判断。硬件只决定上限的一部分,产品体验还取决于数据质量、模型架构、算力、控制系统、人机交互以及安全验证。
我对未来智驾的四个判断
1. 软件架构会趋同,硬件配置仍会分层
Tesla、华为和小鹏公开的技术方向虽然命名不同,但都在向更大规模的神经网络、端到端决策、世界模型或生成式方法靠近。过去需要人工编写的大量“如果……那么……”规则,会逐渐被从真实数据中学习到的统一表示替代。
但硬件未必因此完全统一。高端车型、Robotaxi 和限定区域的 L4 运营车辆,更愿意为传感器冗余付费;大众量产车则会持续追求成本、功耗和规模之间的平衡。
2. 未来的竞争重点会从“装了什么”转向“失败时怎么办”
宣传页很容易比较激光雷达数量、摄像头像素和芯片算力,真正困难的是:
- 镜头被雨水遮住时,系统能否识别自己已经看不清;
- 道路施工与地图冲突时,系统相信实时环境还是历史信息;
- 模型不确定时,车辆如何降级、提醒和安全退出;
- 软件更新以后,旧能力是否发生回退。
一个成熟的系统不仅要在正常场景里“会开”,还要知道自己什么时候不会。
3. 数据闭环会比单次演示更重要
端到端模型并不会自动解决长尾问题。它仍然需要持续发现失败样本、重建场景、训练、仿真、回归测试和小范围验证。真正的壁垒可能不是某一个网络结构,而是企业能否把偶发问题稳定地变成数据,再把数据变成可验证的软件改进。
4. L2/L2+ 与真正的无人驾驶仍有责任边界
NHTSA 对自动化等级的解释很清楚:在 Level 2 中,即使系统同时控制转向、加速和制动,驾驶员仍然需要持续监督。Tesla 也把当前面向消费者的产品称为 FSD(Supervised)。中国的智能网联汽车准入和上路通行试点,则把责任主体、安全监测、数据记录和应急处置纳入了要求。
从“辅助驾驶很好用”走到“驾驶员可以合法、持续地不看路”,中间还有法规、责任划分、系统安全论证和运营设计域等问题。技术进步很快,但命名不能替代责任边界。
最后留下的结论
我最初好奇的是:为什么特斯拉敢不用激光雷达,而国内车型却经常把雷达数量写在最醒目的位置?
现在我的理解是,两条路线在解决同一个目标,却选择了不同的风险分配方式:
- 视觉优先路线把更多难题交给数据、模型和算力;
- 多传感器路线用额外硬件获得直接测量和冗余,同时承担融合与成本复杂度。
未来它们可能不会一直泾渭分明。模型架构会相互借鉴,硬件会按车型和场景分层,真正拉开差距的,是系统能否持续处理长尾场景,并在能力边界之外安全地退让。
所以,我之后再看一辆车的智驾能力,不会只问“有没有激光雷达”,也不会只听“是不是端到端”。我更想知道的是:它依靠什么信息做判断,遇到不确定性时怎么处理,出了问题以后能不能通过数据闭环真正改进。
参考资料
以下均为官方或原始资料,访问日期为 2026 年 9 月 16 日:
- Tesla AI:Autopilot、视觉与规划、推理硬件和训练基础设施
- Tesla:Full Self-Driving(Supervised)说明
- Tesla Model Y Owner’s Manual:Full Self-Driving(Supervised)
- Tesla Model Y Owner’s Manual:Maps and Navigation
- 华为:乾崑智能技术发布,ADS 4 采用全新 WEWA 架构
- 华为:乾崑智驾 ADS 5 与自动驾驶网络
- XPENG 2025 AI Day:VLA 2.0 与 Robotaxi 方向
- XPENG:第二代 VLA 2.0 架构与量产部署计划
- Waymo:第五代 Waymo Driver 的摄像头、激光雷达与雷达组合
- NHTSA:驾驶自动化等级与驾驶员责任
- 工业和信息化部等四部门:开展智能网联汽车准入和上路通行试点









