1. 从“辅助”到“大脑”:Thor芯片如何重新定义汽车计算

如果你最近关注过智能汽车或者机器人,大概率会听到一个名字:英伟达Thor。这可不是漫威电影里那个甩锤子的神,而是一颗实实在在的、被黄仁勋称为“机器人的新大脑”的超级芯片。我第一次看到Thor的参数时,感觉就像十年前第一次用上智能手机——那种性能的跨越感,是颠覆性的。

简单来说,Thor是一颗系统级芯片,你可以把它理解为一台超高性能的电脑,但体积只有指甲盖大小,并且是专门为汽车和机器人设计的。它最吓人的地方在于算力:FP8精度下1035 TFLOPS,FP4精度下更是高达2070 TFLOPS。这是什么概念?它的前代明星产品Orin,算力大约是254 TOPS。也就是说,Thor的算力是Orin的7.5倍以上。这种提升不是挤牙膏,而是直接换了个水龙头。

但Thor的意义远不止是算力数字的飙升。它真正的革命性在于,它瞄准了智能汽车发展的终极形态:中央集中式电子电气架构。过去的汽车,像是一个由几十个甚至上百个“小脑”(ECU电子控制单元)控制的复杂机器,每个“小脑”只管自己的一亩三分地,比如车窗升降、发动机控制、仪表盘显示。这种分布式架构导致线束复杂、成本高昂、软件升级困难。

而Thor的设计理念是“一芯多用,多域融合”。它一颗芯片,就能同时、安全、互不干扰地处理原本需要多个芯片才能完成的工作:自动驾驶的感知、决策、规划,智能座舱的语音交互、高清大屏、游戏娱乐,甚至车身控制、泊车辅助。这就像以前你需要一台电脑办公、一台游戏机娱乐、一台服务器处理数据,现在一台Thor全搞定了。这种整合带来的好处是实实在在的:整车线束减少、重量降低、功耗优化,更重要的是,软件可以统一开发、统一OTA升级,车企的开发效率和迭代速度会得到质的飞跃。

所以,Thor的出现,标志着一个新时代的开始。它不再仅仅是一颗“自动驾驶芯片”,而是智能汽车乃至整个物理AI世界的“中央计算单元”。它要解决的,是如何让机器更高效、更智能地理解和应对我们身处的这个复杂、动态的真实世界。

2. 硬核拆解:Thor的“肌肉”与“神经”是如何炼成的

光有“中央大脑”的愿景还不够,得有过硬的硬件本事。Thor能担此大任,靠的是其在架构、工艺和能效上的一系列“组合拳”。咱们来拆开看看,这颗芯片的“肌肉”和“神经”到底强在哪里。

2.1 Blackwell GPU架构:为Transformer而生的计算引擎

Thor的核心动力,来自于英伟达最新的Blackwell GPU架构。如果说之前的架构是“多面手”,那么Blackwell就是为当下AI浪潮的核心——Transformer模型——量身定制的“特种兵”。

Transformer模型,正是驱动ChatGPT、自动驾驶端到端大模型的技术基石。它的特点是计算极其密集,对内存带宽和并行处理能力要求变态的高。Blackwell架构里最关键的创新是Transformer引擎。这个引擎能智能地在FP8和FP4等低精度格式之间动态切换。简单理解,就是在保证计算准确度的前提下,用更“轻量”的数据格式进行运算,从而大幅提升计算速度和能效。实测下来,对于大语言模型和自动驾驶感知模型,这种优化能带来数倍的性能提升。这意味着,Thor可以更流畅、更实时地在车端运行复杂的多模态大模型,让车真正“听懂”你的话,并“看懂”周围的世界。

此外,Thor集成了多达2560个CUDA核心和96个第五代Tensor Core。CUDA核心是通用并行计算的基石,处理各种图形和计算任务;而Tensor Core则是专门为矩阵运算(AI计算的核心)设计的加速器,效率极高。这种组合确保了Thor既能应对AI推理的爆发性算力需求,也能兼顾图形渲染、传感器数据处理等多样化任务。

2.2 高带宽内存与多域计算:打破“数据拥堵”的瓶颈

有了强大的计算引擎,还得有高速的“数据公路”把“粮食”(数据)运过去。Thor配备了128GB的LPDDR5X内存,带宽高达273GB/s。这个数字非常关键。现代自动驾驶汽车装备了十几个摄像头、激光雷达、毫米波雷达,每秒钟产生的数据量是海量的。如果内存带宽不够,再强的算力也会“饿肚子”,等着数据排队,造成延迟。高带宽内存确保了海量传感器数据能够被快速吞吐,为实时决策提供保障。

更精妙的是Thor的多域计算和虚拟化能力。它通过硬件级的虚拟化技术,可以把一颗物理芯片划分成多个逻辑上完全独立、安全隔离的“虚拟芯片”。比如,一部分算力资源运行QNX这种高实时性、高安全性的操作系统,专门处理自动驾驶控制;另一部分同时运行Linux或Android,负责智能座舱的娱乐和信息服务。它们之间互不干扰,就像在一栋大楼里建了多个有独立安保、独立水电的套房。这完美解决了功能安全要求极高的驾驶系统与开放性要求高的娱乐系统共存的问题,是实现“舱驾一体”的硬件基石。

2.3 能效与工艺:在性能与功耗间走钢丝

把这么多强大的部件塞进一颗车规级芯片,功耗和发热是巨大的挑战。Thor采用了台积电4nm制程工艺和先进的CoWoS-R封装技术。4nm工艺意味着晶体管更小、更密集,在相同面积下能塞进更多晶体管(Thor有770亿个),同时功耗更低。CoWoS封装则像给芯片内部修了立交桥,让不同计算核心和内存之间的通信路径更短、更快,进一步降低功耗和延迟。

最终,Thor的功耗可以配置在40W到130W之间。你可能觉得130W不低,但考虑到它整合了原本需要多个芯片、总功耗可能超过数百瓦的功能,并且其能效比相比前代提升了3.5倍,这个功耗控制已经非常出色。它让高性能计算从云端数据中心,真正走进了对功耗极其敏感的移动边缘设备——汽车和机器人里。

3. 软件生态:Thor的“灵魂”与Isaac平台的威力

在芯片行业待久了,我深刻体会到一句话:“硬件决定下限,软件生态决定上限。”一颗再强的芯片,如果没有完善的工具链和开发者生态,也只是一块昂贵的硅片。英伟达最让对手头疼的,正是其围绕CUDA构建的、长达十余年的软硬件协同生态。Thor的威力,一半要归功于它背后强大的软件栈。

3.1 NVIDIA Isaac机器人平台:从虚拟训练到真实部署的闭环

对于机器人开发来说,最大的成本和风险是什么?是在现实世界中反复试错。让一个机器人学习走路、抓取物体,如果在现实中训练,效率极低且可能损坏硬件。英伟达的Isaac平台就是为了解决这个问题而生的。

Isaac平台的核心是 Isaac Sim,一个基于Omniverse的、高保真度的机器人仿真模拟器。开发者可以在Isaac Sim里构建一个物理属性极其真实的虚拟世界,创建成千上万个机器人“数字孪生”,让它们在其中7x24小时不间断地训练、学习、碰撞、试错。我试过用Isaac Sim训练一个机械臂抓取随机摆放的物体,在虚拟环境中训练几天,得到的模型直接部署到真实的机器人上,成功率非常高。这种“仿真到现实”的迁移能力,将机器人开发周期从年缩短到月,成本大幅降低。

而Thor芯片,正是Isaac平台在物理世界的“最佳载体”。通过CUDA、TensorRT等工具链,在Isaac Sim中训练好的AI模型可以无缝、高效地部署到Thor上运行。这意味着,从算法研发、仿真测试到上车/上机器人部署,形成了一条高度自动化的流水线。

3.2 DriveOS与LLM SDK:让大模型在车端“跑起来”

随着ChatGPT的火爆,如何让大语言模型在车端运行,成为智能座舱的新竞赛。Thor凭借其惊人的算力,自然是运行端侧大模型的理想平台。但光有算力不够,还需要专门的软件优化。

这就是NVIDIA DriveOS LLM SDK的价值所在。它是一套专门为在DRIVE平台(包括Orin和Thor)上部署大语言模型和多模态模型而设计的工具包。它做了很多底层优化,比如:

  • 专用插件与内核:针对LLM中注意力机制等关键组件进行了深度优化,比如集成了高效的AttentionPlugin,支持动态批处理和序列长度。
  • 先进的量化支持:支持FP8、INT4等低精度格式。通过量化,可以在几乎不损失精度的情况下,将模型体积和内存占用减少数倍,这对于车端有限的存储和带宽至关重要。
  • 简化的部署流程:提供了从Hugging Face模型导出ONNX,再到构建TensorRT引擎的一站式工具。开发者不需要关心底层复杂的移植工作,可以更专注于应用开发。

有了这个SDK,车企可以相对轻松地将类似Llama、Qwen这样的主流大模型部署到Thor上,实现真正智能、低延迟的语音助手、文档总结、代码生成甚至图像理解功能,让车从“功能机”进化为“智能体”。

4. 重塑格局:Thor在自动驾驶与机器人领域的落地冲击

聊了这么多技术和软件,最终还是要看落地。Thor这颗“核弹”投入市场,正在对自动驾驶和机器人两个领域产生深远的范式冲击。

4.1 自动驾驶:加速迈向“舱驾一体”与端到端

在自动驾驶领域,Thor带来的最直接变化是推动了 “舱驾一体” 方案的成熟。以前,高端车型可能需要一颗Orin做智驾,一颗高通8155做座舱。而一颗Thor,凭借其多域隔离能力,可以同时胜任这两项工作。像极氪已经宣布将从2025年开始在其下一代平台上使用Thor。这种整合不仅降低了系统的复杂性和成本,更重要的是为“软件定义汽车”提供了更统一、强大的硬件底座。所有功能都运行在同一套硬件上,OTA升级可以更彻底,功能迭代也更灵活。

更深层次的影响在于,Thor为 “端到端自动驾驶” 铺平了道路。传统的自动驾驶系统是模块化的:感知、预测、规划、控制各自为政,像流水线一样传递信息,存在误差累积和延迟。而端到端模型,则是用一个庞大的神经网络,从传感器输入直接映射到方向盘、油门刹车的控制信号。这种方式更接近人类驾驶,潜力巨大,但对算力的需求是指数级增长。Thor的2000 TOPS级算力和Transformer引擎,正是为了运行这种庞然大物般的端到端模型而准备的。它让车企有能力去探索这条更前沿、也更根本的技术路径。

4.2 机器人:为人形机器人注入“灵魂”

如果说在汽车领域Thor是“融合与集中”,那么在机器人领域,它带来的则是“敏捷与智能”的飞跃。英伟达专门为机器人推出了基于Thor的 Jetson Thor 计算平台。

人形机器人是当前最热的风口之一,但它的核心挑战在于需要在一个移动、功耗受限的平台上,实时处理视觉、语音、力觉等多模态信息,并做出复杂的全身协同运动规划。这需要前所未有的计算密度和能效。Jetson Thor的出现,正好补上了这块短板。它能为机器人提供运行Project GR00T等通用机器人基础模型所需的算力。

Project GR00T是一个多模态大模型,旨在成为机器人的“大脑”,让机器人能通过观察人类来学习技能,理解自然语言指令。你可以想象,未来机器人看到你收拾桌子,它就能学会帮忙;你告诉它“把那个红色的杯子拿过来”,它就能准确理解并执行。这种高级的认知和模仿能力,必须依赖像Thor这样强大的本地计算平台进行实时推理,因为依赖云端通信的延迟是无法接受的。

目前,包括Figure、Agility Robotics、宇树科技等全球领先的人形机器人公司,都在基于英伟达的Isaac平台和Jetson Thor进行开发。Thor正在成为下一代智能机器人的标准“心脏”和“大脑”。

5. 挑战与未来:Thor之后的计算演进方向

当然,Thor并非完美无缺,它的出现也引出了新的问题和挑战。首先就是成本。Thor的开发套件售价高达3499美元,最终的车规级芯片成本对于车企来说是一笔不小的投入。这决定了它初期将主要应用于高端车型和机器人产品,如何通过规模效应和技术迭代降低成本,是其能否普及的关键。

其次,是软件与算法的适配。有了强大的算力,如何设计出能充分利用这些算力的算法模型,是对AI算法工程师的巨大考验。端到端模型、世界模型等前沿方向都还在快速演进中,硬件和软件需要更紧密地协同进化。

展望未来,Thor已经为我们指明了几个清晰的技术演进方向:

  • 算力持续攀升与能效极致优化:摩尔定律虽然在放缓,但通过架构创新(如Chiplet芯粒技术)、先进封装和新型计算范式(如存算一体),算力仍将保持增长,同时能效比会越来越被重视。
  • 软硬件协同设计深化:未来的芯片设计将越来越从上层应用和算法出发。就像Thor的Transformer引擎,未来的芯片可能会有更多针对特定AI范式的专用处理单元,实现“算法即硬件”。
  • 跨域融合成为常态:Thor的“舱驾一体”只是开始。未来,车与路、车与云、机器人与环境之间的计算将会更紧密地融合,形成一张动态的、分布式的智能计算网络。

从我这些年的经验来看,Thor这类芯片的出现,标志着一个临界点的到来:AI计算的重心,正从云端训练不可逆转地向边缘端推理倾斜。我们正在进入一个物理世界被智能深度改造的时代,而像Thor这样的高性能、高集成度计算平台,正是开启这个时代的钥匙。它逼着整个行业重新思考硬件架构、软件开发和产品形态。对于开发者和车企来说,现在需要思考的不是用不用,而是如何尽快基于这样的新平台,构建自己下一代的核心竞争力。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐