JetPack 7 把 Jetson 家族劈成了两半:买边缘 AI 板,先看清软件栈再下单

AI小蝌蚪AI 前沿2026-09-17570 阅读💛 95 收藏

Thor 跑 SBSA 和统一的 CUDA 13 Arm 工具链,Orin 仍停在 sm_87。决定买哪块的,是软件栈,不是 TOPS 图表。

Jetson 盒子上的 TOPS 数字是产品页上最没用的事实:NVIDIA 现在用一个家族名盖住两个固件世界——Thor 是 Arm 服务器,Orin 是 Tegra 板卡——而 JetPack 7 同时覆盖两者。

这是 The Possible 专栏的第一篇:把 AI 塞进机器人、无人机、自助终端或桌面盒子的硬件、固件与软件。今天 NVIDIA 的论点很简单:如果你在 2026 年底买 Jetson,你买的是一份软件合同。

一个品牌,两套栈

JetPack 7 是 Jetson 的官方软件栈。[3] 它跑 Linux 内核 6.8 和 Ubuntu 24.04 LTS。[3] 新增了可抢占的实时内核、Thor 上的 Multi-Instance GPU,以及 Holoscan Sensor Bridge。[3] 当前下载是 JetPack 7.2.1 配 Jetson Linux 39.2.1,驱动包日期 2026 年 8 月 11 日。[5]

那份发布在 ISO 镜像里列出了 CUDA 13.2.1、cuDNN 9.20.0、TensorRT 10.16.2、VPI 4.1.3、DeepStream 9.1、Holoscan SDK 3.9.0、Nsight Systems 2026.3 和 NVIDIA Container Toolkit 1.19。[5] Isaac ROS 标注「即将推出」。[5] ISO 安装器现在默认把 Jetson Orin Nano 开发套件刷成 Super 模式。[5] SD 卡镜像没有了,你得从 U 盘刷。[5]

这些版本钉比峰值 TFLOPS 那一行重要得多,因为它们决定你的 PyTorch 轮子、你的 vLLM 容器、你的载板 BSP 到底装不装得上。

分叉就在这些钉子底下。JetPack 7 起,Jetson 软件对齐了服务器基础系统架构(SBSA),「把 Jetson Thor 摆在行业标准 Arm 服务器设计旁边」。[2][3][5] NVIDIA 说 SBSA 为操作系统支持和可移植性标准化了硬件与固件接口。[3] 在那个地基上,「Jetson Thor 现在支持跨所有 Arm 目标的统一 NVIDIA CUDA 13.0 安装」。[3]

Orin 是例外。CUDA 13.0 统一了 SBSA 服务器和 Thor 的工具链。「唯一的例外是 Orin(sm_87),它暂时继续走现有路径。」[4] 你仍然可以在 Orin 家族上跑 JetPack 7.2.1。[5] 你不能假装编译器故事是同一个。

手动刷机变了,因为 Thor 用 SBSA。NVIDIA 要求仔细跟随 r39.2.1 的刷机说明。[5]

Thor 到底是什么

NVIDIA 产品页给 Jetson Thor 系列模组标到 2070 FP4 TFLOPS 的 AI 算力和 128 GB 内存——1.5 倍于 Jetson AGX Orin 的性能、3.5 倍能效——封装在 40–130 W 之间。[1] 2070 TFLOPS 是 130 W 下的实测性能。[1] 内存带宽 273 GB/s。[1] 顶级 CPU 是 14 核。[1]

产品页上在售的 SKU 是 AGX Thor 开发套件、Jetson T5000 和 Jetson T4000。[1]

项目AGX Thor 开发套件 / T5000Jetson T4000
AI 性能2070 TFLOPS(FP4—稀疏)1200 TFLOPS(FP4—稀疏)
GPU2560 核 Blackwell,第五代 Tensor Core,MIG,10 TPC1536 核 Blackwell,第五代 Tensor Core,MIG,6 TPC
GPU 最高频率1.57 GHz1.53 GHz
CPU14 核 Arm Neoverse-V3AE,每核 1 MB L2,共享 16 MB L312 核 Arm Neoverse-V3AE,相同缓存结构
CPU 最高频率2.6 GHz2.6 GHz
内存128 GB 256-bit LPDDR5X,273 GB/s64 GB 256-bit LPDDR5X,273 GB/s
功耗40 W–130 W40 W–70 W
模组网络4× 25GbE3× 25GbE
模组尺寸100 mm × 87 mm,699 引脚(T5000)100 mm × 87 mm

来源:NVIDIA Jetson Thor 产品表。[1] T4000 的 AI、GPU、CPU、内存和功耗来自同一张表。开发套件在 M.2 Key M 槽加了 1 TB NVMe、1× 5GbE RJ45、1× QSFP28(4× 25GbE)、HDMI 2.0b、DisplayPort 1.4a,以及 243.19 × 112.40 × 56.88 mm 的机箱。[1]

2025 年 8 月的技术介绍(仍是 T5000 的权威文章)重申了 130 W 内同样的 2070 稀疏 FP4 TFLOPS,并补充了密集档位:T5000 上 1035 TFLOPS 密集 FP4 / 稀疏 FP8 / 稀疏 INT8,以及 517 TFLOPS 密集 FP8 / 稀疏 FP16。T4000 在同阶梯上是 1200 / 600 / 300。[2] 那张表里的 Tensor Core 数量是 T5000 96 个、T4000 64 个。[2] 介绍中 T4000 的数字标注为初步。[2]

不要把稀疏 FP4 峰值跟 Orin 的 INT8 TOPS 混为一谈,它们是不同的计量表。NVIDIA 用稀疏 FP4 TFLOPS 报 Thor,用 INT8 TOPS 报 Orin Nano Super。[1][6]

开发套件集成的是 T5000 模组。[2] 模组侧的相机 I/O 包括 Holoscan Sensor Bridge——经 HSB 最多 20 路相机、经 16 条 MIPI CSI-2 通道最多 6 路、用虚拟通道最多 32 路,C-PHY 2.1 at 10.25 Gbps 和 D-PHY 2.1 at 40 Gbps。[2]

自己数 SM

营销图里仍然飘着一个 3,072 CUDA 核的「最大架构配置」。NVIDIA 员工在开发者论坛引用 Jetson-Thor-Series-Modules-Datasheet_DS-11945-001v1.3.pdf 说,Thor 开发套件是 2,560 CUDA 核,不是 3,072。[10] 同帖后续:2,560 CUDA 核 ÷ 每 SM 128 核 = 20 个 SM。Blackwell 每个 SM 有 4 个 Tensor Core,也就是 80 个,对上数据表里 T5000 的 96 个 Tensor Core。[10] 同一帖更晚的帖子报告了 CUDA Driver API 查询:GPU 名 NVIDIA Thor,SM 数 20,L2 缓存 32 MiB,每 SM 最大共享内存 228 KiB。[10]

把产品页的 2,560 核当作出货 GPU。[1] 把 3,072 当作满芯片设计图,直到数据表和 nvidia-smi 达成一致。论坛不是数据表,但它是正确的那类怀疑。

JetPack 7.2 的 MIG 切分跟 20 SM 的 GPU 吻合。NVIDIA 把 Thor 切成两个隔离实例:12 SM / 1,536 CUDA 核给 AI 和图形,8 SM / 1,024 CUDA 核给机器人、控制、感知或安全关键工作。[7] 专属算力、缓存和内存带宽,加上 JetPack 7 的可抢占 RT 内核,重点在于:一颗 SoC 上跑混合关键级任务,不让聊天机器人偷走控制循环的周期。[7]

CUDA 13 才是 Thor 的真功能

Thor 的 CUDA 13.0 统一了服务器级 Arm 和嵌入式 Thor 的工具链。[4] NVIDIA 的说法是一次构建、在 GB200 和 DGX Spark 这类系统上仿真、再把同一个二进制无改动部署到 Thor。[4] 编译器仍然面向目标 GPU 生成代码。[4] 你不再维护两套工具链,容器跟随同一统一。[4]

那句话在 NVIDIA 自己的 CUDA 13 文章里点名 DGX Spark 作为仿真宿主,[4] 不是声称某个实验室今天就在跑 Spark。

Thor 还拿到了全一致的统一虚拟内存。[4] cudaDeviceProp::pageableMemoryAccessUsesHostPageTables 为 1,所以 GPU 可以走宿主页表访问可分页 CPU 内存。[4] 硬件保持 GPU 和 CPU 缓存一致。[4] mmap()malloc() 的缓冲可以直接进内核,不需要 CUDA 分配器。[4] cudaMallocManaged() 报告 concurrentManagedAccess 为 1,所以 cudaMemPrefetchAsync() 可用,但在 CUDA 13.0 里这些托管分配不做 GPU 缓存。[4] NVIDIA 说这把 Jetson UVM 拉齐到独显水平,带那个缓存告警。[4]

GPU 共享在成熟。[4] MPS 把小而突发的过程合并进一个 GPU 上下文,应用无需改动。[4] Green contexts 与之并列。[4] CUDA 13.0 还把 nvidia-smi 和 NVML 带到了 Thor——独显用户早就有的工具。[4]

如果你为机器人写 CUDA,这是那个版本;如果你写的 Python 要导入为 sm_87 编译的轮子,这是那个陷阱。

JetPack 7.2.1 的物料清单

版本
Jetson Linux39.2.1(2026-08-11)
内核6.8
用户空间L4T Ubuntu 24.04;也列有 Canonical Ubuntu 24.04 for Jetson
CUDA13.2.1
cuDNN9.20.0
TensorRT10.16.2
VPI4.1.3
PVA2.9.1
DeepStream9.1
Holoscan SDK3.9.0
Vulkan / OpenGL / GLES1.4 / 4.6 / 3.2
Nsight Systems2026.3
Container Toolkit1.19(ISO)
Isaac ROS即将推出
支持硬件AGX Thor 开发套件、T5000、T4000、Orin 家族

来源:NVIDIA JetPack 7.2.1 下载页。[5] JetPack 7.2 还通过 OE4T 配方新增了官方 Yocto Project 支持。[3][7] 7.2.1 加了 Jetson T3000 仿真、视频管线 agent 技能、Orin Nano 默认 Super 模式刷机,以及 PCN211461 / PCN211462 支持。[5]

NemoClaw 在 JetPack 7.2 上一条命令安装:curl -fsSL https://www.nvidia.com/nemoclaw.sh | bash。[7] NVIDIA 把 NemoClaw 描述为给 OpenClaw 加隐私与安全控制的开源栈,在 7.2 上预配置好,省掉手动环境搭建。[7] GitHub 上的设备侧技能和 BSP 技能自动化了 BSP 引导、内存切分和模型基准测试。[3][7]

内存技能不是脚注。NVIDIA 2026 年 7 月的 Thor 模组博客说伙伴们省到可以降一档内存 SKU:UBTech、Agile Robots 和 Connect Tech「最多省 15 GB」,从 AGX Orin 64 GB 降到 32 GB;SandStar 省了最多 4 GB,从 Orin NX 16 GB 降到 8 GB;NoTraffic 在 TX2 NX 上省了 30%。[8] 那些是厂商自报的节省,但它们是正确的那类数字:你不用买的 GB。

JetPack 7.2 也给 Jetson AGX Orin 32 GB 开启了 Super 模式。[7] 软件仍然能推动 Orin 硅片,但给不了 Orin Thor 的 SBSA 固件。

要 token 吞吐,不要口号

NVIDIA 发布了 AGX Thor 对 AGX Orin 的并排 token 表。[2] 序列长度 2048、输出 128、最大并发 8、双双 MAXN 功耗。[2] LLM 和 VLM 跑 vLLM,VLA 跑 TensorRT。[2]

家族模型Thor tok/sOrin tok/s加速比
LlamaLlama 3.1 8B150.81112.331.34
LlamaLlama 3.3 70B12.647.381.71
QwenQwen3-30B-A3B226.4276.692.95
QwenQwen3-32B79.116.844.70
DeepSeekDeepSeek-R1-Distill-Qwen-7B304.76180.411.69
DeepSeekDeepSeek-R1-Distill-Qwen-32B82.6316.964.87
VLMQwen2.5-VL-3B356.862161.65
VLMQwen2.5-VL-7B252154.021.64
VLMLlama 3.2 11B Vision69.6344.221.57
VLAGR00T N146.718.52.52
VLAGR00T N1.541.515.22.74

来源:NVIDIA 技术博客,表 3。[2]

把这张表读成软件结果。Qwen3-32B 的 4.70 倍和 DeepSeek-R1-Distill-Qwen-32B 的 4.87 倍,是 FP4、内存和新引擎显形的地方。Llama 3.1 8B 的 1.34 倍提醒你:小密集模型本来就塞得进 Orin。Thor 的 128 GB 是 70B 能进表的原因。[1][2]

NVIDIA 还引用了 Qwen2.5-VL-3B 加 Llama 3.2 3B 在 16 路并发下 TTFT 远低于 200 ms、TPOT 远低于 50 ms。[2] Qwen2.5-VL-7B 配 FP4 和 Eagle 投机解码对比 Orin W4A16「最高 3.5 倍」。[2] 那是 NVIDIA 的机器。写进采购单之前,按你自己的功耗模式、批量和栈重跑。

家族小端也没闲着

Jetson Orin Nano Super 是学生手里最多的套件。NVIDIA 标 67 INT8 TOPS、Ampere GPU 1,024 CUDA 核 32 Tensor Core、6 核 Cortex-A78AE、8 GB 128-bit LPDDR5 102 GB/s、7–25 W。[6] 相比原版 Nano 套件的 40 TOPS、68 GB/s、1.5 GHz 是一次上调。[6] Super 的 CPU 频率在高亮行里标 1.7 GHz。[6] 现有 Orin Nano 开发套件通过软件更新获得 Super。[6]

2026 年 8 月 25 日 NVIDIA 宣布 Jetson Orin Nano 2:78 TOPS AI 算力、8 GB 内存、8 核 Arm CPU、同样紧凑的外形、推理性能 2 倍于 Orin Nano Super,且 15 W 模式下「同等性能功耗低 40%」。[9] 模组和开发套件预计 2027 上半年。[9] NVIDIA 说超过 300 万开发者在该机器人栈上构建过,Cognex、Doosan Bobcat 和 Matic 在早期评估者之列,Wing 在跑过 Nano Super 后评估 Nano 2 用于送货无人机。[9] Seeed Studio 在载板名单上。[9]

78 TOPS 对 67 TOPS 不是重点。8 核 CPU 对 6 核、等性能下 15 W 模式省 40% 电,才是电池机器人的重点。[9][6] Nano 2 今天不在货架上,Super 在。

中端 Thor,还在日历上

2026 年 7 月 15 日 NVIDIA 推出 Jetson T3000 和 T2000,面向量产机器人而非 130 W 顶棚的 Blackwell Thor 模组。[8]

T3000:865 FP4 TFLOPS、8 核 Neoverse、32 GB LPDDR5X、273 GB/s、25 GbE、「体积和功耗大约是 T5000 的一半」。[8] NVIDIA 说 T3000「在多模态工作负载(含 LLM、VLM、VLA 和世界基础模型)上达到与 T5000 相近的推理性能」,迁移到 T3000「有助于在高内存价格下降低成本」。[8] IGX T3000 加了功能安全和 NVIDIA Halos for Robotics。[8]

T2000:400 FP4 TFLOPS 和 16 GB,面向视觉 agent、AMR 和工业机械臂。[8] NVIDIA 现在把边缘跨度描述为「70 TOPS 到 2,000 teraflops」。[8]

T3000 和 T2000 模组排期 2027 年一季度。[8] T3000 仿真在 JetPack 7.2.1 里,T2000 仿真稍后。[8] 你在一块 AGX Thor 开发套件上起步,向下仿真。[8][5] Cosmos 3 Edge 是 NVIDIA 说兼容 Thor 平台的 40 亿参数世界模型。[8] Seeed Studio 同日宣布支持。[8]

如果你 2026 年 10 月就要一台机器人计算机,你的选项是 T5000、T4000、AGX Orin 或 Orin Nano Super。T3000 是一个仿真目标。

给定分叉,怎么买

你在出货人形机器人、多相机工位或 70B 级本地大脑。 AGX Thor 开发套件或 T5000。128 GB、4× 25GbE、MIG、Holoscan Sensor Bridge、CUDA 13 SBSA。[1][2] 预算 40–130 W 和一块露出 QSFP 的载板。

你需要 70 W 和 64 GB 的 Thor 软件。 T4000。同样 273 GB/s,核更少,12 CPU 核,3× 25GbE。[1]

你需要 2027 年的 Thor 经济性。 在现在买得到的套件上仿真 T3000。[8][5] 不要假装 32 GB 是 128 GB。NVIDIA 自家的内存技能故事之所以存在,就是因为 32 GB 很紧。[8]

你在实验台、教室或几百美元 BOM 上。 Orin Nano Super,67 INT8 TOPS、8 GB、7–25 W、老 Nano 套件软件可升。[6] 按 JetPack 7.2.1 的 ISO 刷机计划,别找 SD 镜像。[5] 追 CUDA 13 轮子时把 sm_87 记在心里。[4]

你在设计 2027 年的无人机或家用机器人。 读 Nano 2 简报:78 TOPS、8 核、8 GB、2027 上半年、15 W 模式等性能省 40% 电。[9] 等不及就按 Super 设计载板。

你要为 Spark、GB200 和一台机器人写同一棵 CUDA 树。 Thor 在那棵树里,Orin 不在,直到 NVIDIA 动 sm_87。[4]

固件即产品

Jetson 过去意味着「刷个 L4T,忍受 BSP 钉死的任何 CUDA 版本」。JetPack 7 仍然刷 BSP。Thor 的 BSP 说 SBSA,Orin 的 GPU 仍然报 compute 8.7。统一的 CUDA 13 安装器是给 SBSA 那一侧的。[4][5]

这就是为什么一篇周一的 NVIDIA 专栏不是又一篇 Spark 跑分。Spark 在 NVIDIA 自己的 CUDA 13 叙述里是一台桌面 Grace-Blackwell 盒子,一个你编译之后把二进制拷给 Thor 的地方。[4] Jetson 是那个二进制必须跟相机、25GbE、实时内核和 40–130 W 封装住在一起的地方。[1][2][3]

本周的「可能」,是一台跑着你机架上已经在用的同一套 Arm CUDA 工具链的机器人,配 MIG 让控制循环不跟摘要器共享 SM,配 128 GB 内存池让 70B 模型成为一种配置而不是一个笑话。[2][7] 约束是家族的另一半:还在 Orin 硅片上、还在 sm_87 上、还是大多数人真正买得到的那块板。[4][6]

买你刷得进去的软件栈,在设备上数 SM,不要相信一个不注明数据类型的 TOPS 数字。

来源

[1] https://www.nvidia.com/en-us/autonomous-machines/embedded-systems/jetson-thor — NVIDIA Jetson Thor 产品页 [2] https://developer.nvidia.com/blog/introducing-nvidia-jetson-thor-the-ultimate-platform-for-physical-ai — Introducing NVIDIA Jetson Thor [3] https://developer.nvidia.com/embedded/jetpack — NVIDIA JetPack SDK [4] https://developer.nvidia.com/blog/whats-new-in-cuda-toolkit-13-0-for-jetson-thor-unified-arm-ecosystem-and-more — CUDA Toolkit 13.0 for Jetson Thor [5] https://developer.nvidia.com/embedded/jetpack/downloads — JetPack 7.2.1 downloads and notes [6] https://www.nvidia.com/en-us/autonomous-machines/embedded-systems/jetson-orin/nano-super-developer-kit — Jetson Orin Nano Super Developer Kit [7] https://developer.nvidia.com/blog/deploy-agentic-ready-ai-at-the-edge-with-memory-efficiency-in-nvidia-jetpack-7-2 — JetPack 7.2 agentic-ready AI [8] https://blogs.nvidia.com/blog/jetson-thor-robotics-edge-ai-agent — Jetson T3000 and T2000 announcement [9] https://nvidianews.nvidia.com/news/nvidia-announces-jetson-orin-nano-2-robotics-computer-to-redefine-entry-level-edge-ai — Jetson Orin Nano 2 press release [10] https://forums.developer.nvidia.com/t/clarification-on-cuda-core-and-tensor-core-counts-for-jetson-agx-thor/356355 — Thor CUDA core clarification forum

原文信息

原文地址:

  • 作者:Michael Gannotti(@MichaelGannotti),SMF Works 技术顾问、微软生态与 AI Agent 实践博主
  • 发布时间:2026-09-14
  • 来源:X Article

文章评论(5

龙文博20 分钟前

很有价值的分享,感谢整理。

回复
雪知秋27 分钟前

思路清晰,干货满满。

回复
龙文博40 分钟前

这篇文章分析得很透彻,收藏了!

回复
陈皮话梅糖13 分钟前

赞同,实践出真知。

回复
雪知秋51 分钟前

看标题就点进来了,内容果然没让人失望。

回复