JetPack 7 把 Jetson 家族劈成了两半:买边缘 AI 板,先看清软件栈再下单
Thor 跑 SBSA 和统一的 CUDA 13 Arm 工具链,Orin 仍停在 sm_87。决定买哪块的,是软件栈,不是 TOPS 图表。
Jetson 盒子上的 TOPS 数字是产品页上最没用的事实:NVIDIA 现在用一个家族名盖住两个固件世界——Thor 是 Arm 服务器,Orin 是 Tegra 板卡——而 JetPack 7 同时覆盖两者。
这是 The Possible 专栏的第一篇:把 AI 塞进机器人、无人机、自助终端或桌面盒子的硬件、固件与软件。今天 NVIDIA 的论点很简单:如果你在 2026 年底买 Jetson,你买的是一份软件合同。
一个品牌,两套栈
JetPack 7 是 Jetson 的官方软件栈。[3] 它跑 Linux 内核 6.8 和 Ubuntu 24.04 LTS。[3] 新增了可抢占的实时内核、Thor 上的 Multi-Instance GPU,以及 Holoscan Sensor Bridge。[3] 当前下载是 JetPack 7.2.1 配 Jetson Linux 39.2.1,驱动包日期 2026 年 8 月 11 日。[5]
那份发布在 ISO 镜像里列出了 CUDA 13.2.1、cuDNN 9.20.0、TensorRT 10.16.2、VPI 4.1.3、DeepStream 9.1、Holoscan SDK 3.9.0、Nsight Systems 2026.3 和 NVIDIA Container Toolkit 1.19。[5] Isaac ROS 标注「即将推出」。[5] ISO 安装器现在默认把 Jetson Orin Nano 开发套件刷成 Super 模式。[5] SD 卡镜像没有了,你得从 U 盘刷。[5]
这些版本钉比峰值 TFLOPS 那一行重要得多,因为它们决定你的 PyTorch 轮子、你的 vLLM 容器、你的载板 BSP 到底装不装得上。
分叉就在这些钉子底下。JetPack 7 起,Jetson 软件对齐了服务器基础系统架构(SBSA),「把 Jetson Thor 摆在行业标准 Arm 服务器设计旁边」。[2][3][5] NVIDIA 说 SBSA 为操作系统支持和可移植性标准化了硬件与固件接口。[3] 在那个地基上,「Jetson Thor 现在支持跨所有 Arm 目标的统一 NVIDIA CUDA 13.0 安装」。[3]
Orin 是例外。CUDA 13.0 统一了 SBSA 服务器和 Thor 的工具链。「唯一的例外是 Orin(sm_87),它暂时继续走现有路径。」[4] 你仍然可以在 Orin 家族上跑 JetPack 7.2.1。[5] 你不能假装编译器故事是同一个。
手动刷机变了,因为 Thor 用 SBSA。NVIDIA 要求仔细跟随 r39.2.1 的刷机说明。[5]
Thor 到底是什么
NVIDIA 产品页给 Jetson Thor 系列模组标到 2070 FP4 TFLOPS 的 AI 算力和 128 GB 内存——1.5 倍于 Jetson AGX Orin 的性能、3.5 倍能效——封装在 40–130 W 之间。[1] 2070 TFLOPS 是 130 W 下的实测性能。[1] 内存带宽 273 GB/s。[1] 顶级 CPU 是 14 核。[1]
产品页上在售的 SKU 是 AGX Thor 开发套件、Jetson T5000 和 Jetson T4000。[1]
| 项目 | AGX Thor 开发套件 / T5000 | Jetson T4000 |
|---|---|---|
| AI 性能 | 2070 TFLOPS(FP4—稀疏) | 1200 TFLOPS(FP4—稀疏) |
| GPU | 2560 核 Blackwell,第五代 Tensor Core,MIG,10 TPC | 1536 核 Blackwell,第五代 Tensor Core,MIG,6 TPC |
| GPU 最高频率 | 1.57 GHz | 1.53 GHz |
| CPU | 14 核 Arm Neoverse-V3AE,每核 1 MB L2,共享 16 MB L3 | 12 核 Arm Neoverse-V3AE,相同缓存结构 |
| CPU 最高频率 | 2.6 GHz | 2.6 GHz |
| 内存 | 128 GB 256-bit LPDDR5X,273 GB/s | 64 GB 256-bit LPDDR5X,273 GB/s |
| 功耗 | 40 W–130 W | 40 W–70 W |
| 模组网络 | 4× 25GbE | 3× 25GbE |
| 模组尺寸 | 100 mm × 87 mm,699 引脚(T5000) | 100 mm × 87 mm |
来源:NVIDIA Jetson Thor 产品表。[1] T4000 的 AI、GPU、CPU、内存和功耗来自同一张表。开发套件在 M.2 Key M 槽加了 1 TB NVMe、1× 5GbE RJ45、1× QSFP28(4× 25GbE)、HDMI 2.0b、DisplayPort 1.4a,以及 243.19 × 112.40 × 56.88 mm 的机箱。[1]
2025 年 8 月的技术介绍(仍是 T5000 的权威文章)重申了 130 W 内同样的 2070 稀疏 FP4 TFLOPS,并补充了密集档位:T5000 上 1035 TFLOPS 密集 FP4 / 稀疏 FP8 / 稀疏 INT8,以及 517 TFLOPS 密集 FP8 / 稀疏 FP16。T4000 在同阶梯上是 1200 / 600 / 300。[2] 那张表里的 Tensor Core 数量是 T5000 96 个、T4000 64 个。[2] 介绍中 T4000 的数字标注为初步。[2]
不要把稀疏 FP4 峰值跟 Orin 的 INT8 TOPS 混为一谈,它们是不同的计量表。NVIDIA 用稀疏 FP4 TFLOPS 报 Thor,用 INT8 TOPS 报 Orin Nano Super。[1][6]
开发套件集成的是 T5000 模组。[2] 模组侧的相机 I/O 包括 Holoscan Sensor Bridge——经 HSB 最多 20 路相机、经 16 条 MIPI CSI-2 通道最多 6 路、用虚拟通道最多 32 路,C-PHY 2.1 at 10.25 Gbps 和 D-PHY 2.1 at 40 Gbps。[2]
自己数 SM
营销图里仍然飘着一个 3,072 CUDA 核的「最大架构配置」。NVIDIA 员工在开发者论坛引用 Jetson-Thor-Series-Modules-Datasheet_DS-11945-001v1.3.pdf 说,Thor 开发套件是 2,560 CUDA 核,不是 3,072。[10] 同帖后续:2,560 CUDA 核 ÷ 每 SM 128 核 = 20 个 SM。Blackwell 每个 SM 有 4 个 Tensor Core,也就是 80 个,对上数据表里 T5000 的 96 个 Tensor Core。[10] 同一帖更晚的帖子报告了 CUDA Driver API 查询:GPU 名 NVIDIA Thor,SM 数 20,L2 缓存 32 MiB,每 SM 最大共享内存 228 KiB。[10]
把产品页的 2,560 核当作出货 GPU。[1] 把 3,072 当作满芯片设计图,直到数据表和 nvidia-smi 达成一致。论坛不是数据表,但它是正确的那类怀疑。
JetPack 7.2 的 MIG 切分跟 20 SM 的 GPU 吻合。NVIDIA 把 Thor 切成两个隔离实例:12 SM / 1,536 CUDA 核给 AI 和图形,8 SM / 1,024 CUDA 核给机器人、控制、感知或安全关键工作。[7] 专属算力、缓存和内存带宽,加上 JetPack 7 的可抢占 RT 内核,重点在于:一颗 SoC 上跑混合关键级任务,不让聊天机器人偷走控制循环的周期。[7]
CUDA 13 才是 Thor 的真功能
Thor 的 CUDA 13.0 统一了服务器级 Arm 和嵌入式 Thor 的工具链。[4] NVIDIA 的说法是一次构建、在 GB200 和 DGX Spark 这类系统上仿真、再把同一个二进制无改动部署到 Thor。[4] 编译器仍然面向目标 GPU 生成代码。[4] 你不再维护两套工具链,容器跟随同一统一。[4]
那句话在 NVIDIA 自己的 CUDA 13 文章里点名 DGX Spark 作为仿真宿主,[4] 不是声称某个实验室今天就在跑 Spark。
Thor 还拿到了全一致的统一虚拟内存。[4] cudaDeviceProp::pageableMemoryAccessUsesHostPageTables 为 1,所以 GPU 可以走宿主页表访问可分页 CPU 内存。[4] 硬件保持 GPU 和 CPU 缓存一致。[4] mmap() 或 malloc() 的缓冲可以直接进内核,不需要 CUDA 分配器。[4] cudaMallocManaged() 报告 concurrentManagedAccess 为 1,所以 cudaMemPrefetchAsync() 可用,但在 CUDA 13.0 里这些托管分配不做 GPU 缓存。[4] NVIDIA 说这把 Jetson UVM 拉齐到独显水平,带那个缓存告警。[4]
GPU 共享在成熟。[4] MPS 把小而突发的过程合并进一个 GPU 上下文,应用无需改动。[4] Green contexts 与之并列。[4] CUDA 13.0 还把 nvidia-smi 和 NVML 带到了 Thor——独显用户早就有的工具。[4]
如果你为机器人写 CUDA,这是那个版本;如果你写的 Python 要导入为 sm_87 编译的轮子,这是那个陷阱。
JetPack 7.2.1 的物料清单
| 层 | 版本 |
|---|---|
| Jetson Linux | 39.2.1(2026-08-11) |
| 内核 | 6.8 |
| 用户空间 | L4T Ubuntu 24.04;也列有 Canonical Ubuntu 24.04 for Jetson |
| CUDA | 13.2.1 |
| cuDNN | 9.20.0 |
| TensorRT | 10.16.2 |
| VPI | 4.1.3 |
| PVA | 2.9.1 |
| DeepStream | 9.1 |
| Holoscan SDK | 3.9.0 |
| Vulkan / OpenGL / GLES | 1.4 / 4.6 / 3.2 |
| Nsight Systems | 2026.3 |
| Container Toolkit | 1.19(ISO) |
| Isaac ROS | 即将推出 |
| 支持硬件 | AGX Thor 开发套件、T5000、T4000、Orin 家族 |
来源:NVIDIA JetPack 7.2.1 下载页。[5] JetPack 7.2 还通过 OE4T 配方新增了官方 Yocto Project 支持。[3][7] 7.2.1 加了 Jetson T3000 仿真、视频管线 agent 技能、Orin Nano 默认 Super 模式刷机,以及 PCN211461 / PCN211462 支持。[5]
NemoClaw 在 JetPack 7.2 上一条命令安装:curl -fsSL https://www.nvidia.com/nemoclaw.sh | bash。[7] NVIDIA 把 NemoClaw 描述为给 OpenClaw 加隐私与安全控制的开源栈,在 7.2 上预配置好,省掉手动环境搭建。[7] GitHub 上的设备侧技能和 BSP 技能自动化了 BSP 引导、内存切分和模型基准测试。[3][7]
内存技能不是脚注。NVIDIA 2026 年 7 月的 Thor 模组博客说伙伴们省到可以降一档内存 SKU:UBTech、Agile Robots 和 Connect Tech「最多省 15 GB」,从 AGX Orin 64 GB 降到 32 GB;SandStar 省了最多 4 GB,从 Orin NX 16 GB 降到 8 GB;NoTraffic 在 TX2 NX 上省了 30%。[8] 那些是厂商自报的节省,但它们是正确的那类数字:你不用买的 GB。
JetPack 7.2 也给 Jetson AGX Orin 32 GB 开启了 Super 模式。[7] 软件仍然能推动 Orin 硅片,但给不了 Orin Thor 的 SBSA 固件。
要 token 吞吐,不要口号
NVIDIA 发布了 AGX Thor 对 AGX Orin 的并排 token 表。[2] 序列长度 2048、输出 128、最大并发 8、双双 MAXN 功耗。[2] LLM 和 VLM 跑 vLLM,VLA 跑 TensorRT。[2]
| 家族 | 模型 | Thor tok/s | Orin tok/s | 加速比 |
|---|---|---|---|---|
| Llama | Llama 3.1 8B | 150.81 | 112.33 | 1.34 |
| Llama | Llama 3.3 70B | 12.64 | 7.38 | 1.71 |
| Qwen | Qwen3-30B-A3B | 226.42 | 76.69 | 2.95 |
| Qwen | Qwen3-32B | 79.1 | 16.84 | 4.70 |
| DeepSeek | DeepSeek-R1-Distill-Qwen-7B | 304.76 | 180.41 | 1.69 |
| DeepSeek | DeepSeek-R1-Distill-Qwen-32B | 82.63 | 16.96 | 4.87 |
| VLM | Qwen2.5-VL-3B | 356.86 | 216 | 1.65 |
| VLM | Qwen2.5-VL-7B | 252 | 154.02 | 1.64 |
| VLM | Llama 3.2 11B Vision | 69.63 | 44.22 | 1.57 |
| VLA | GR00T N1 | 46.7 | 18.5 | 2.52 |
| VLA | GR00T N1.5 | 41.5 | 15.2 | 2.74 |
来源:NVIDIA 技术博客,表 3。[2]
把这张表读成软件结果。Qwen3-32B 的 4.70 倍和 DeepSeek-R1-Distill-Qwen-32B 的 4.87 倍,是 FP4、内存和新引擎显形的地方。Llama 3.1 8B 的 1.34 倍提醒你:小密集模型本来就塞得进 Orin。Thor 的 128 GB 是 70B 能进表的原因。[1][2]
NVIDIA 还引用了 Qwen2.5-VL-3B 加 Llama 3.2 3B 在 16 路并发下 TTFT 远低于 200 ms、TPOT 远低于 50 ms。[2] Qwen2.5-VL-7B 配 FP4 和 Eagle 投机解码对比 Orin W4A16「最高 3.5 倍」。[2] 那是 NVIDIA 的机器。写进采购单之前,按你自己的功耗模式、批量和栈重跑。
家族小端也没闲着
Jetson Orin Nano Super 是学生手里最多的套件。NVIDIA 标 67 INT8 TOPS、Ampere GPU 1,024 CUDA 核 32 Tensor Core、6 核 Cortex-A78AE、8 GB 128-bit LPDDR5 102 GB/s、7–25 W。[6] 相比原版 Nano 套件的 40 TOPS、68 GB/s、1.5 GHz 是一次上调。[6] Super 的 CPU 频率在高亮行里标 1.7 GHz。[6] 现有 Orin Nano 开发套件通过软件更新获得 Super。[6]
2026 年 8 月 25 日 NVIDIA 宣布 Jetson Orin Nano 2:78 TOPS AI 算力、8 GB 内存、8 核 Arm CPU、同样紧凑的外形、推理性能 2 倍于 Orin Nano Super,且 15 W 模式下「同等性能功耗低 40%」。[9] 模组和开发套件预计 2027 上半年。[9] NVIDIA 说超过 300 万开发者在该机器人栈上构建过,Cognex、Doosan Bobcat 和 Matic 在早期评估者之列,Wing 在跑过 Nano Super 后评估 Nano 2 用于送货无人机。[9] Seeed Studio 在载板名单上。[9]
78 TOPS 对 67 TOPS 不是重点。8 核 CPU 对 6 核、等性能下 15 W 模式省 40% 电,才是电池机器人的重点。[9][6] Nano 2 今天不在货架上,Super 在。
中端 Thor,还在日历上
2026 年 7 月 15 日 NVIDIA 推出 Jetson T3000 和 T2000,面向量产机器人而非 130 W 顶棚的 Blackwell Thor 模组。[8]
T3000:865 FP4 TFLOPS、8 核 Neoverse、32 GB LPDDR5X、273 GB/s、25 GbE、「体积和功耗大约是 T5000 的一半」。[8] NVIDIA 说 T3000「在多模态工作负载(含 LLM、VLM、VLA 和世界基础模型)上达到与 T5000 相近的推理性能」,迁移到 T3000「有助于在高内存价格下降低成本」。[8] IGX T3000 加了功能安全和 NVIDIA Halos for Robotics。[8]
T2000:400 FP4 TFLOPS 和 16 GB,面向视觉 agent、AMR 和工业机械臂。[8] NVIDIA 现在把边缘跨度描述为「70 TOPS 到 2,000 teraflops」。[8]
T3000 和 T2000 模组排期 2027 年一季度。[8] T3000 仿真在 JetPack 7.2.1 里,T2000 仿真稍后。[8] 你在一块 AGX Thor 开发套件上起步,向下仿真。[8][5] Cosmos 3 Edge 是 NVIDIA 说兼容 Thor 平台的 40 亿参数世界模型。[8] Seeed Studio 同日宣布支持。[8]
如果你 2026 年 10 月就要一台机器人计算机,你的选项是 T5000、T4000、AGX Orin 或 Orin Nano Super。T3000 是一个仿真目标。
给定分叉,怎么买
你在出货人形机器人、多相机工位或 70B 级本地大脑。 AGX Thor 开发套件或 T5000。128 GB、4× 25GbE、MIG、Holoscan Sensor Bridge、CUDA 13 SBSA。[1][2] 预算 40–130 W 和一块露出 QSFP 的载板。
你需要 70 W 和 64 GB 的 Thor 软件。 T4000。同样 273 GB/s,核更少,12 CPU 核,3× 25GbE。[1]
你需要 2027 年的 Thor 经济性。 在现在买得到的套件上仿真 T3000。[8][5] 不要假装 32 GB 是 128 GB。NVIDIA 自家的内存技能故事之所以存在,就是因为 32 GB 很紧。[8]
你在实验台、教室或几百美元 BOM 上。 Orin Nano Super,67 INT8 TOPS、8 GB、7–25 W、老 Nano 套件软件可升。[6] 按 JetPack 7.2.1 的 ISO 刷机计划,别找 SD 镜像。[5] 追 CUDA 13 轮子时把 sm_87 记在心里。[4]
你在设计 2027 年的无人机或家用机器人。 读 Nano 2 简报:78 TOPS、8 核、8 GB、2027 上半年、15 W 模式等性能省 40% 电。[9] 等不及就按 Super 设计载板。
你要为 Spark、GB200 和一台机器人写同一棵 CUDA 树。 Thor 在那棵树里,Orin 不在,直到 NVIDIA 动 sm_87。[4]
固件即产品
Jetson 过去意味着「刷个 L4T,忍受 BSP 钉死的任何 CUDA 版本」。JetPack 7 仍然刷 BSP。Thor 的 BSP 说 SBSA,Orin 的 GPU 仍然报 compute 8.7。统一的 CUDA 13 安装器是给 SBSA 那一侧的。[4][5]
这就是为什么一篇周一的 NVIDIA 专栏不是又一篇 Spark 跑分。Spark 在 NVIDIA 自己的 CUDA 13 叙述里是一台桌面 Grace-Blackwell 盒子,一个你编译之后把二进制拷给 Thor 的地方。[4] Jetson 是那个二进制必须跟相机、25GbE、实时内核和 40–130 W 封装住在一起的地方。[1][2][3]
本周的「可能」,是一台跑着你机架上已经在用的同一套 Arm CUDA 工具链的机器人,配 MIG 让控制循环不跟摘要器共享 SM,配 128 GB 内存池让 70B 模型成为一种配置而不是一个笑话。[2][7] 约束是家族的另一半:还在 Orin 硅片上、还在 sm_87 上、还是大多数人真正买得到的那块板。[4][6]
买你刷得进去的软件栈,在设备上数 SM,不要相信一个不注明数据类型的 TOPS 数字。
来源
[1] https://www.nvidia.com/en-us/autonomous-machines/embedded-systems/jetson-thor — NVIDIA Jetson Thor 产品页 [2] https://developer.nvidia.com/blog/introducing-nvidia-jetson-thor-the-ultimate-platform-for-physical-ai — Introducing NVIDIA Jetson Thor [3] https://developer.nvidia.com/embedded/jetpack — NVIDIA JetPack SDK [4] https://developer.nvidia.com/blog/whats-new-in-cuda-toolkit-13-0-for-jetson-thor-unified-arm-ecosystem-and-more — CUDA Toolkit 13.0 for Jetson Thor [5] https://developer.nvidia.com/embedded/jetpack/downloads — JetPack 7.2.1 downloads and notes [6] https://www.nvidia.com/en-us/autonomous-machines/embedded-systems/jetson-orin/nano-super-developer-kit — Jetson Orin Nano Super Developer Kit [7] https://developer.nvidia.com/blog/deploy-agentic-ready-ai-at-the-edge-with-memory-efficiency-in-nvidia-jetpack-7-2 — JetPack 7.2 agentic-ready AI [8] https://blogs.nvidia.com/blog/jetson-thor-robotics-edge-ai-agent — Jetson T3000 and T2000 announcement [9] https://nvidianews.nvidia.com/news/nvidia-announces-jetson-orin-nano-2-robotics-computer-to-redefine-entry-level-edge-ai — Jetson Orin Nano 2 press release [10] https://forums.developer.nvidia.com/t/clarification-on-cuda-core-and-tensor-core-counts-for-jetson-agx-thor/356355 — Thor CUDA core clarification forum
原文信息
原文地址:
- 作者:Michael Gannotti(@MichaelGannotti),SMF Works 技术顾问、微软生态与 AI Agent 实践博主
- 发布时间:2026-09-14
- 来源:X Article
很有价值的分享,感谢整理。
思路清晰,干货满满。
这篇文章分析得很透彻,收藏了!
赞同,实践出真知。
看标题就点进来了,内容果然没让人失望。