ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Thor 上手第一天 Checklist

Thor 上手第一天 Checklist

文章目录

    • 1. 第一天目标
    • 2. 认板与供电
    • 3. 刷机
      • 3.1 材料
      • 3.2 安装顺序(DevKit)
      • 3.3 刷完立刻记版本
    • 4. 登录与网络
    • 5. 功耗与温度
    • 6. 算力路径冒烟
    • 7. Docker
    • 8. 磁盘与内存
    • 9. 不要从 Orin 硬搬的东西
    • 10. 常见坑
    • 11. 收工检查
    • 12. 下一步
    • 13. 小结

摘要:Thor 不是 Orin 换皮。封装不兼容,软件走 JetPack 7 / CUDA 13 / SBSA,刷机也常变成「U 盘装系统」而不是老一套 recovery。本文按第一天顺序写:认板与供电、ISO 刷机、登录网络、功耗温度、算力样例、磁盘与 Docker,以及不要从 Orin 硬搬什么。适合刚到手的 Jetson AGX Thor 开发者套件。步骤以 NVIDIA Quick Start 与当前 JetPack 文档为准。


1. 第一天目标

第一天只建立基线,不堆业务:

  • 能稳定开机、登录,网络和磁盘正常
  • 记下 JetPack / L4T 版本,后面装组件和容器才有依据
  • 功耗档和温度看过一眼
  • CUDA / TensorRT 至少有一条官方路径能跑

检测、大模型、Isaac、自研工程,都放到这些确认之后。环境没捋清就搬 Orin 上的镜像和引擎,后面半天都在猜:是板子问题,还是软件代际问题。

官方入口:

  • AGX Thor Quick Start
  • BSP Setup(ISO / SDK Manager / flash 脚本)
  • JetPack 下载页

2. 认板与供电

本文默认是Jetson AGX Thor Developer Kit(常见集成T5000、板载大容量 NVMe)。量产模组加载板的接口与供电以载板手册为准,不要把 DevKit 假设原样搬过去。

开箱先记下:

建议记下的内容
模组T5000 / 其他 SKU,内存容量
存储系统是否在 NVMe,容量多少
电源是否使用套件标配 USB-C 电源
散热风扇能否转,风道有没有被挡
软件目标计划安装的 JetPack 大版本

和 Orin 比,第一天最容易翻车的是供电与散热。Thor 功耗可配置区间更高(公开材料常见约 40W~130W 量级),标配电源不是装饰。官方 Quick Start 也强调优先用套件电源。电源偏弱时,表现可能是随机重启、USB 掉线、文件系统异常,看起来像软件坏了。

另外记住:Thor 与 Orin无针脚兼容。载板、外壳、供电方案不能按「Orin 换模组」理解。选型背景见同目录《Jetson Orin 和 Thor 怎么选》《NVIDIA Jetson Thor 简介》。


3. 刷机

JetPack 7 起,开发者套件常见路径是制作 Jetson ISO 安装 U 盘 → 装到 NVMe,不一定非要一台符合版本要求的 Ubuntu 主机 + SDK Manager。Windows / Mac / Linux 主机都可以先做 U 盘。

3.1 材料

  • 主机:至少约 25GB 空闲空间(下 ISO)
  • U 盘:16GB 及以上
  • 写盘工具:如 Balena Etcher(不能只是把 ISO 文件复制进 U 盘)

ISO 从 JetPack 下载页 取面向 AGX Thor 的当前版本,不要拿过期镜像硬装。

3.2 安装顺序(DevKit)

  1. 接显示器 / 键鼠,或按文档走 Debug 串口的 headless 流程
  2. 插入安装 U 盘,接上标配电源,按电源键开机
  3. 若提示QSPI capsule update,按Y,等更新完成;不要跳过
  4. 安装菜单优先选Install on NVMe
  5. 装完重启前拔掉安装 U 盘,否则可能再次进安装盘
  6. 进入oem-config:用户、密码、时区、网络

细节、重装注意项、UEFI 兼容性以 Quick Start 为准。需要 SDK Manager 或Linux_for_Tegra脚本时,看 BSP Setup。

3.3 刷完立刻记版本

cat/etc/nv_tegra_releaseuname-a# 包名随版本可能变化,以镜像实际为准dpkg-l|rg-i"nvidia-jetpack|nvidia-l4t"

把输出贴进一个小文本:型号、内存、JetPack/L4T、安装日期。后面装 CUDA 组件、拉容器、对论坛,都靠这份基线。

注意:ISO 路径往往先把BSP(Jetson Linux)装上;CUDA、TensorRT 等 JetPack 组件是否已齐全,要以当前文档的JetPack SDK Setup为准。第一天发现nvcc/ TensorRT 不在,优先补官方组件,不要按 x86 方式重装一份 CUDA。


4. 登录与网络

datetimedatectl statusipaddrping-c38.8.8.8

时间不对,下证书、拉包、拉容器都可能怪到别处。只用 ssh 时:

  • 记下 IP;路由器里做 DHCP 绑定或静态地址
  • 大文件尽量让板子自己拉,少经笔记本中转
  • 公司网有代理,第一天就把 apt / Docker 代理设好

Thor DevKit 网络口比常见 Orin 套件更丰富(例如多千兆 / QSFP 等,以载板为准)。第一天有线能通即可;高速相机、Holoscan Sensor Bridge、25GbE 类链路放到环境稳后再接,少一次变量。

远程桌面可以后做。第一天能 ssh、能拷文件、能跑样例就够。图形远程更占资源,也更容易把「环境不通」和「桌面卡」搅在一起。


5. 功耗与温度

tegrastatssudonvpmodel-qsudonvpmodel-p

空载看一两分钟,确认风扇在转。字段名随 JetPack 可能变化,温度与 GPU 相关项看懂即可。

写测试记录时带上功耗档。同一模型在不同档位上差一截很正常。闷壳、风道堵、标配风扇被替换成静音方案时,高档位空转也可能降频或保护重启——DevKit 开放散热上的数字,不能直接写成量产指标。

jetson_clocks一类锁频手段,第一天知道存在即可,不必一上来锁满。先摸清模式和温度,再谈锁频。


6. 算力路径冒烟

目标不是跑通业务模型,而是证明加速栈在:

nvcc--versionnvidia-smi python3-c"import tensorrt as trt; print(trt.__version__)"

Thor 走 SBSA / 更接近服务器语义的软件路线,nvidia-smi等工具的表现可能比老 Jetson 更「像独显」。以你当前 JetPack 实际输出为准;命令不存在或权限不对时,先回到 JetPack 组件是否装全。

建议再做一件:

  • 跑一个官方 CUDA sample,或
  • TensorRT 自带小例子

样例失败时的排查顺序:

  1. JetPack 组件是否装全
  2. 功耗档是否过低,或已经热降频
  3. df -h是否磁盘满
  4. 是否把 x86 / 旧 Orin 的 wheel、引擎、容器硬搬过来

第一天不要编译大型开源仓库,也不要按桌面 PC 教程重装 CUDA。官方路径通了,再上 YOLO、VLM、Isaac。


7. Docker

不用容器可跳过。要用则先做 smoke test:

dockerversion# 镜像标签必须匹配当前 JetPack / L4T,不要用桌面 x86 镜像dockerrun--rm--runtimenvidia<匹配当前版本的L4T镜像>nvidia-smi

注意:

  • runtime 没配好时,容器能起、GPU 不可用
  • Orin 上能用的 L4T 镜像,不能默认拿到 Thor 上复用
  • 镜像很大,先看磁盘与网络

Docker 数据目录默认常在系统盘。有独立数据分区时,第一天就可以规划镜像与容器层放哪,避免两周后满盘伪装成各种 GPU 故障。


8. 磁盘与内存

df-hfree-hlsblk

DevKit 常见大容量 NVMe,但仍建议:

  • 系统与大数据(模型、数据集、Docker 层)分区或分目录清楚
  • 系统分区只剩几个 G 时,apt、拉镜像、导引擎都会突然失败
  • 日志(journalctl、Docker 日志、自己的 debug)也会吃盘

内存通常远高于 Orin Nano/NX,第一天仍别同时开:远程大桌面 + 多容器 + 本机大编译 + 无节制拉模型。基线清爽,后面压测才有对照。


9. 不要从 Orin 硬搬的东西

类别原因
TensorRT.engine绑定 GPU 架构与 TensorRT 版本
旧 L4T / JetPack 5·6 容器用户态与驱动代际不同
按 Orin 写死的刷机习惯Thor 常见 ISO U 盘安装,细节已变
「换模组升级」的结构假设封装与供电不兼容
把 Orin 上的峰值 FPS 当 Thor 合同指标负载类型与软件栈都不同

Orin 上的算法与数据可以迁;运行时产物按目标板重建。第一天就把这条边界划清,后面少吵两天。


10. 常见坑

现象多见原因处理
装完又进安装盘没拔 U 盘拔掉安装盘再启动
卡在 QSPI / 固件提示跳过了 capsule update重来并按 Y 等完成
无显示(经 KVM)部分 KVM 不兼容显示器直连试
nvcc/ TensorRT 没有只装了 BSP,组件未装全按 JetPack SDK Setup 补
容器无 GPUruntime 或镜像标签不对查 Docker 与 L4T 标签
随机重启、USB 掉供电不稳先换标配电源与线
样例异常慢功耗档低、降频、实际走 CPUnvpmodel与温度
按 Orin 教程硬套版本与架构假设错误回到 Thor 当前文档

第一天尽量少做:无目的full-upgrade、按 x86 重装 CUDA、并行堆多个互相打架的 Python 环境、封闭壳里最高档空转很久。


11. 收工检查

  • 能稳定登录(屏幕或 ssh)
  • JetPack / L4T 版本已记下
  • 系统在 NVMe 上,磁盘空间够用
  • 当前nvpmodel清楚
  • tegrastats看过温度与风扇
  • nvidia-smi/ CUDA / TensorRT 至少一条路径冒烟通过
  • 用 Docker 的话,匹配镜像的 GPU 测试过
  • 明确:不从 Orin 拷引擎和旧容器当第一依赖

几人共用板时,把型号、内存、JetPack、功耗档、数据目录、基础镜像标签放进同一份小文档。


12. 下一步

环境稳了再往下,按你的目标选一条:

  1. 视觉检测:本板重建 TensorRT 引擎,再谈 DeepStream
  2. 端侧大模型 / VLM:先小模型打通内存与吞吐,再上业务模型
  3. 机器人 / Physical AI:再接 Isaac、相机与高速传感链路

相机、QSFP、多模型并发,都不是第一天必选项。先保证「版本、供电、磁盘、加速路径」比较清楚了。


13. 小结

Thor 第一天不着急上业务,而是把供电、ISO/BSP、版本、功耗档、官方算力路径摸清楚,并接受它和 Orin 不是同一套搬迁假设。这几样清楚了,后面上模型与传感,问题更好处理。

命令与包名随 JetPack 会变;对不上就查当前官方文档,不要用旧 Orin 教程硬套。

返回列表