Skip to main content

GR00T-N1.7 精度对齐

本页使用 GR00T-N1.7-LIBERO/libero_10 checkpoint,对比 PhyAI 与 NVIDIA Isaac-GR00T 的结果。

结果

benchmark 使用以下公式计算由 MAE 推导出的回归指标:
Avg Acc 不是分类任务中的正确率。这里的 MAE 也不是在归一化后的 40 x 132 模型输出上计算的。每次请求都会先解码为 checkpoint 对应的 16 x 7 LIBERO action。评估取其中前 8 步并向前推进 8 步,因此每条 200-step 轨迹由 25 次请求完整覆盖;拼接后的 200 x 7 序列会与数据集记录的全部 200 个 action 比较。 对应的误差如下:

评估配置

两种实现使用相同的 checkpoint、数据集、trajectory、图像变换、prompt 构造方式、精度、action horizon 和随机种子。脚本先在解码后的 action 空间内计算 每条 trajectory 的 MSE 和 MAE,再对五条 trajectory 取平均值。

复现 PhyAI 结果

请先按照 GR00T-N1.7 ws1 指南准备 checkpoint 和 Cosmos-Reason2 tokenizer 文件。克隆 NVIDIA Isaac-GR00T 时需要启用 Git LFS,确保上面链接的 LIBERO demo 中包含 metadatavideos 三个目录。 在 PhyAI 仓库根目录运行:
如果本地还没有 Cosmos-Reason2 tokenizer 和 preprocessor 缓存,仅在第一次运行时 追加 --online。 内置Cosmos-Reason2 processor不需要执行远程代码;只有在使用可信的自定义processor 仓库时才传入--trust-remote-code Isaac-GR00T 参考值根据 NVIDIA 官方模型和 processor 在相同设置下生成的解码 action 计算。NVIDIA 的 standalone_inference_script.py 实现了对应的 200-step、horizon-8 评估流程。