GR00T-N1.7 精度对齐
本页使用GR00T-N1.7-LIBERO/libero_10
checkpoint,对比 PhyAI 与 NVIDIA Isaac-GR00T 的结果。
结果
benchmark 使用以下公式计算由 MAE 推导出的回归指标:Avg Acc 不是分类任务中的正确率。这里的 MAE 也不是在归一化后的
40 x 132 模型输出上计算的。每次请求都会先解码为 checkpoint 对应的
16 x 7 LIBERO action。评估取其中前 8 步并向前推进 8 步,因此每条 200-step
轨迹由 25 次请求完整覆盖;拼接后的 200 x 7 序列会与数据集记录的全部 200 个
action 比较。
对应的误差如下:
评估配置
两种实现使用相同的 checkpoint、数据集、trajectory、图像变换、prompt
构造方式、精度、action horizon 和随机种子。脚本先在解码后的 action 空间内计算
每条 trajectory 的 MSE 和 MAE,再对五条 trajectory 取平均值。
复现 PhyAI 结果
请先按照 GR00T-N1.7 ws1 指南准备 checkpoint 和 Cosmos-Reason2 tokenizer 文件。克隆 NVIDIA Isaac-GR00T 时需要启用 Git LFS,确保上面链接的 LIBERO demo 中包含meta、data 和 videos 三个目录。
在 PhyAI 仓库根目录运行:
--online。
内置Cosmos-Reason2 processor不需要执行远程代码;只有在使用可信的自定义processor
仓库时才传入--trust-remote-code。
Isaac-GR00T 参考值根据 NVIDIA 官方模型和 processor 在相同设置下生成的解码
action 计算。NVIDIA 的
standalone_inference_script.py
实现了对应的 200-step、horizon-8 评估流程。
