BENCHMARK 横向对照 · 原文转制

9 个具身智能榜单横向对照表

整理日期 2026-09-20 · 内容转自 benchmark-tutorial/00-overview.md「横向对照表」(定位 / 引擎 / 规模 / 指标 / SOTA 逐字照录,仅调列序,SOTA 移末列为备注)。「环境 + 技术栈」按各仓安装脚本 / Dockerfile / requirements 逐项扒出(conda / pip / 数据资产点名计数);「预估搭建时间」以 RoboTwin 两周实测(按 10 个工作日计 10 人天)为锚点、其余按原成本档同比例折算,待按实际团队与机器校准。

共 9 行
榜单 定位 引擎 规模(任务数 / 演示数) 指标 官方已评测模型 新模型接入工作量预估 环境 + 技术栈 预估搭建时间 备注(SOTA + 日期)
LIBERO★ 2343 终身机器人学习的任务注册与遗忘度量,测知识迁移与灾难性遗忘,不测真机迁移 MuJoCo + robosuite / Franka Panda 总计 130 个语言条件任务,分 4 组套件
  • LIBERO-SPATIAL / OBJECT / GOAL 各 10 个(分别只变空间关系 / 物体种类 / 任务目标)
  • LIBERO-100(100 个)= LIBERO-90 预训练数据源 + LIBERO-LONG 10 个长时程任务
  • 每任务 50 条人工遥操作演示;演示总数以仓库数据配置为准
FWT / NBT / AUC(稀疏成功率)+ 混淆矩阵
  • FWT 前向迁移(新任务学得多快,越高越好);NBT 负向遗忘(旧任务掉多少,越低越好);AUC 成功率曲线面积(兼顾两者)
  • 基线算法:ER、EWC、PackNet,SEQL 顺序微调为下界、MTL 多任务为上界
  • 代表分数(2023-06,论文 Table 2,RESNET-T):SPATIAL 上 SEQL 的 FWT 0.72±0.01、ER 0.65±0.03、PackNet 0.55±0.01;LONG 上 ER 的 AUC 0.32±0.01,SEQL 仅 0.15±0.00
RESNET-RNN、RESNET-T、VIT-T三套官方策略架构 4–6 人天经验初估·待确认(配置三选 + 训练入口成熟;含适配编写 + 联调 + 基础测试脚本)适配文件:lifelong/models/新策略.py + configs/policy/新配置.yaml 环境conda python=3.8.13;单机 CPU 可跑,GPU 可选(torch cu113)技术栈约 18 项requirements.txt 15 个钉死版本(robosuite 1.4.0、robomimic 0.2.0、bddl 1.0.1、gym 0.25.2、transformers 4.21.1…)+ torch 1.11.0+cu113 全家桶 + pip install -e . + 演示数据(HF 镜像) 3–5 人天锚定折算·待确认(原成本档:低) 未公开单一榜首分数(2026-09-20 整理,出处:论文 Table 1 / Table 2 基线对比,ER 与 PackNet 等方法按套件报告)
CALVIN★ 991 语言条件长时序操作协议,测 5 步链式执行与跨环境泛化,不测大规模真机排名 PyBullet + PlayTable 操作台 / 7 自由度机械臂 约 34 类原子操作 + 1000 条 5 步链 + 4 个环境
  • 原子操作 34:旋转 6、推动 6、滑门 2、抽屉 2、抓取 9、放置 2、灯光 4、推入抽屉 1、堆叠 / 拆塔 2
  • 1000 条 5 步指令链(去环、去冗余、过滤不可行);4 个环境 A / B / C / D
  • 约 24 小时 VR 遥操作数据(每环境约 6 小时),约 240 万交互步,可重标定约 4000 万短时程窗口;众包语言标注 400 余条,仅约 1% 数据配语言
MTLC 单步 + LH-MTLC 链式(SR_1 至 SR_5 + 平均链长)
  • MTLC:34 个任务各 10 次 rollout 的平均成功率,测试用训练未见的新表述
  • LH-MTLC:1000 条 5 步链,报告至少连续完成 k 步的序列占比,任一步失败即终止该链
  • MCIL 基线(2021-12,论文图 8):MTLC 53.9%;SR_1 48.9%、SR_2 12.9%、SR_3 2.6%、SR_4 0.5%、SR_5 0.08%;零样本 ABC→D 的 MTLC 38.6%
MCIL官方基线;超 MCIL 的开源模型见官方排行榜 6–10 人天经验初估·待确认(双接口对接;含适配 + 联调 + 测试脚本)适配文件:evaluate_policy.py 内两扩展类 + calvin_agent/models/ 下模型本体 环境conda python=3.8 + cmake 3.18.4(tacto 触觉编译用),EGL 离屏渲染技术栈约 8 项3 个 editable 包(tacto、calvin_env、calvin_models)+ pyhash(setuptools 需 <58 兜底)+ 数据集 D / ABC / ABCD(debug 版 1.3GB 起)+ PyTorch Lightning + Hydra 训练栈 5–8 人天锚定折算·待确认(原成本档:低;数据下载体量大) 53.9%(2021-12,出处:论文评估表 MCIL 基线 D→D 的 MTLC 单步);arXiv:2112.03227 ⚠️待点开确认(CALVIN,原因:版本号未核实)
SimplerEnv★ 1168 真实策略的 real-to-sim 排名复现,测仿真评估是否保序,不测新策略训练榜首 SAPIEN + ManiSkill2 真机映射分支 / Google Robot 与 WidowX 两类本体约 10 个任务族 + 约 1500 轮配对评估
  • Google Robot 6 组(拿可乐罐、拿任意物体、移近、开关抽屉等)
  • WidowX 4 组:勺放毛巾、胡萝卜放盘、叠方块、茄子放入篮
  • 子变体:可乐罐横 / 竖 / 立姿、抽屉上 / 中 / 下层等
  • 约 1500 轮配对 sim-and-real 评估(RT-1、RT-1-X、RT-2-X、Octo)
成功率 + Pearson 相关 + MMRV + 两套评估做法
  • Pearson 相关(仿真与真实分数的线性相关,-1 至 1);MMRV 排错的最大真实代价(0 至 1,越低越好)
  • Visual Matching(真实背景叠加)+ Variant Aggregation(多外观多光照变体汇总)
  • 保序证据(2024-05,论文图 6):拿可乐罐 0.031/0.976、移近 0.111/0.855、开关抽屉 0.055/0.915、开抽屉放苹果 0.000/0.969(MMRV/r)
RT-1、RT-1-X、RT-2-X、Octo 4–7 人天经验初估·待确认(照推理主入口模式;含真机视频调试脚本,官方文档重点强调)适配文件:policies/{新策略}/(仿 rt1/octo)+ simple_inference_visual_matching_prepackaged_envs.py(定制再改 main_inference.py + scripts/ 配置) 环境conda python=3.10/3.11 + CUDA 11.8–13 + NVIDIA GPU(RTX 最佳,非 RTX 光追慢)技术栈约 6 项numpy==1.24.4(pinocchio IK 要求 <2.0)+ ManiSkill2 real2sim 分支及依赖 + RT-1 推理栈 + Octo 推理栈(full install) 8–12 人天锚定折算·待确认(原成本档:中;视觉匹配调试占大头) 未公开单一成功率榜首(2026-09-20 整理,出处:论文 Fig.1 强相关结论,仿真与真实配对评估约 1500 轮;各策略分值见分章 03,不转述二手排名)
RoboCasa365★ 1747 厨房原子到组合的泛化阶梯,测组合泛化与数据规模效应,不测开放家务全集 MuJoCo + robosuite / 移动操作平台 365 个任务 + 约 2500 场景 + 超 2000 小时数据
  • 365 = 原子 65 + 组合 300;约 60 类厨房活动、6 个高层活动族;目标评测子集 50(原子 18 + 组合可见 16 + 组合未见 16)
  • 约 2500 厨房场景(50 种布局 × 50 种风格)
  • 人工约 612 小时(预训练 300 任务 × 100 条约 404 小时 + 目标 50 任务 × 500 条约 208 小时)+ 合成约 1615 小时(60 原子任务 × 1 万条)
  • 原版对照:100 任务(原子 25 / 组合 75)、120 场景、2500 余物体 153 类、10 万条以上轨迹
分组成功率(原子 / 组合可见 / 组合未见)+ 终身学习阶段成功率
  • 多任务训练基线(2026-03,论文 Table 1):GR00T N1.5 平均 20.0%(原子 43.0 / 可见 9.6 / 未见 4.4);π0.5 16.9%、π0 15.0%、Diffusion Policy 6.1%
  • 联合共训练变体:平均 22.5%(44.1 / 9.0 / 11.7),低于预训练加微调两阶段
  • 仿真助益真实:真实加仿真联合 79.8%,纯真实 61.8%
Diffusion Policy、π0、π0.5、GR00T N1.5 6–10 人天经验初估·待确认(gym + 多视角输入对齐;含联调 + 测试脚本)适配文件:robocasa/ 下策略学习代码(仿 scripts/collect_demos.py / demos/ 组织),gym.make 直连 环境conda-forge python=3.11,全平台可装技术栈约 4 项robosuite master 分支(pip install -e .)+ robocasa 本体(pip install -e .,numba 0.56.4 兜底)+ kitchen assets 约 10GB 12–25 人天锚定折算·待确认(原成本档:中高;不含全量数据下载) 平均 22.5%(Atomic-Seen 44.1% / Composite-Seen 9.0% / Composite-Unseen 11.7%)(2026-03,出处:365 论文正文系统评估节);仿真加真实联合训练 79.8%,纯真实 61.8%(出处同);原版分数引用 arXiv:2406.02523 ⚠️待点开确认(RoboCasa 原版,原因:与仓库引用段对应关系未核实)
ManiSkill★ 3350 图形处理器并行的大规模操作基准,测并行吞吐与跨本体泛化,不测家务语义规划 SAPIEN 3 + PhysX 并行物理 + Vulkan 并行渲染 / 多形态本体 ManiSkill2 约 20 任务族 + ManiSkill3 约 12 类域
  • MS2:2000 余物体模型、400 万帧以上演示;柔体 6(填充 / 悬挂 / 挖掘 / 倾倒 / 捏塑 / 书写)、装配 3(单孔 / 充电插头 / 套件组装)、取放 5(YCB / EGAD / 杂乱场景)、关节与避障 5(推椅 / 移桶 / 开柜门抽屉 / 转水龙头等)
  • MS3:20 余种机器人本体,数百万帧演示(运动规划 / 强化学习 / 遥操作三轨来源)
各任务族成功率(训练 / 测试物体集分离)+ 回报值
  • MS2 基线(2023-02):Sense-Plan-Act 在 PickSingleYCB 上 43.24%,Transporter 在 AssemblingKits 上 18%;DAPG 加 PPO 在 PickCube 上 0.94±0.03;行为克隆在装配类接近零成功
  • MS3 真实评估(2024-10):PickCube 仿真训练零样本部署,22/24 = 91.6%;孪生对照 r = 0.9284、MMRV 0.0147
  • 速度基线:256 并行环境约 1 小时训 1500 万样本(RTX 4090)
Sense-Plan-Act、Transporter Networks、DAPG+PPO、BC、Octo、RT-1X 7–12 人天经验初估·待确认(控制器观测转换;含转换调试 + 测试脚本)适配文件:agents/新 agent(仿 base_agent.py,registration.py 注册)+ examples/benchmarking 评测脚本 环境Linux + NVIDIA GPU 全功能(Windows / Mac 仅部分),Vulkan 必须装技术栈约 22 项pip install mani_skill(含 numpy / scipy / gymnasium / h5py / sapien≥3.0.3 / pytorch_kinematics 等约 20 项)+ 按系统版本装 torch + Vulkan 8–12 人天锚定折算·待确认(原成本档:中) 91.6%(2024-10,出处:ManiSkill3 论文正文真实评估,22 次成功共 24 次试验平均);ManiSkill2 分数引用 arXiv:2302.04659 ⚠️待点开确认(ManiSkill2,原因:版本号未核实),细项见分章 05
BEHAVIOR-1K★ 1712 完整家务活动的符号化定义,测长时程规划与状态变化处理,不测单步抓取榜首 Isaac Sim + OmniGibson / 移动双臂平台 1000 个活动 + 50 场景 + 9000 余物体
  • 1000 = 问卷排序前 909 + BEHAVIOR-100 的 91;9318 个物体 1900 余类;每活动涉及 3–47 个物体
  • 挑战子集约 100 任务与约 2 万条轨迹 ⚠️待核实
  • 实验抽样 3 活动:CollectTrash(刚体收纳,至少 16 步原语)、StoreDecoration(关节收纳)、CleanTable(擦拭,最优 6 步)
BDDL 谓词满足率 + 效率分(导航距离 / 仿真耗时 / 物体位移)
  • 基线(2024-03,论文 Table 2,三活动成功率):端到端 RL-VMC 三项全 0.0;RL-Prim. 0.48 / 0.42 / 0.77;加历史观测 RL-Prim.Hist. 0.55 / 0.63 / 0.88
  • 效率分(论文 Table 3,CollectTrash):Hist. 版导航 15.33 米、仿真 12.48 秒、位移 10.82 米,全面优于无历史版本
RL-VMC(SAC 端到端)、RL-Prim.、RL-Prim.Hist. 10–15 人天经验初估·待确认(原语 + BDDL;含长链联调 + 测试脚本)适配文件:原语选择策略 + BDDL 对接(action_primitives/ 六类原语现成,不用写) 环境模块化安装:conda behavior 环境 + CUDA 12.8 + Isaac Sim(wheels 约 12GB,需接受 NVIDIA EULA)技术栈约 6 项OmniGibson + bddl3 + 数据集约 10GB(另挂载)+ primitives / eval 按需 + 数据集 TOS 确认 25–50 人天锚定折算·待确认(原成本档:高;Omniverse 环境最耗时,约 5–10 周单人) 未公开单一榜首分数(2026-09-20 整理,出处:论文实验节,长时程与复杂操作仍是挑战,基线分散未收敛,细项见分章 06)
RoboTwin 2.0★ 2898 双臂数字孪生的评测与数据工厂,测双臂协作与视觉指令泛化,不测单臂桌面榜首 SAPIEN 3.0 / Aloha、ARX、Franka 等双臂平台 50 评测任务 + 731 物体 + 10 万余条轨迹
  • 物体 731 共 147 类:自建 RGB-to-3D 重建 534(111 类)+ Objaverse 153(27 类)+ PartNet-Mobility 关节物体 44(9 类)
  • 5 种双臂构型:Aloha-AgileX、ARX-X5、Piper、Franka、UR5
  • 五轴域随机(杂物 / 光照 / 背景 / 台面高度 / 语言);背景纹理库 11000 张
  • 真机对照 4 任务(StackBowls、HandoverBlock、PickBottle、ClickBell)× 4 种背景杂物组合
任务成功率 + Easy / Hard 两档 + 视觉指令泛化剖面
  • 代码生成(2025-06,论文 Table 1):2.0 加多模态反馈 71.3%(Top5 78.6%),1.0 同配置 63.9%,提升 10.9 个百分点
  • 跨构型数据采集平均 60.5%(较 1.0 基线 +8.3pp;Piper +22.7pp,Aloha-AgileX +13.7pp)
  • 50 任务榜单:RDT Easy→Hard 掉约 20.8pp、Pi0 掉约 30.1pp;DP3 Easy 平均 55.2% 但 Hard 仅 5.0%
  • 真机迁移:few-shot 相对提升 367%,纯合成零样本 228%
ACT、DP、RDT、Pi0、DP3 4–6 人天经验初估·待确认(XPolicyLab;含联调 + 基础测试脚本)适配文件:仿 scripts/eval_policy*.py + XPolicyLab 策略服务(子模块需初始化) 环境git clone --recurse-submodules(XPolicyLab 子模块)+ SAPIEN 3.0;官方称安装约 20 分钟技术栈约 4 项XPolicyLab + env_cfg / envs + HF 预采集 10 万+ 轨迹(默认直接下数据开训) 10 人天(两周)你方实测锚点(原成本档:中;纯仿真部分) 71.3%(2025-06,出处:论文 Fig.1 自研方法);代码生成成功率提升 10.9 个百分点(出处:论文摘要与正文);纯合成零样本相对提升 228%,加 10 条真实演示相对提升 367%(出处同,细项见分章 07)
RoboDojo★ 606 按能力维度剖分的统一评测,测记忆、精度、长时程等短板定位,不测单一总榜首 Isaac Sim 5.1 + IsaacLab 2.3 / 多机器人本体 仿真 54 组 + 真机 18 个 + 训练数据约 38 小时
  • 仿真 42 标准 + 12 泛化(各 25 标准轮 + 25 随机轮);真机 18(3 构型各 6)
  • 五维划分:泛化 12、记忆 6、长时程 8、精度 8、开放 8(共 42 任务,24 种操作技能)
  • 仿真训练 3500 条(1859802 帧约 20.66 小时)+ 真机 1800 条(1611841 帧约 17.91 小时);30 余种策略已上报
五维能力成功率 + 平均分(每任务 50 轮,按五维平均)
  • 仿真榜单(2026-07-03,论文 Table 1,平均分/成功率):Hy-Embodied 13.07/8.80%、SpatialForcing 12.38/8.04%、pi0.5 11.41/6.91%、X-VLA 10.13/6.52%
  • 短板:开放维全线低于 2%,记忆维除榜首外普遍低于 5%
  • 真机榜单:每任务 10 轮,三人双盲独立打分取平均
Hy-Embodied-0.5-VLA、SpatialForcing、pi0.5、X-VLA30 余种策略已上报 4–6 人天经验初估·待确认(两文件接入;含容器联调 + 测试脚本)适配文件:XPolicyLab/policy/〈名〉/eval.sh + deploy.yml(仿真侧只调 robodojo.sh) 环境Docker 一条龙(Ubuntu 22.04 + CUDA 12.8.1 cudnn devel):cmake / build-essential / ffmpeg + EGL / Vulkan 运行库 + Miniconda + Python≥3.11技术栈约 6 项Isaac Sim + IsaacLab 2.3 + CuRobo + robodojo pip 栈 + XPolicyLab 子模块 + Assets 挂载(策略服务跑容器外经 TCP) 12–25 人天锚定折算·待确认(原成本档:高;纯仿真部分,真机工位另计) 基线平均约 8% 至 13%(2026-07,出处:论文主结果表,如 Hy-Embodied 类基线平均约 13.07% 与 8.80% 双列;各维度细项见分章 08)
VLA-Harness★ 620 一次接入、多处评测的矩阵型框架,测跨模型横评与复现保真,不测单一操作技能榜首 WebSocket 加消息打包协议,各榜单容器隔离 / 依所连榜单本体而定 约 14 适配器 + 6 模型服务 + 657 条聚合结果
  • 榜单页 657 条结果覆盖 17 榜单(源自 1704 篇引用榜单的论文)
  • 复现矩阵:6 个 VLA 代码库 × LIBERO / CALVIN / SimplerEnv 三榜单
  • 仓库实测:榜单配置约 20 目录 + 模型服务 10 余目录(多于论文口径,以仓库为准)
分集 → 任务 → 榜单三级聚合 + 复现偏差报告
  • 复现矩阵(2026-03,论文 Table II):LIBERO 上 X-VLA 97.4(-0.7)、pi0.5 97.7(+0.8)、OpenVLA 76.2(-0.3);CALVIN 链长 X-VLA 4.30(-0.13);SimplerEnv X-VLA 94.8(-1.0)
  • 偏差警示:单个未记录参数可摆动 55 个百分点(本体状态源错用 97.8%→42%)
  • 覆盖洞察:509 余模型中 81% 只测过 1 个榜单,仅约 6% 测过 3 个及以上
OpenVLA(含 OFT)、pi0 / pi0-FAST(含 pi0.5)、GR00T N1(含 N1.6)、X-VLA、CogACT(含 DB-CogACT) 2–4 人天经验初估·待确认(单文件 + 双 YAML;含 smoke 测试)适配文件:predict(obs, ctx) 单文件 + configs/model_servers/〈名〉/(照 examples/pusht_train_eval/ 四件套) 环境宿主机只需 Python + pip install vla-eval + uv技术栈约 15 项vla-eval 本体依赖约 13 项(anyio / websockets / msgpack / pyyaml / omegaconf / rich…)+ 榜单容器约 20 个 Dockerfile(base:CUDA 12.1 + EGL / Vulkan + Miniforge + uv,ghcr.io 拉取;behavior1k 另需 Isaac Sim 4.5.0 + 双 EULA)+ 两份 YAML + serve / run 双命令 8–12 人天锚定折算·待确认(原成本档:中;先跑通 LIBERO 复现矩阵) 聚合 657 条结果(2026-03,出处:论文 Fig.1);复现警示:单个未记录参数可摆动 55 个百分点,如 LIBERO 案例从 97.8% 降至 42%(出处:论文 Sec.III);并行评估最高约 47 倍加速,如 2000 轮 LIBERO 约 18 分钟(出处:论文摘要与 Fig.1)

横向可滚动查看全表;首列与表头冻结。点「下载 CSV」可直接用 Excel 打开,「复制 TSV」可粘贴进在线表格。

表注(原文照录)

  1. 规模数字以本地仓库 commit 为准,定义以论文为准;每格溯源见行内出处,分章给出仓库相对路径与论文章节号。
  2. SOTA 格格式为分数(日期,出处),出处为论文表号、图号或章节,或官方榜单页;未公开格同样给出整理日期与缺口原因,不臆测。
  3. 不确定编号警示:arXiv:2112.03227 ⚠️待点开确认(CALVIN,原因:版本号未核实);arXiv:2406.02523 ⚠️待点开确认(RoboCasa 原版,原因:与仓库引用段对应关系未核实);arXiv:2302.04659 ⚠️待点开确认(ManiSkill2,原因:版本号未核实)。三者凡出现均已标记。
  4. 一句话定位与选型表述参考教程站总览(https://benchmark.linkseek.net.cn/),事实口径以论文与仓库为准。
  5. 「预估搭建时间」以 RoboTwin 两周实测(按 10 个工作日计 10 人天)为锚点:RoboTwin 原属「中」档(中点约 4 人天),折算系数约 2.5 倍,其余各档同比例放大——低约 3–8 人天、中约 8–12 人天、中高约 12–25 人天、高约 12–50 人天(含环境复杂度,不含全量数据下载与真机工位搭建)。如两周指 14 天或多人并行,告知换算方式后重调系数。
  6. 榜单名下的 ★ 数为对应 GitHub 主仓 2026-09-22 抓取的 star 数(LIBERO 2343、CALVIN 991、SimplerEnv 1168、RoboCasa365 1747、ManiSkill 3350、BEHAVIOR-1K 1712、RoboTwin 2898、RoboDojo 606、Harness 620),仅作社区热度参考,非质量排名;会随时间变化,引用前请重抓。
  7. 「新模型接入工作量预估」无论文出处,按各榜单集成接口成熟度给的经验初估:接口越现成越轻(Harness 2–4、XPolicyLab 系 4–6),观测动作转换和目标对齐越重(ManiSkill 7–12、BEHAVIOR 10–15);口径含适配文件编写 + 联调出首分 + 基础测试脚本(专项回归测试另计),测试脚本按复杂度加 1–3 天已折入;待按实际接入案例校准。