整理日期 2026-09-20 · 内容转自 benchmark-tutorial/00-overview.md「横向对照表」(定位 / 引擎 / 规模 / 指标 / SOTA 逐字照录,仅调列序,SOTA 移末列为备注)。「环境 + 技术栈」综合各分章引擎与复现路径节整理;「预估搭建时间」以 RoboTwin 两周实测(按 10 个工作日计 10 人天)为锚点、其余按原成本档同比例折算,待按实际团队与机器校准。
| 榜单 | 定位 | 引擎 | 规模(任务数 / 演示数) | 指标 | 环境 + 技术栈 | 预估搭建时间 | 备注(SOTA + 日期) |
|---|---|---|---|---|---|---|---|
| LIBERO | 终身机器人学习的任务注册与遗忘度量,测知识迁移与灾难性遗忘,不测真机迁移 | MuJoCo + robosuite / Franka Panda | 总计 130 个语言条件任务,分 4 组套件
|
FWT / NBT / AUC(稀疏成功率)+ 混淆矩阵
|
环境纯仿真,单机 CPU 可跑(MuJoCo + robosuite 1.4.0)技术栈Python + BDDL 任务定义 + FWT / NBT / AUC 评测脚本;演示数据下载脚本 / HuggingFace 镜像 + notebooks 上手示例 | 3–5 人天锚定折算·待确认(原成本档:低) | 未公开单一榜首分数(2026-09-20 整理,出处:论文 Table 1 / Table 2 基线对比,ER 与 PackNet 等方法按套件报告) |
| CALVIN | 语言条件长时序操作协议,测 5 步链式执行与跨环境泛化,不测大规模真机排名 | PyBullet + PlayTable 操作台 / 7 自由度机械臂 | 约 34 类原子操作 + 1000 条 5 步链 + 4 个环境
|
MTLC 单步 + LH-MTLC 链式(SR_1 至 SR_5 + 平均链长)
|
环境PyBullet + EGL 离屏渲染,单机可跑(GPU 可选),7 自由度仿真臂操作台技术栈数据集划分下载脚本 + evaluate_policy.py 评测入口 + slurm 集群训练脚本 + RL 示例 notebook | 5–8 人天锚定折算·待确认(原成本档:低;数据下载体量大) | 53.9%(2021-12,出处:论文评估表 MCIL 基线 D→D 的 MTLC 单步);arXiv:2112.03227 ⚠️待点开确认(CALVIN,原因:版本号未核实) |
| SimplerEnv | 真实策略的 real-to-sim 排名复现,测仿真评估是否保序,不测新策略训练榜首 | SAPIEN + ManiSkill2 真机映射分支 / Google Robot 与 WidowX | 两类本体约 10 个任务族 + 约 1500 轮配对评估
|
成功率 + Pearson 相关 + MMRV + 两套评估做法
|
环境SAPIEN + ManiSkill2 真机映射分支(另有 ManiSkill3 GPU 并行分支,快约 10–15 倍);消费级显卡约 3500 步 / 秒,约为真实 7 倍速技术栈main_inference.py 推理主入口 + calc_metrics.py(MMRV / Pearson 复算)+ 新增环境指引 + 交互示例 notebook | 8–12 人天锚定折算·待确认(原成本档:中;视觉匹配调试占大头) | 未公开单一成功率榜首(2026-09-20 整理,出处:论文 Fig.1 强相关结论,仿真与真实配对评估约 1500 轮;各策略分值见分章 03,不转述二手排名) |
| RoboCasa365 | 厨房原子到组合的泛化阶梯,测组合泛化与数据规模效应,不测开放家务全集 | MuJoCo + robosuite / 移动操作平台 | 365 个任务 + 约 2500 场景 + 超 2000 小时数据
|
分组成功率(原子 / 组合可见 / 组合未见)+ 终身学习阶段成功率
|
环境MuJoCo + robosuite;物理跑 CPU、渲染走 GPU,20Hz,可多异步环境并行;2000 小时级数据需大容量存储技术栈robocasa 任务与环境实现包 + 官网文档与排行榜 | 12–25 人天锚定折算·待确认(原成本档:中高;不含全量数据下载) | 平均 22.5%(Atomic-Seen 44.1% / Composite-Seen 9.0% / Composite-Unseen 11.7%)(2026-03,出处:365 论文正文系统评估节);仿真加真实联合训练 79.8%,纯真实 61.8%(出处同);原版分数引用 arXiv:2406.02523 ⚠️待点开确认(RoboCasa 原版,原因:与仓库引用段对应关系未核实) |
| ManiSkill | 图形处理器并行的大规模操作基准,测并行吞吐与跨本体泛化,不测家务语义规划 | SAPIEN 3 + PhysX 并行物理 + Vulkan 并行渲染 / 多形态本体 | ManiSkill2 约 20 任务族 + ManiSkill3 约 12 类域
|
各任务族成功率(训练 / 测试物体集分离)+ 回报值
|
环境SAPIEN + PhysX GPU 并行仿真 + Vulkan 并行渲染,需 NVIDIA GPU(论文 256 并行约 1 小时训 1500 万样本,RTX 4090 级)技术栈mani_skill 环境 / 智能体 / 传感器 / 向量化模块 + 在线文档与演示画廊 | 8–12 人天锚定折算·待确认(原成本档:中) | 91.6%(2024-10,出处:ManiSkill3 论文正文真实评估,22 次成功共 24 次试验平均);ManiSkill2 分数引用 arXiv:2302.04659 ⚠️待点开确认(ManiSkill2,原因:版本号未核实),细项见分章 05 |
| BEHAVIOR-1K | 完整家务活动的符号化定义,测长时程规划与状态变化处理,不测单步抓取榜首 | Isaac Sim + OmniGibson / 移动双臂平台 | 1000 个活动 + 50 场景 + 9000 余物体
|
BDDL 谓词满足率 + 效率分(导航距离 / 仿真耗时 / 物体位移)
|
环境Isaac Sim + OmniGibson(Omniverse + PhysX 5),光追渲染,需高显存 GPU;约 60 物体住宅场景约 60 帧 / 秒技术栈bddl3 符号定义库(活动定义 / 知识库 / 谓词判定)+ OmniGibson 仿真主体 + 官网安装指南 | 25–50 人天锚定折算·待确认(原成本档:高;Omniverse 环境最耗时,约 5–10 周单人) | 未公开单一榜首分数(2026-09-20 整理,出处:论文实验节,长时程与复杂操作仍是挑战,基线分散未收敛,细项见分章 06) |
| RoboTwin 2.0 | 双臂数字孪生的评测与数据工厂,测双臂协作与视觉指令泛化,不测单臂桌面榜首 | SAPIEN 3.0 / Aloha、ARX、Franka 等双臂平台 | 50 评测任务 + 731 物体 + 10 万余条轨迹
|
任务成功率 + Easy / Hard 两档 + 视觉指令泛化剖面
|
环境SAPIEN 3.0,双臂构型 5 种,30Hz 多视角 RGB-D 同步;真机对照需 COBOT-Magic 双臂平台技术栈env_cfg 双臂构型 + envs 仿真实现 + XPolicyLab 评测适配 + HuggingFace 预采集数据 + 完整文档站 | 10 人天(两周)你方实测锚点(原成本档:中;纯仿真部分) | 71.3%(2025-06,出处:论文 Fig.1 自研方法);代码生成成功率提升 10.9 个百分点(出处:论文摘要与正文);纯合成零样本相对提升 228%,加 10 条真实演示相对提升 367%(出处同,细项见分章 07) |
| RoboDojo | 按能力维度剖分的统一评测,测记忆、精度、长时程等短板定位,不测单一总榜首 | Isaac Sim 5.1 + IsaacLab 2.3 / 多机器人本体 | 仿真 54 组 + 真机 18 个 + 训练数据约 38 小时
|
五维能力成功率 + 平均分(每任务 50 轮,按五维平均)
|
环境Isaac Sim 5.1 + IsaacLab 2.3,异构并行 + 多卡分片;真机需 1.5 米见方工位 + 固定臂 / 相机位姿 + LED 线光源技术栈XPolicyLab 统一策略接口 + robodojo.sh 评测入口 + YAML 模块化任务配置 + HuggingFace 数据 | 12–25 人天锚定折算·待确认(原成本档:高;纯仿真部分,真机工位另计) | 基线平均约 8% 至 13%(2026-07,出处:论文主结果表,如 Hy-Embodied 类基线平均约 13.07% 与 8.80% 双列;各维度细项见分章 08) |
| VLA-Harness | 一次接入、多处评测的矩阵型框架,测跨模型横评与复现保真,不测单一操作技能榜首 | WebSocket 加消息打包协议,各榜单容器隔离 / 依所连榜单本体而定 | 约 14 适配器 + 6 模型服务 + 657 条聚合结果
|
分集 → 任务 → 榜单三级聚合 + 复现偏差报告
|
环境榜单侧 Docker 容器隔离(镜像 4.7–35.6GB,动作 6–14 维);模型侧单文件 uv 脚本(约 50 行 predict 方法)技术栈vla-eval serve 起模型服务 + vla-eval run 跑榜单客户端,两份 YAML 驱动,结果落结构化 JSON | 8–12 人天锚定折算·待确认(原成本档:中;先跑通 LIBERO 复现矩阵) | 聚合 657 条结果(2026-03,出处:论文 Fig.1);复现警示:单个未记录参数可摆动 55 个百分点,如 LIBERO 案例从 97.8% 降至 42%(出处:论文 Sec.III);并行评估最高约 47 倍加速,如 2000 轮 LIBERO 约 18 分钟(出处:论文摘要与 Fig.1) |
横向可滚动查看全表;首列与表头冻结。点「下载 CSV」可直接用 Excel 打开,「复制 TSV」可粘贴进在线表格。