旗下矩阵

  • 投资界
  • 天天IPO
  • 解码LP
  • 并购
  • 前哨
  • 投资界AI

智元开源AGIBOT WORLD 2026第三期:强化学习数据集,让机器人从经验中学习

智元正式发布AGIBOT WORLD 2026第三期开源强化学习数据集,覆盖从示教到部署各阶段,含丰富标注,助机器人从成败中进步,迈向具身智能新时代。
·投资界综合

AGIBOT WORLD 2026 是首 个覆盖具身智能全域研究的开源数据集,基于丰富真实场景,围绕五大具身领域研究主题构建,每个主题均设有专属采集方法与精细化的标注体系,以精准支持不同细分领域研究者的需求。继模仿学习和多样交互两期数据集之后,本期进一步面向强化学习,开放机器人从专家示教、真实部署到人工纠正过程中产生的多类真实交互经验数据。

过去几年,大规模专家示教数据推动机器人模仿学习快速发展,帮助机器人学习“面对一个任务应该怎么做”。 但进入真实环境后,机器人产生的数据并不都是标准答案:有成功,也有失败;有偏差,也有恢复;有自主执行,也有人类接管。 这些真实交互记录了模型的能力边界、失败状态、有效行为和纠正过程,是专家示教无法完全提供的经验数据(Experience Data)。 因此,机器人不仅要学习别人如何成功完成任务,也要学会利用自己与真实世界交互产生的经验。

为此,智元正式发布 AGIBOT WORLD 2026 第三期开源强化学习数据集。该数据集覆盖了从示教到部署的各个阶段:专家示教提供任务的标准示范;人类在环纠正轨迹记录了模型执行犯错时人类的接管与纠正;部署推理轨迹(Rollout)则有模型真实部署执行产生的成功与失败。在此基础上,数据集进一步标注了进度、错误、成功与干扰等关键信息。研究者可以据此训练不同维度的奖励模型(Reward Model),将轨迹级的成败结果细化为过程反馈,为真机强化学习的研究提供可复用的数据基础。

本期数据集首批开源数据覆盖11430条轨迹,包含1024条成功Rollout轨迹、1369条失败Rollout轨迹,并提供丰富的细粒度标注。我们希望以此降低真机强化学习中积累执行反馈的成本,让不同团队在同一批真实轨迹上复现实验、比较方法,并把分散在各场景中的经验沉淀为公共资产。

从示教到部署,采集机器人的“实战轨迹”

本期首批数据集聚焦工业与家居等真实场景,设计网线插接、钥匙开门等14类交互任务,覆盖精细操作、复杂长程和强接触等不同任务类型。

数据采集贯穿从示教、部署到纠正的三个阶段:

专家示教轨迹,由人类操作员完成任务,记录任务在真实环境中的标准执行轨迹。

部署推理轨迹,模型进入真实场景执行任务,成功和失败结果均被记录。成功rollout展示策略已经具备的能力,失败Rollout则暴露模型在不同任务阶段的能力边界。

人类在环纠正轨迹,模型首先自主推理并执行任务,人类操作员在策略出现偏差时进行接管纠正。数据同时保留接管前的模型行为、接管时机、接管后的纠正动作。

这三类轨迹共同构成一条完整的数据链路:专家示教告诉模型任务应该怎样完成,人类在环纠正轨迹记录了模型如何被纠正,Rollout轨迹检验模型独立执行时究竟做得怎么样。

智元开源AGIBOT WORLD 2026第三期:强化学习数据集,让机器人从经验中学习

智元开源AGIBOT WORLD 2026第三期:强化学习数据集,让机器人从经验中学习

智元开源AGIBOT WORLD 2026第三期:强化学习数据集,让机器人从经验中学习

以上三张图,排版左右滑动

从过程到结果,标注真实执行中的关键反馈

强化学习需要的不是“机器人做了什么”的笼统记录,而是“这一步做得怎么样”“任务推进到哪一步”的精细反馈。

本期数据集围绕真实执行过程,对成功、错误、接管、干扰等关键状态进行细粒度标注;在此基础上,用户可进一步结合标注信息,识别风险与错误恢复过程。成功帧提供明确的任务达成信号,错误、干扰和风险区间帮助模型识别异常与危险状态,接管区间记录人工介入时机,错误恢复区间则提供从错误到恢复的真实过程。

智元开源AGIBOT WORLD 2026第三期:强化学习数据集,让机器人从经验中学习

丰富标注

以首批开放的近万条轨迹为基础,本期数据集共包含98159个子任务区间标注,每个子任务均带有完成状态标注;同时标注了26493段干扰片段、5795段错误状态,以及10684段人工接管。

这些细粒度标注可以进一步转化为强化学习所需的反馈信号,用于训练奖励模型、价值模型,支持任务进度预测、成功检测、错误识别、风险预警、接管提示以及错误恢复等研究。

智元开源AGIBOT WORLD 2026第三期:强化学习数据集,让机器人从经验中学习

数据在强化学习的应用

让机器人从每一次成功与失败中进步

对具身智能而言,真正的技能从来不是复刻标准化动作,而是在动态真实环境中感知反馈、自主纠错、持续优化。

模仿学习让模型从专家示教中学习任务,而强化学习则提供了另一条优化路径:利用真实执行反馈,判断哪些行为推动了任务、哪些状态存在风险,并将这些判断转化为可供训练的奖励信号。高质量的真机轨迹与过程标注,是开展这类研究的重要基础。

AGIBOT WORLD 2026 第三期真机强化学习数据集,完整留存每一次物理接触、每一处执行偏差、每一轮人工修正,让真机强化学习拥有高质量、可复用、闭环式训练底座,让机器人不仅要从成功示范中学会“怎么做”,还要从错误、风险和人工纠正中学会“如何做得更好”。加速行业从 “实验室演示” 走向规模化产业部署,迈进具身智能生产力新时代!



AGIBOT WORLD 2026第三期:真机强化学习

项目主页:agibot-world.com

开源地址:huggingface.co/datasets/agibot-world/AgiBotWorld2026







【本文经授权发布,不代表投资界立场。本平台仅提供信息存储服务。】
【免责声明】:本文不构成任何投资建议。市场有风险,投资需谨慎。
如有任何疑问,请联系(editor@zero2ipo.com.cn)投资界处理。