
北大等联合发布 Data Pyramid用五层数据金字塔系统回答“机器人应该从什么数据中学习”这次我们来看一个相当硬核的机器人学习方向项目由北京大学等机构联合提出的Data Pyramid数据金字塔系统。如果说过去机器人学习更多是在“卷模型结构、卷训练策略”那 Data Pyramid 要回答的是一个更底层、也更容易被忽略的问题——机器人到底应该从什么数据中学习这个项目不是又给你一个训练框架而是直接给出一套数据分层方法论把机器人训练数据的来源、规模、属性、价值和成本摆到台面上告诉你哪些数据该多采、哪些数据该少采、哪些数据可以合成、哪些数据必须来自真实物理世界。全文核心看点五层数据金字塔怎么划分、每一层数据在真实机器人训练里扮演什么角色、这套系统如何指导数据配比和采样策略、以及如果想复现或验证这套思路从环境准备到实验设计应该怎么落地。1. 核心能力速览能力项说明项目类型机器人学习数据系统 / 数据分层方法论提出机构北京大学等联合团队具体作者阵容以论文为准核心问题机器人应该从什么数据中学习主要贡献五层数据金字塔体系覆盖从人类视频到真实机器人交互数据的完整分层数据层级从互联网视频 / 人类示范到真实机器人操作数据按真实性和规模划分潜在应用机器人基础模型预训练、模仿学习数据配比、数据采集策略优化是否需要特定硬件复现实验需 GPU 集群具体配置根据训练规模决定是否支持 CPU 推理推理阶段可能可行但训练阶段必须依赖 GPU是否支持 API 调用论文层面暂无对应 API属于研究框架不提供现成服务是否支持批量任务数据采集和训练流程可批量执行但需自行搭建 pipeline适合读者机器人学习研究者、具身智能算法工程师、数据工程师、相关专业研究生一句话总结项目价值Data Pyramid 不直接解决“模型怎么训”而是先帮你把“用什么数据训”这件事梳理清楚。2. 五层数据金字塔机器人学习数据的层次逻辑Data Pyramid 的核心思想是把机器人可用的训练数据按“与真实物理世界的贴近程度”和“获取成本”分成五个层级。2.1 第一层互联网图文与视频数据这一层是规模最大、成本最低的数据来源。包括互联网上的图片、文本、视频等非机器人数据。这一层的数据优势是规模大、覆盖场景广模型可以从中学习到物体识别、场景理解、语言 grounding 等基础能力。缺点是缺乏物理交互信息模型不知道“拿起一个杯子”这个动作在真实世界中需要多大的力、怎样的轨迹。在 Data Pyramid 的框架下这一层适合做预训练底座但不适合直接作为机器人策略的训练数据。2.2 第二层人类活动视频数据这一层包括人类日常活动的视频比如做饭、打扫、整理物品等。与纯互联网视频相比人类活动视频更贴近机器人操作任务模型可以从中观察人类的手部动作、物体操作顺序和任务完成逻辑。但这层数据仍然缺少机器人本体信息——人类的手和机器人的夹爪在自由度、力控方式上有本质差异。这一层的价值在于任务理解和动作拆解但对于低层控制策略的帮助有限。2.3 第三层遥操作 / 动捕数据这一层是通过遥操作设备或动捕系统获取的人类操作数据。操作者通过手柄、外骨骼或动捕服控制机器人完成操作任务同时记录关节角度、末端轨迹、力反馈等信息。相比纯视频数据这类数据包含了机器人本体的状态信息与真实部署环境更加匹配。但采集成本显著上升需要专业设备而且操作者的熟练程度会直接影响数据质量。2.4 第四层真实机器人操作数据这一层是机器人在真实物理环境中自主或半自主执行任务时记录的数据包括关节状态、视觉观察、力传感器反馈、任务成功/失败标签等。这类数据是数据金字塔中“含金量”最高的真实数据它与测试环境高度一致模型可以直接学习从感知到动作的完整映射。但采集成本极高需要真实机器人平台、实际场景布置和大量人工干预。2.5 第五层仿真环境数据这一层是在仿真器中生成的机器人交互数据比如 Isaac Sim、MuJoCo、Gazebo 等环境中的大规模随机场景数据。仿真数据可以无限生成、成本低、可批量并行并且可以覆盖真实世界中难以复现的边缘场景。缺点是存在 sim-to-real gap仿真中的物理规律与真实世界不完全一致。2.6 五层之间怎么配合Data Pyramid 的关键洞察是不同层级的数据不是互斥的应当按比例混合使用。合理的数据配比应该是金字塔结构底部是海量的互联网数据做基础预训练中层是人类视频和仿真数据做任务理解顶部是高质量真实机器人数据做策略精调。这一思路和 LLM 训练中的“预训练 SFT RLHF”阶段划分有异曲同工之处只不过 Data Pyramid 把数据分层的思想完整地搬到了机器人领域。3. 这个系统想解决什么问题3.1 机器人学习中的“数据饥渴”当前机器人学习面临的核心瓶颈是数据不足。LLM 可以依赖整个互联网的文本数据但机器人策略学习需要的是“物理交互数据”这类数据无法从互联网直接获取。于是研究社区就面临一个选择是花大价钱采集真实机器人数据还是用仿真合成数据降低门槛Data Pyramid 给出的是一个结构化的答案按层级组织数据源根据任务需求和数据预算动态调整各层级比例。3.2 数据配比缺乏理论指导很多机器人项目在训练时会凭经验混合数据多一点仿真数据、少一点真实数据或者反过来。但很少有人能说清楚“为什么这么配”。Data Pyramid 至少有潜力提供一套更加系统的数据配比原则让研究者在构建训练集时有据可依而不是完全靠调参玄学。3.3 数据属性与学习目标不匹配另一个问题是数据属性与学习目标不匹配。如果想让机器人学会某一种灶台上的煎蛋操作用大量互联网煎蛋视频预训练当然有帮助但真正决定策略质量的是最后那些真实机器人煎蛋数据。Data Pyramid 强调了不同学习阶段需要不同层级数据的思想这和课程学习curriculum learning有相通之处但更聚焦于数据来源和物理真实度的维度。4. 如何用 Data Pyramid 指导机器人训练数据构建这一部分我们来拆解一下如果把 Data Pyramid 的框架落地到实际机器人训练流程中应该按照什么步骤操作。4.1 第 1 步定义任务场景与评估指标首先明确机器人需要完成什么任务操作对象是什么运行环境是结构化工厂还是开放家庭场景评估指标是任务成功率、操作精度还是泛化到新物体的能力这决定了哪层数据应该占主导。4.2 第 2 步盘点已有数据资产整理团队目前拥有的数据是否有互联网预训练模型和数据是否积累了人类操作视频是否有遥操作采集的数据有多少真实机器人数据是否已经搭建仿真数据生成管线这一步的目标是知道自己在数据金字塔中处于什么位置。4.3 第 3 步按金字塔结构设计数据配比参考五层结构初步制定配比底座互联网图文视频数据用于基础感知和语言理解。第二层人类操作视频用于任务级理解。第三层遥操作数据用于动作轨迹学习。第四层真实机器人数据用于最终策略对齐。第五层仿真数据用于规模扩展和边缘场景覆盖。4.4 第 4 步训练与验证按配比混合数据训练策略模型在真实环境和仿真环境中分别评测。关注不同数据层级比例对任务成功率的影响。5. 模拟实验设计如何验证数据金字塔的有效性由于当前没有可复现的现成项目仓库具体代码和模型权重以论文发布状态为准下面给出一套针对数据金字塔思路的验证实验设计适合做科研复现或工程技术验证。5.1 实验目的验证不同数据层级配比对机器人操作策略最终性能的影响找出“哪些数据层是必需品哪些层只是顺手补充”。5.2 基线设置设计三组基线仅用真实机器人数据训练。真实数据 人类视频。真实数据 仿真数据。再设置一组完整 Data Pyramid 方案真实数据 人类视频 仿真数据 互联网预训练底座。5.3 评测维度任务成功率。对新物体/新场景的泛化能力。训练数据规模的扩展曲线。数据成本采集时间和资金成本。5.4 预期结果如果 Data Pyramid 的假设成立完整方案在泛化性上应该显著优于单一数据源尤其是在训练数据量有限时补充层级的边际收益更明显。6. 环境准备与复现思路由于 Data Pyramid 是一个研究型框架具体代码和依赖需要依据论文描述来搭建。这里给出一套通用的机器人学习环境准备清单。6.1 硬件要求GPU 训练节点至少单卡 24GB 显存推荐多卡集群。CPU 节点用于数据预处理、仿真环境运行。存储数据层级越多存储需求越高建议 NVMe SSD 做训练缓存。机器人平台如果做真实数据验证需要机械臂 相机 力控等设备。6.2 软件栈Python3.9 以上。PyTorch或TensorFlow。仿真环境Isaac Sim、MuJoCo、Gazebo 三选一。机器人中间件ROS 1 / ROS 2用于真实机器人的数据采集和部署。数据处理框架FFmpeg 处理视频流OpenCV 处理图像numpy/pandas 处理状态数据。6.3 通用环境配置# 创建 Python 虚拟环境 conda create -n data_pyramid python3.10 conda activate data_pyramid # 安装基础依赖注意具体版本需按项目代码要求调整 pip install torch torchvision pip install numpy opencv-python pip install rosbag # 处理机器人数据包7. 数据收集与处理流程7.1 真实机器人数据采集真实数据采集是数据金字塔中最昂贵的一层设计采集流程时要注意固定传感器配置保持相机位姿一致。记录完整的机器人状态序列包括关节角度、末端位姿、力/力矩信息。同时录制第一人称和第三人称视角视频。每个任务重复多次保证覆盖不同初始条件。7.2 人类视频数据处理人类视频数据需要做对齐处理清洗无关片段。提取手部关键点和物体交互信息。转换为统一的轨迹表示。7.3 仿真数据生成# 仿真数据生成通用流程以 MuJoCo 为例代码需按实际项目接口调整 python generate_sim_data.py \ --env pick_and_place \ --num_episodes 10000 \ --output_dir ./sim_data \ --randomize_object_position \ --randomize_lighting7.4 数据格式统一多层级数据的格式差异很大强烈建议设计统一的数据格式# 统一数据格式示例 dataset: source: real_robot | human_video | simulation | internet_video task: pick_and_place observations: rgb_image: path/to/frame.png depth_image: path/to/depth.npy joint_states: path/to/joints.npy ee_pose: path/to/ee_pose.npy action: path/to/action.npy success: true统一格式后后续数据加载和模型输入 pipeline 会简单很多。8. 资源占用与性能观察方法虽然当前没有可测试的开源代码但结合机器人训练和数据处理的一般经验可以从几个层面做资源观察。8.1 数据预处理阶段处理人类视频和互联网视频时CPU 和解码性能是瓶颈。可以通过以下命令观察nvidia-smi # 观察 GPU 利用率 htop # 观察 CPU 和内存占用 iostat -x 1 # 观察磁盘 IO8.2 训练阶段机器人操作策略模型通常包括视觉编码器 策略网络两部分。训练时显存占用主要由以下因素决定图像分辨率和帧数。Batch size。是否同时加载多个数据层级。8.3 降低资源占用的建议视频帧率降采样降低视觉编码器输入尺寸。小 batch size 起步。使用混合精度训练。先小规模跑通实验再扩展数据量。9. 常见问题与排查方法问题现象可能原因排查方式解决方案真实机器人与仿真数据格式不一致不同采集平台的数据 schema 不同检查数据日志字段和单位设计统一数据格式写转换脚本训练时显存不足批量大小过大或图像分辨率过高监控 nvidia-smi降低 batch size缩小输入尺寸仿真策略迁移到真实机器人失败sim-to-real gap 较大在仿真和真实环境分别做对比测试增加真实数据比例加入域随机化人类视频清洗后仍包含大量无效帧过滤规则太宽松可视化抽样检查添加动作检测模型提高过滤阈值数据金字塔各层数据比例失衡缺乏配比策略统计各层数据量占比按任务需求重新采样对各层做加权论文代码未开源发布时间限制查看论文补充材料和项目主页先按论文描述自行实现基线等待官方代码10. 最佳实践与使用建议10.1 小规模验证先行在没有完整复现 Data Pyramid 前先在小规模数据集中跑通数据混合训练管线。选 1-2 个任务把五层数据的 pipeline 都跑通确认数据格式和模型输入一致后再扩展规模。10.2 建立数据版本管理机器人数据集的迭代和更新很频繁。每个层级的数据都要有版本号、记录采集日期、采集平台、清洗规则等信息。推荐用 DVC 或类似工具做数据版本管理。10.3 数据合规必须前置这是尤其要注意的一点人类视频数据涉及个人肖像互联网数据涉及版权如果用到公开数据集需要确认数据许可协议是否允许用于模型训练和商用。如果涉及合作单位的机器人数据也要提前确认知识产权归属。对真实场景中的人物、环境、物品信息要做好脱敏处理。尤其是涉及人脸、家庭环境、办公环境的数据需要获得明确的授权同意。商用之前全部数据来源和授权链路都要留档备查。10.4 训练日志与可复现性每次实验都保存完整的训练配置、数据配比、随机种子和数据版本号。Data Pyramid 的核心思想是理解数据配比的影响如果实验不复现这些分析就没有意义了。10.5 多层级数据配比要动态调整不要认为一种配比可以适用于所有任务。建议的做法是先跑小规模实验对比配比方案确定最优区间后再用大规模数据做最终训练。每换一个任务域就重新做一轮配比搜索。11. 总结与下一步Data Pyramid 的价值在于把机器人学习的数据问题拆成了一个可见、可分析、可调优的框架。它可能不是最终答案但它给出了一个方向数据不是越多越好而是需要在真实度、规模、成本之间做系统性的平衡。从实践来看最值得先验证的是将真实机器人数据与仿真数据、人类视频数据混合训练时的配比敏感性。最容易踩的坑则是多源数据格式不统一和数据合规风险。后续可以关注的是Data Pyramid 团队是否会开源配套的数据管线基于该框架训练出的机器人基础模型是否能在真实物理环境中展示更好的泛化能力以及这套分层方法能否延伸到 VLAVision-Language-Action模型的数据工程中。建议做机器人方向研究或工程的朋友把这篇论文放入阅读清单即使暂时不自己做数据采集也可以借助这个框架重新审视团队现有的数据策略。至少在有新任务需要准备数据时Data Pyramid 是一个足够清晰的起点。