中国信通院 · 2024.11 — 2025.08 · 核心技术成员
基于 LLM 运动规划与模仿学习,构建从自然语言指令到机械臂精确执行的完整具身智能系统,覆盖数据采集、策略训练、模型对比与工程部署全流程。

系统概览
本项目依托中国信息通信研究院具身智能研究课题,构建了一套完整的工业机械臂具身智能系统,核心能力包括:
- 语言驱动运动规划:基于 VoxPoser 框架,将自然语言指令转化为机械臂可执行轨迹
- 模仿学习策略训练:系统性采集示教数据,完成 Diffusion Policy 与 ACT 的训练、对比与调优
- 双臂协同系统:睿尔曼 RM-75 七自由度双臂平台,完成实机任务验证
一、VoxPoser:语言驱动运动规划
VoxPoser 是一种基于大语言模型(LLM)的零样本运动规划框架,利用 LLM 生成空间值函数,将语言指令转化为运动约束,无需大量训练数据即可完成任务规划。

LightIndust-Net检测效果

OWL-ViT原版检测效果
将原框架中的 OWL-ViT 替换为自研轻量化检测模型 LightIndust-Net——基于 YOLOv11 改进,使用本项目采集的工业场景数据集训练,在工件识别数量与置信度上均大幅优于原版(见上图)。检测结果以结构化 JSON 输出物体类别、位姿与尺寸,作为 LLM 的环境感知输入。
本项目完成的工作:
- 完整工程化落地 VoxPoser,打通「自然语言 → 空间值函数 → 运动轨迹 → 机械臂执行」全链路
- 构建本地视觉感知接口,基于自研 LightIndust-Net(YOLOv11 改进版)完成目标检测与实例分割,输出物体类别、位姿与尺寸的结构化 JSON,作为 LLM 的环境感知输入
- 设计分阶段执行与重感知机制:每个子动作执行后自动校验夹爪与目标坐标偏差,超阈值则触发重感知并重新规划
- 适配睿尔曼 RM-75 双臂平台,完成真实环境下的任务执行验证
二、模仿学习:策略训练与对比
数据采集
使用睿尔曼具身智能双臂开发平台(16 自由度,配备 4 台 RealSense D435I),采用主从臂遥操作方式采集示教数据。
每条轨迹包含:
- 4 路 RGB 图像(640×480,30 FPS)
- 16 维状态数据(关节位置 / 速度 / 力矩 + 夹爪)
- 对应动作指令序列
以 HDF5 格式存储(episode_<id>.hdf5),30 Hz 采样,原始数据速率约 100 MB/s。
累计构建数据集 4,899 条轨迹(单臂 2,054 条 / 双臂协作 2,845 条),任务时间步 210—870 步,采集周期 2025.03—2025.05。
Diffusion Policy 训练
Diffusion Policy 是一种基于扩散模型的机器人策略学习方法,核心优势在于少量示教数据即可训练出稳定的操作策略。
针对轴承抓取、轴承盖取放、零件盒取件共 3 个操作任务,完成了从数据筛选、训练到实机验证的完整流程:
- 从数据集中筛选 150 条高质量示教轨迹用于训练
- 迭代训练约 3—4 个版本,逐步调优动作精度与策略稳定性
- 实机抓取成功率约 70%(目标区域内)
与 ACT 的对比
项目同期对 ACT(Action Chunking with Transformers)进行了对比实验。ACT 在大规模数据训练下表现出明显局限:目标位姿偏移超过约 4 cm 时即跳过关键步骤、退化为轨迹回放,实机成功率不足 20%。
相比之下,Diffusion Policy 在仅 150 条数据的条件下实现了更稳定的策略泛化,验证了其在小样本工业操作任务中的适用性。
三、系统基础设施
- 搭建 GPU 服务器集群与 SSH 集中运维环境
- 部署 Docker 容器化环境,规范算法模块的部署与迁移流程
- 负责甲方需求对接与多组跨团队协调,推动项目按期交付
技术栈
ROS2 Python Diffusion Policy ACT VoxPoser LightIndust-Net YOLOv11 HDF5 Docker Linux 睿尔曼 RM-75