跳到主要内容

模型训练

训练页面在浏览器内完成策略模型的训练任务创建、参数配置、过程监控与检查点管理。训练任务的执行由训练服务调度,产出可部署为推理服务的检查点。

适用角色与前提​

角色与权限​

角色可执行操作必需权限
管理员创建、查看、停止、删除训练任务;管理训练额度「查看训练」、「创建训练任务」
项目经理创建、查看、停止、删除训练任务「查看训练」、「创建训练任务」

菜单入口为模型 → 训练。模块权限的配置方式见模块权限。

使用前提​

项要求
训练服务训练服务已部署并可访问
训练数据已导出的 LeRobot 导出记录、已上传的 LeRobot 数据集、可访问的下载链接,或 HuggingFace 数据集之一
数据集版本LeRobot v2 或 v3;spirit-v1.5 另支持 robochallenge
训练位置管理员已配置本机 GPU 服务器或远程训练节点
GPU 资源本机训练需可用 GPU;groot 仅支持 Nvidia Ampere 及以上型号
训练额度次数额度与时长额度未用尽,额度由管理员在额度管理中授予
权限「创建训练任务」

操作步骤​

支持的模型与框架​

平台注册 11 个可训练策略模型。每个模型支持的框架与数据集版本如下。

模型标识支持框架默认框架支持数据集版本
actact、lerobotactv2、v3
diffusionlerobotlerobotv2、v3
grootlerobotlerobotv2、v3
pi0lerobot、jaxlerobotv2、v3
pi05lerobot、jaxlerobotv2、v3
reward_classifierlerobotlerobotv2、v3
saclerobotlerobotv2、v3
smolvlalerobotlerobotv2、v3
spirit-v1.5spiritspiritrobochallenge、v2、v3
tdmpclerobotlerobotv2、v3
vqbetlerobotlerobotv2、v3

框架说明如下。模型被管理员通过名称或框架禁用后不出现在训练页。

框架标识说明适用模型
lerobotHuggingFace 机器人学习框架,基于 PyTorch除下述专用框架外的全部模型
jaxJAX 计算框架pi0、pi05
actACT 专用训练栈act
spiritSpirit 官方训练栈spirit-v1.5

创建训练任务​

  1. 进入模型 → 训练,点击「创建训练」。
  2. 选择训练位置;选择本机 GPU 服务器时,勾选参与训练的 GPU。
  3. 选择模型,并在该模型支持的框架中选择训练框架。
  4. 填写训练参数;首次训练可使用默认值。
  5. 选择训练数据集,来源见下表。
  6. 可选:在「从已有训练继续」中选择源训练任务与检查点权重。
  7. 选择项目归属;不选择时为私密任务,仅创建者可见。
  8. 点击「创建训练任务」。

训练数据集的四种来源如下。

来源数据位置说明
导出 LeRobot平台导出记录从导出历史中选择一条记录
已上传 LeRobot平台数据集选择已上传的 LeRobot 数据集
下载链接外部地址支持 .tar.gz 或 .zip 格式的 LeRobot 数据集
HuggingFaceHuggingFace Hub填写数据集名称,如 io-intelligence/piper_uncap_pen

选择训练数据

选择训练位置

训练参数设置

训练参数​

通用参数​

参数类型默认值说明
batch_sizeint1每次训练使用的样本数量,按显存调整
stepsint10000训练总步数
seedint1000随机种子,用于结果复现
num_workersint4数据加载器工作进程数
eval_freqint1000每多少步评估一次
log_freqint100每多少步输出一次日志
save_checkpointbool是是否保存检查点
save_freqint5000每多少步保存一次检查点

模型特定参数​

训练页按所选模型显示对应参数。常用模型的默认值如下。

模型参数默认值说明
actchunk_size100一次预测的动作序列长度
actn_action_steps100每次调用执行的动作步数
actvision_backboneresnet18视觉主干,可选 resnet18/34/50/101/152
actkl_weight10.0KL 散度损失权重
diffusionhorizon16动作预测时间跨度
diffusionn_action_steps8每次调用执行的动作步数
diffusionnum_inference_steps空反向扩散采样步数
grootimage_size224×224视觉塔输入的图像分辨率
grootmax_state_dim64状态向量最大维度,不足补零
grootmax_action_dim32动作向量最大维度,不足补零
pi0、pi05chunk_size50一次预测的动作序列长度
pi0、pi05num_inference_steps10去噪采样步数
pi0、pi05max_state_dim32状态向量最大维度
smolvlachunk_size50一次预测的动作序列长度
smolvlanum_steps10解码步数
smolvlamax_state_dim32状态向量最大维度
sacdiscount0.99折扣因子
sacactor_lr3e-4策略网络学习率
tdmpchorizon5预测时间跨度
tdmpcdiscount0.9折扣因子

结果校验​

训练过程监控​

训练详情页提供四个标签页。

标签页内容
训练指标损失曲线、验证指标、学习率与训练进度
模型输出检查点列表与产物文件
实时日志训练日志的流式输出
训练参数本次任务采用的参数

状态与进度取自训练服务上报的字段:进度百分比、当前步数、总步数、损失值、学习率、GPU 显存占用。

训练任务状态如下。

状态含义可执行操作
等待中已创建,等待调度删除
运行中正在训练停止、删除
成功训练完成部署推理、删除
失败训练异常结束从检查点继续、删除
用户停止由用户手动停止从检查点继续、删除
已暂停训练暂停停止、删除

训练详情页面

检查点与产物​

检查点按训练步数保存,类型分为最终检查点与步骤检查点。

操作作用约束
下载下载检查点文件或整包大检查点可先同步到对象存储再下载
删除删除检查点不可恢复
推理从检查点部署推理服务见模型推理
离线部署生成离线部署包见模型推理

「从已有训练继续」用于微调或续训:选择源训练任务与检查点权重后,创建新任务。

约束说明
训练位置一致源训练任务须与目标训练位置位于同一训练节点
检查点存在仅可选择源任务中实际存在的检查点

模型检查点列表

「训练参数」标签页提供「编辑参数并重新训练」:修改参数后,系统基于当前任务创建一条新训练任务,原任务保持不变。

异常处置​

现象可能原因处置
无法创建训练任务训练额度用尽、未选择数据集、未选择检查点申请额度;补齐数据集与检查点选择
训练任务失败显存不足、数据格式错误、参数配置错误降低 batch_size;修正数据格式;调整参数后重新训练
本机 GPU 不可用无可用 GPU系统提示已回退到 CPU 训练;检查 GPU 配置
groot 无法选择 GPUGPU 型号非 Nvidia Ampere 及以上更换为 A100、RTX 4090 等型号
训练中断训练节点故障从已保存的检查点继续训练
训练耗时超出预期数据量大、模型参数多、GPU 性能不足减少训练步数或数据量;更换算力更高的 GPU

相关页面​

页面用途
模型推理将检查点部署为推理服务
数据导出导出 LeRobot 格式训练数据
数据质检ROS 录制的自动质量检测规则
额度管理训练次数与时长额度的授予与查看
LeRobot 数据集与训练LeRobot 数据集的导入、可视化与训练