模型推理
推理页面把训练完成的检查点或外部模型部署为推理服务,并提供模拟推理、MCAP 数据测试与离线边缘部署三种验证与落地方式。
适用角色与前提
角色与权限
| 角色 | 可执行操作 | 必需权限 |
|---|---|---|
| 管理员 | 创建、查看、启动、停止、删除推理服务;管理推理额度 | 「查看推理」、「管理推理任务」 |
| 项目经理 | 创建、查看、启动、停止、删除推理服务 | 「查看推理」、「管理推理任务」 |
菜单入口为模型 → 推理。模块权限的配置方式见模块权限。
使用前提
| 项 | 要求 |
|---|---|
| 推理服务 | 推理服务已部署并可访问 |
| 模型来源 | 训练检查点、自定义模型权重与配置、HuggingFace 预训练模型之一 |
| GPU 资源 | 推理节点有可用 GPU;无 GPU 时回退 CPU |
| 推理额度 | 额度未用尽,额度由管理员在额度管理中授予 |
| 权限 | 「管理推理任务」 |
操作步骤
模型来源
创建推理服务时按来源选择标签页。
| 来源 | 标签页 | 说明 |
|---|---|---|
| 训练检查点 | 使用微调模型 | 选择已完成的训练任务及其检查点 |
| 自定义模型 | 上传自定义模型 | 上传模型权重与配置文件,模型类型从配置文件解析 |
| 预训练模型 | 使用预训练模型 | 选择内置模型,或填写 HuggingFace 仓库 ID |
从检查 点部署
- 进入模型 → 推理,点击「创建推理」。
- 在「使用微调模型」中选择训练任务。
- 选择该任务下的检查点。
- 填写推理服务名称与服务描述。
- 选择 GPU;系统默认推荐显存占用率最低的 GPU。
- 点击「创建推理服务」,等待部署完成。
部署过程自动创建容器、加载模型权重与配置、启动推理服务并执行健康检查。

上传自定义模型
上传自定义模型时,需提供模型权重与配置,系统从配置解析模型类型。
| 项 | 要求 |
|---|---|
| 模型权重 | .safetensors 文件 |
| 模型配置 | config.json,用于识别模型类型 |
| 数据集配置 | train_config.json,可选 |