跳到主要内容

模型部署

入口:管理员控制台 → 基础设施 → 模型管理 → 部署列表 → 新建部署。也可在模型管理页对已添加的模型选择“新建部署”。

部署前应先添加模型,并确认目标 Docker 集群已有在线节点。GPU 推理还需要目标机的驱动与容器运行时正确识别设备;特定引擎(如 llama.cpp)也支持纯 CPU 落点。创建部署和发布对外模型名称是两个步骤;确认部署时可以选择自动发布。

创建部署​

新建部署向导

向导依次完成三步。也可以从已添加模型的列表行点击新建部署,让第一步自动选中该模型。

1. 基本信息​

已选择模型并自动推荐引擎和集群的部署基本信息
选中模型后,控制台生成部署名并推荐引擎、镜像版本和目标集群。

核对模型、部署名称、推理引擎、镜像版本和目标集群。部署名称可以修改;镜像版本留空时由服务端按默认目录解析。推荐值只是起点,仍需确认目标节点的驱动、资源和模型格式。点击下一步进入算力选择。

2. 选择算力​

部署算力拓扑及已选 GPU
拓扑展示节点、GPU、可用显存与估算需求;蓝色节点是当前副本的落点。

设置最大上下文长度和副本,按副本选择节点与 GPU;适用时可选择纯 CPU。界面会展示推荐显存、已选卡数,以及每张卡不可选的原因。多副本要满足每份卡数与设备架构等拓扑约束,GPU 与纯 CPU 落点不能混用。图中的节点 IP 已替换为示例地址。

算力步骤中的 KV Cache 精度设置
“高级”可调整 KV Cache 精度;默认值表示不额外量化。

3. 确认部署​

部署确认页的模型、引擎、算力及自动发布摘要
提交前检查部署名、模型、引擎、集群、算力拓扑与自动发布开关。
部署确认页展开的自动发布名称、标签与定价字段
展开“发布详情”可填写对外服务名、描述、标签和三项 Token 定价。

确认页还可展开算力明细和高级启动参数。默认开启部署完成后自动发布;关闭后,部署只注册推理端点,需待其就绪后到发布中心手动创建对外路由并绑定。向导会在进入确认页前执行预检;如果出现资源或兼容性告警,优先调整模型、引擎或落点,不要将“强制部署”作为常规操作。

提交后检查状态​

创建成功后,控制台直接进入部署详情的拓扑视图,而不是返回列表。部署任务异步执行;先看顶部的编排阶段,再观察拓扑中的节点、实例与 GPU 状态。

部署中拓扑详情与编排进度
部署中可看到下载模型、拉取镜像、启动节点与健康检查等阶段。
部署列表中的创建中状态
返回部署列表后,可按状态筛选,并从“部署详情”重新进入拓扑。

等待状态进入运行中,再到详情页核对实例与端点健康。提交成功只表示部署任务已创建,不能仅凭提示就向应用交付模型名。

部署后的管理​

在部署列表按状态筛选并执行启动、停止或删除;运行中的部署可调整副本数。扩缩容只改变副本数量,不修改单副本的模型或算力规格。部署详情提供节点与实例拓扑、阶段进度、容器日志和启动命令,适合排查启动失败或资源不足。

症状优先检查
长时间停留在创建中部署详情中的阶段时间线、节点在线状态、镜像拉取与模型文件获取日志
容器启动失败引擎与模型格式是否匹配、GPU 驱动和容器运行时、启动命令与容器日志
运行中却请求不可达端点健康、节点互联 IP、发布路由绑定与推理网关日志
启动或扩容提示资源冲突原 GPU 是否已被占用、目标节点剩余显存与集群可用算力
模型下载超过自动重试上限后部署失败的拓扑详情
示例部署在模型下载阶段超过自动重试上限;详情页会显示失败原因与节点日志入口。

出现这种失败时,应先检查节点日志中的下载错误、模型源地址和节点网络,再决定是否重新启动部署或改用可访问的本地模型目录。失败的部署不会生成可用推理端点。

如果未自动发布,部署就绪后还需在发布中心配置对外模型名和端点绑定。相关对象的区别见模型服务的组成。