模型部署
入口:管理员控制台 → 基础设施 → 模型管理 → 部署列表 → 新建部署。也可在模型管理页对已添加的模型选择“新建部署”。
部署前应先添加模型,并确认目标 Docker 集群已有在线节点。GPU 推理还需要目标机的驱动与容器运行时正确识别设备;特定引擎(如 llama.cpp)也支持纯 CPU 落点。创建部署和发布对外模型名称是两个步骤;确认部署时可以选择自动发布。
创建部署
向导依次完成三步。也可以从已添加模型的列表行点击新建部署,让第一步自动选中该模型。
1. 基本信息

核对 模型、部署名称、推理引擎、镜像版本和目标集群。部署名称可以修改;镜像版本留空时由服务端按默认目录解析。推荐值只是起点,仍需确认目标节点的驱动、资源和模型格式。点击下一步进入算力选择。
2. 选择算力

设置最大上下文长度和副本,按副本选择节点与 GPU;适用时可选择纯 CPU。界面会展示推荐显存、已选卡数,以及每张卡不可选的原因。多副本要满足每份卡数与设备架构等拓扑约束,GPU 与纯 CPU 落点不能混用。图中的节点 IP 已替换为示例地址。

3. 确认部署


确认页还可展开算力明细和高级启动参数。默认开启部署完成后自动发布;关闭后,部署只注册推理端点,需待其就绪后到发布中心手动创建对外路由并绑定。向导会在进入确认页前执行预检;如果出现资源或兼容性告警,优先调整模型、引擎或落点,不要将“强制部署”作为常规操作。
提交后检查状态
创建成功后,控制台直接进入部署详情的拓扑视图,而不是返回列表。部署任务异步执行;先看顶部的编排阶段,再观察拓扑中的节点、实例与 GPU 状态。


等待状态进入运行中,再到详情页核对实例与端点健康。提交成功只表示部署任务已创建,不能仅凭提示就向应用交付模型名。