Manager 与计算节点
Manager 是控制面的编排能力,与管理 API 一起运行在 webserver 服务中。Node 是计算机上的节点代理,负责硬件探测、资源上报和本地部署任务。远端 Node 主动连接 Manager,不需要把节点上的管理 API 对外开放。
三个容易混淆的地址
| 地址 | 用途 | 配置位置 |
|---|---|---|
| Manager 控制面地址 | 浏览器登录、节点引导 HTTP 请求与 /ws/node 回连 | WEBSERVER_PORT、LLMPOD_NODE_MANAGER_IP,必要时 LLMPOD_NODE_MANAGER_IP_LAN |
| 节点互联 IP | 其他节点或部署容器访问这台节点 | 注册节点时指定的节点 IP |
| 推理网关地址 | 应用请求 /v1/* | PROXY_PORT、可选的 LLMPOD_PROXY_ADVERTISE_URL |
LLMPOD_NODE_MANAGER_IP 留空时回落到 localhost,只适合与 Manager 同机 的节点。多机环境应从节点机器实测 Manager 地址可达,同时确保节点互联 IP 能在相关机器之间通信。
生命周期
- 管理员创建 Docker 集群,在节点列表为目标集群签发短期引导命令。
- 在目标机器执行引导脚本;脚本启动 Node 容器并保存节点身份。
- Node 连上 Manager,上报 CPU、内存和可识别的 GPU / NPU;管理员在节点详情确认在线和设备状态。
- 创建部署时,Manager 调度算力和模型文件,Node 在宿主容器运行时中执行任务并回报状态。
- 升级或维护时,先查看该节点上有无运行中的实例。节点版本可在管理端核对,详见升级 LLMPod。
Node 容器默认使用宿主机网络以支持多机通信;设备可见性仍依赖宿主驱动与容器运行时配置。节点在线只证明控制连接存在,不等于模型容器已经具备可用 GPU。实际排查步骤见添加计算节点和常见问题。