模型服务的组成
一个可调用的模型服务需要实际提供推理的端点、对外发布的模型名和调用凭据。本地模型与外部服务进入平台的起点不同,但都在发布路由汇合。
| 对象 | 它记录什么 | 它本身能否被 API 调用 |
|---|---|---|
| 模型记录 | HuggingFace 或本地模型文件的来源、类别与元数据 | 不能 |
| 部署 | 某个模型用哪个引擎、镜像和节点资源运行 | 还需要就绪端点与发布 |
| 来源端点 | 真实上游的协议、地址、上游模型名与凭据;可以来自本地部署或外部服务 | 尚需绑定到发布路由 |
| 发布路由 | 应用看到的模型名、类型、价格、端点绑定、权重和故障切换 | 发布且有可用绑定后可以 |
| API Key | 调用方身份及模型、用量限制 | 用来请求已发布模型 |
本地流程是添加模型 → 模型部署 → 发布模型。添加模型只是登记文件,创建部署才启动推理容器。部署向导可选择自动发布;即便如此,也应在发布中心检查对外名称、绑定和状态。
外部服务流程从登记来源端点开始,无需添加模型文件或计算节点。两条流程都要发布路由,应用请求中的 model 使用对外模型名。网关会把它换为端点的上游模型名,按端点协议转发,再把响应中的模型名映射回来。租户可见性还受模型封禁和 Key 授权范围影响。
一个路由可以绑定多个端点,以优先级、权重和故障切换控制流量。端点和路由的存在并不保证上游持续健康;交付应用前,应使用目标 Key 请求 GET /v1/models 并发起一次与端点协议匹配的真实推理调用。