跳到主要内容

模型服务的组成

一个可调用的模型服务需要实际提供推理的端点、对外发布的模型名和调用凭据。本地模型与外部服务进入平台的起点不同,但都在发布路由汇合。

添加模型或接入已有推理服务,形成端点、发布对外模型,再用 API Key 调用
对象它记录什么它本身能否被 API 调用
模型记录HuggingFace 或本地模型文件的来源、类别与元数据不能
部署某个模型用哪个引擎、镜像和节点资源运行还需要就绪端点与发布
来源端点真实上游的协议、地址、上游模型名与凭据;可以来自本地部署或外部服务尚需绑定到发布路由
发布路由应用看到的模型名、类型、价格、端点绑定、权重和故障切换发布且有可用绑定后可以
API Key调用方身份及模型、用量限制用来请求已发布模型

本地流程是添加模型 → 模型部署 → 发布模型。添加模型只是登记文件,创建部署才启动推理容器。部署向导可选择自动发布;即便如此,也应在发布中心检查对外名称、绑定和状态。

外部服务流程从登记来源端点开始,无需添加模型文件或计算节点。两条流程都要发布路由,应用请求中的 model 使用对外模型名。网关会把它换为端点的上游模型名,按端点协议转发,再把响应中的模型名映射回来。租户可见性还受模型封禁和 Key 授权范围影响。

一个路由可以绑定多个端点,以优先级、权重和故障切换控制流量。端点和路由的存在并不保证上游持续健康;交付应用前,应使用目标 Key 请求 GET /v1/models 并发起一次与端点协议匹配的真实推理调用。