跳到主要内容

添加模型

入口:管理员控制台 → 基础设施 → 模型管理 → 模型管理 → 添加模型。

添加模型用于登记模型来源和模型信息。完成这一步后,模型还没有启动,也没有可供 API 调用的对外名称;需要运行本地模型时,下一步是创建部署。接入已有推理服务则可直接在发布中心添加来源端点,无须先添加模型。

开始前​

准备模型的来源地址或完整文件目录。使用本地目录时,路径指的是 Manager 容器能读取的路径,不是浏览器所在电脑的路径。Compose 把宿主机 MODEL_HOST_DIR 映射到容器内 /data/models;例如宿主侧模型位于该挂载目录的 Qwen 子目录,控制台使用 /data/models/Qwen。

模型源适合的场景需要填写
HuggingFace模型已有仓库仓库 ID 或 URL;需要固定版本时填写 revision
本地文件 → 本机路径权重已在 Manager 挂载目录Manager 容器内可读的目录路径
本地文件 → 上传文件权重在操作电脑上在浏览器选择整个模型文件夹,包含权重与配置文件

当前控制台没有开放 OSS 来源选项;已有 OSS 模型记录可能仍会在列表中显示。

添加步骤​

添加模型向导的模型源步骤
从 Manager 本机路径添加模型
本地文件来源可以填写 Manager 容器可读的模型目录。
从浏览器上传模型文件夹
也可以选择完整模型文件夹,上传前先核对权重与配置文件。
  1. 在模型管理页签选择添加模型。向导第一步“模型源”中选择上表的一种方式。
  2. 选择上传时,检查文件清单是否包含权重、配置及分词器等模型所需文件。点击探测模型源后,控制台先校验清单、分片上传,再探测来源;本机路径或 HuggingFace 来源则直接探测。
  3. 在第二步“模型信息”核对模型名称、类别和量化方案。界面会展示探测出的权重大小,以及各推理引擎是否可部署的评估。模型类别有 LLM、Embedding、Rerank 等;出现在类别下拉框不代表所有引擎都支持部署。
  4. 确认信息并提交。返回列表,按名称查到模型记录,核对来源和类别。点击该行的新建部署可直接预选此模型。
模型探测结果与引擎可部署性评估
探测结果回填名称、类别、大小,并逐项显示推理引擎的可部署性。

图中的示例模型被识别为 safetensors:vLLM 与 SGLang 显示可部署,llama.cpp 因格式不匹配而不可部署。此结果只反映该模型和当前环境,其他模型应以自己的探测结果为准。

探测与部署的区别

探测 HuggingFace 来源主要用于读取文件信息和元数据,不代表此时已下载全部模型权重。即使向导允许保存一个带可部署性警告的模型,创建部署时仍需通过资源和引擎预检。

常见问题​

  • 上传前被拦截:检查选中的是否为完整文件夹,并按界面指出的缺失或不合规文件修正后重试。
  • 模型信息无法识别:核对仓库、revision 或 Manager 容器内路径是否正确且可读;必要时检查该来源的文件结构。
  • 引擎显示不可部署:先阅读评估原因,检查模型格式、类别和当前集群资源;这与“添加模型”提交成功是两个判断。
  • 删除模型失败:先检查是否仍有部署引用该模型。编辑模型可修改名称、类别和量化等信息,不能把来源地址当成可随意更换的字段。

下一步:模型部署;如果需要先理解对象关系,参见模型服务的组成。