跳到主要内容

监控调用与排查请求

LLMPod 将平台整体状态、推理引擎指标、逐次请求和审计操作分开展示。先用控制台确定影响范围,再进入对应请求或服务日志。

你要了解管理员入口租户入口
集群、部署和上游整体状态总览大屏控制台中的本租户概览
调用量、成功率、延迟趋势仪表盘 → 调用统计数据与费用 → 调用统计
吞吐、KV 压力、实例与上游健康仪表盘 → 推理引擎无平台级视图
某次请求的 Token、费用、错误和重试审计和计费 → 计量计费调用统计 → 请求详情
管理操作记录审计和计费 → 审计日志管理 → 审计日志(仅本租户)

沿一条失败请求排查​

  1. 记录调用时间、对外模型名和请求 ID。在调用统计中按时间、状态、模型或 Key 缩小范围。
  2. 若有请求记录,打开详情,判断是选路失败(没有可用绑定端点)还是上游调用失败(连接、超时或上游响应)。Key、权限和用量限制等准入拒绝不会写调用日志;此时依据 HTTP 状态码和网关日志排查。
  3. 对照路由所绑定的端点及部署状态:本地模型看部署详情的阶段和容器日志;外部端点看地址、上游 Key 与连接情况。
  4. 再查看数据面和控制面日志。官方安装脚本部署的实例可从安装目录执行(默认 /opt/llmpod):
cd /opt/llmpod
docker compose --env-file .env logs --tail=200 proxyserver webserver

管理员“计量计费”当前主要是调用日志与费用明细;租户“费用中心”展示余额和流水。两者与管理员的审计日志用途不同。对外共享日志前,应移除 Key、密码和请求体中的敏感数据。

Anthropic Token Count 不产生账单或调用日志;当前 Embeddings 适配器也不写调用日志。不要把这些请求的日志缺席直接判断为网关未收到请求。

指标没有更新时​

安装脚本生成的 Compose 配置中,webserver 通过内部网络抓取 proxyserver 的指标端点。先确认两个容器健康,然后检查推理网关的 /health,再看服务日志中的抓取错误。若使用自定义分容器部署,需要按实际网络配置指标抓取地址;不要把 Compose 内部服务名直接用于外部网络。

相关操作:模型部署、发布与路由、常见问题。