指标名 | 指标含义 |
总请求数 | 总请求数。按照所选择的时间粒度统计求和。 |
请求平均时延 | 请求平均时延。按照所选择的时间粒度统计求平均值。 |
请求最大时延 | 请求最大时延。按照所选择的时间粒度统计求最大值。 |
网关直接返回的请求数 | 网关未转发到后端,直接返回响应的请求量(如鉴权失败、触发限流时)。按照所选择的时间粒度统计求和。 |
网关平均时延 | 网关自身处理请求的平均耗时。 |
网关最大时延 | 网关自身处理请求的最大耗时。 |
2xx请求数 | 客户端发送到 AI 网关,请求成功的次数(如 200 OK),按照所选择的时间粒度统计求和。 |
3xx请求数 | 客户端发送到 AI 网关,请求重定向的次数,按照所选择的时间粒度统计求和。 |
4xx请求数 | 客户端发送到 AI 网关的是非法请求,如鉴权不通过或者超过限流值的错误个数,网关直接返回的客户端错误的个数(如 401 鉴权失败、403 权限不足、429 限流)。按照所选择的时间粒度统计求和。 |
5xx请求数 | AI 网关将消息转发到后端服务,后端服务返回的服务端错误的个数(如 500 后端异常、502 后端无效响应、504 后端不可达)。按照所选择的时间粒度统计求和。 |
403请求数 | 权限错误,后端有能力处理该请求,但是拒绝授权访问 |
404请求数 | 请求后端服务失败,请求所希望的资源未在后端服务器上发现,此类错误的个数的统计,按照所选择的时间粒度统计求和。 |
429请求数 | 请求后端服务失败,请求被限流,此类错误的个数的统计,按照所选择的时间粒度统计求和。 |
499请求数 | 请求后端服务失败,客户端在后端响应前主动断开连接,此类错误的个数的统计,按照所选择的时间粒度统计求和。 |
502请求数 | 网关尝试执行后端请求时,从后端服务器接收到无效的响应(通常连接服务失败),此类错误的个数的统计,按照所选择的时间粒度统计求和。 |
504请求数 | 网关尝试执行后端请求时,后端机器不可达,此类错误的个数的统计,按照所选择的时间粒度统计求和。 |
网关转到后端的请求数 | 网关成功转发到后端服务的请求量。按照所选择的时间粒度统计求和。 |
后端平均时延 | 后端服务处理请求的平均耗时。按照所选择的时间粒度统计求平均值。 |
后端最大时延 | 后端服务处理请求的最大耗时。按照所选择的时间粒度统计求最大值。 |
后端2xx请求数 | 后端服务请求成功的次数(如 200 OK),按照所选择的时间粒度统计求和。 |
后端3xx请求数 | 后端服务请求重定向的次数,按照所选择的时间粒度统计求和。 |
后端4xx请求数 | 后端服务是非法请求的次数。按照所选择的时间粒度统计求和。 |
后端5xx请求数 | 后端服务返回的服务端错误的个数(如 500 后端异常、502 后端无效响应、504 后端不可达)。按照所选择的时间粒度统计求和。 |
后端404请求数 | 后端服务资源未在后端服务器上发现,此类错误的个数的统计,按照所选择的时间粒度统计求和。 |
后端429请求数 | 后端服务请求失败,请求被限流,此类错误的个数的统计,按照所选择的时间粒度统计求和。 |
后端499请求数 | 后端服务请求失败,客户端在后端响应前主动断开连接,此类错误的个数的统计,按照所选择的时间粒度统计求和。 |
后端502请求数 | 后端服务请求失败,后端服务接收到无效的响应,此类错误的个数的统计,按照所选择的时间粒度统计求和。 |
后端504请求数 | 后端服务请求失败,后端机器不可达,此类错误的个数的统计,按照所选择的时间粒度统计求和。 |
指标名 | 指标含义 |
LLM HTTP 请求次数 | 网关向大模型供应商发起的 HTTP 调用次数。此指标直接反映模型 API 的调用频次。 |
LLM 总消耗 Token 数 | 网关消耗大模型供应商的总 Token 数,即输入(Prompt)与输出(Completion)的实际消耗 Token 数之和。用于评估消耗 Token 总数据吞吐量。 |
LLM prompt 消耗 token 数 | 大模型在处理请求时,模型实际所消耗的输入(Prompt)部分的总 Token 数。 |
LLM completion 消耗 token 数 | 大模型在生成回复时,模型实际所消耗的输出(Completion)部分的总 Token 数。此指标是评估模型调用成本的核心依据之一。 |
LLM 模型每次请求平均耗时(ms) | 从网关发送请求到模型提供商,到收到其完整响应的平均耗时。此指标反映模型提供商的端到端响应性能。 |
LLM 提供商平均每 token 耗时(ms) | 模型提供商平均消耗每个 Token 所花费的时间,此指标反映模型提供商 Token 的消耗速度。 |
指标名 | 指标含义 |
MCP 请求次数 | MCP 服务在所选时间范围内接收到的请求总数。此指标直接反映 MCP Server 的调用频次。 |
MCP 请求平均耗时(ms) | MCP 服务处理请求的平均耗时(毫秒)。此指标反映 MCP Server 的性能表现。 |
MCP 请求成功率(%) | MCP 服务调用成功的请求数占总请求数的百分比。此指标反映 MCP Server 的稳定性。 |
Was this page helpful?
You can also Contact sales or Submit a Ticket for help.
Help us improve! Rate your documentation experience in 5 mins.
Feedback