27B推理服务SERVICE STATUS
V100
LIVE OBSERVABILITY

Qwen3.8-27B

请求、吞吐与缓存,一眼掌握。

正在连接
等待第一个样本 · 每 5 秒更新
处理中
个请求
包含 prefill 与 decode
排队中
个请求
等待调度的请求
当前生成吞吐
token/s
所有请求合计 · 最近 10 秒
已完成请求
自本轮模型服务启动以来
不含取消与错误

吞吐趋势

最近 15 分钟 / token/s

生成 tokentoken/s10 秒滚动平均
正在积累实时数据
生成吞吐按已输出 token 统计,包含所有并发请求。

KV Cache

GPU 活跃页与 CPU 前缀池

GPU 活跃占用
每卡预留 — GiB— 个块
CPU 前缀缓存
— / — GiB— 个快照
GPU 累计命中率
CPU 累计命中率

GPU 占用不含可回收的空闲前缀页,归零不代表历史缓存消失。CPU 容量为全机合计。

运行概况

服务运行时间 —
CPU 缓存淘汰
CPU 导出跳过
请求抢占
取消 / 错误— / —
已导出到 CPU
已从 CPU 恢复
指标怎么看?

生成吞吐是最近约 10 秒的总输出速率,采样刚开始时会先积累数据。无请求时通常为 0。

输入吞吐仅统计实际计算的输入 token,不包含 GPU/CPU 缓存命中。这版服务在 prefill 完成时记账,因此长 prefill 期间可能暂为 0、完成时出现峰值;它不是每一刻的 GPU 计算速度。

缓存命中率按 token 计,自本轮模型服务启动起累计。GPU 与 CPU 的查询范围不同,不能相加;无查询时显示「—」。CPU 池含待导出的快照,GPU/CPU 中可存在同一前缀的副本。

趋势保存在状态服务的内存中,最多 15 分钟;服务重启或采样失败会留下断点。页面仅展示汇总指标,不展示请求内容。