处理中
—个请求
包含 prefill 与 decode
请求、吞吐与缓存,一眼掌握。
最近 15 分钟 / token/s
GPU 活跃页与 CPU 前缀池
GPU 占用不含可回收的空闲前缀页,归零不代表历史缓存消失。CPU 容量为全机合计。
生成吞吐是最近约 10 秒的总输出速率,采样刚开始时会先积累数据。无请求时通常为 0。
输入吞吐仅统计实际计算的输入 token,不包含 GPU/CPU 缓存命中。这版服务在 prefill 完成时记账,因此长 prefill 期间可能暂为 0、完成时出现峰值;它不是每一刻的 GPU 计算速度。
缓存命中率按 token 计,自本轮模型服务启动起累计。GPU 与 CPU 的查询范围不同,不能相加;无查询时显示「—」。CPU 池含待导出的快照,GPU/CPU 中可存在同一前缀的副本。
趋势保存在状态服务的内存中,最多 15 分钟;服务重启或采样失败会留下断点。页面仅展示汇总指标,不展示请求内容。