仿真模型参考
本文说明 vllm-sr-sim 背后的数学模型、各模型假设、假设失效之处,以及如何按工作负载调参。
面向进阶用户与维护者。操作路径请先读 快速开始 与 容量规划场景。
1. GPU 迭代延迟模型
公式
每个 GPU profile 暴露迭代延迟函数:
iter_t(n_active, mean_seq_len) = W + H_eff × n_active
| 符号 | 含义 | 单位 |
|---|---|---|
W | 基础迭代成本:权重内存读、AllReduce、核启动 | 秒 |
H | 在 calibration_ctx 上测得的每序列开销 | s/seq |
H_eff | 按实际平均序列长度缩放后的有效每序列开销 | s/seq |
n_active | 当前 batch 中活跃序列数 | — |
mean_seq_len | 活跃序列的平均总 token(prompt + 输出) | tokens |
calibration_ctx | 测量 H 时的上下文长度(默认 8192) | tokens |
序列长度缩放:
H_eff = H × (mean_seq_len / calibration_ctx)
注意力计算成本随序列长度近似线性:O(n_active × seq_len × d_head)。池服务 800 token 的 LMSYS 请求时,H_eff 比服务 8192 token 上限时小约 10×。