技术与工程已解决
大模型应用的压力测试怎么做?
Token 维度的压测指标、流量建模与长尾延迟,与传统接口压测的差异。
问题正文
与传统压测的差异
传统接口压测看 QPS 与响应时间;大模型调用还要看 Token 吞吐、首 Token 延迟、并发下的限流触发率。响应时间分布与输入输出长度强相关,单一数值没有意义。
流量建模
从真实日志提取三个分布:输入长度分布、输出长度分布、请求时间分布。压测流量越接近真实形态,结论越可信。没有历史数据时按业务预估建模,并标注假设。
首 Token 延迟(体验起点)
Token 生成速率(体感速度)
P95 与 P99 延迟(长尾表现)
限流触发率与重试成功率
错误类型分布
