技术与工程已解决
vLLM 的关键参数调优
显存利用率、最大批大小、调度策略——vLLM 生产部署的参数清单。
问题正文
GPU 显存利用率
gpu-memory-utilization 控制单实例能用的显存比例,默认 0.9。留太少浪费算力,留太多会在与其他进程共卡时溢出。
最大序列长度
max-model-len 决定支持的上下文上限,直接决定 KV Cache 的显存预留。按业务真实需要的最大长度设置,不要默认最大。
调度相关
max-num-seqs(并发批大小)与 max-num-batched-tokens(批内 Token 上限)共同决定吞吐与延迟的平衡。
