推理框架怎么选?vLLM、SGLang、TensorRT-LLM 与 llama.cpp 全对比
五个主流推理框架的定位差异、性能特征与选型决策树,附生产环境的实测建议。
问题正文
五大框架的定位
vLLM 是通用生产环境的首选:PagedAttention、连续批处理、OpenAI 兼容接口一应俱全,社区活跃度最高。SGLang 在结构化输出与复杂调度上后来居上,RadixAttention 对多轮共享前缀的场景优化显著。TensorRT-LLM 是 NVIDIA 官方的极致性能路线,编译期优化激进但调试门槛高。llama.cpp 主打单机与端侧,Ollama 则是易用性外壳。
vLLM:生态最全、模型覆盖最广,适合绝大多数团队起步
SGLang:结构化输出、多轮共享前缀场景的性价比之王
TensorRT-LLM:算力成本敏感且团队有 NVIDIA 栈经验时上限最高
llama.cpp:单机、端侧、CPU 混合推理的唯一答案
Ollama:个人体验与内部试用,不适合生产并发
选型决策树
先问三个问题:并发量级多大?模型是否频繁更换?团队是否有 CUDA 调优能力?并发不高且模型常换,选 vLLM;长前缀与结构化输出为主,选 SGLang;算力成本占大头且模型固定,选 TensorRT-LLM;单机或边缘场景,选 llama.cpp。
迁移成本
主流框架都兼容 OpenAI 接口格式,应用层迁移成本很低。真正的成本在运维:监控指标、健康检查、模型热加载方式各不相同,建议用网关层屏蔽差异。
