技术与工程已解决
本地推理的 GPU 选型:从消费卡到数据中心卡
显存、带宽、生态与成本——本地推理硬件的四个决策维度。
问题正文
显存是第一决策
跑什么规模的模型决定显存底线:7B 量化 6GB、14B 量化 12GB、32B 量化 24GB、70B 量化 48GB。显存不够,算力再强也白搭。
带宽决定速度
推理速度的上限主要由显存带宽决定(每生成一个 Token 都要读全部权重)。消费卡与数据中心卡的带宽差距由此带来速度差距。
生态与驱动
NVIDIA 的 CUDA 生态无可替代;AMD 的 ROCm 在进步但坑仍多;Apple Silicon 统一内存适合单机大模型但并发能力弱。
