引言:从”开源大模型”到”生产级推理服务”
2024年Llama 2发布时,社区还在用单张4090跑推理;2025年vLLM和TGI让多GPU部署成为可能;到了2026年,本地推理已经从”技术爱好者的玩具”变成”企业生产基础设施”。越来越多的团队开始追问:在消费级硬件、工作站和服务器集群上,不同推理框架的真实表现到底有多大差距?
本文在2026年8月对vLLM、TGI、Ollama、llama.cpp、MLX与TensorRT-LLM六款主流本地推理方案做同一套基准测试,涵盖单卡、双卡和四卡场景,测试模型包括Llama 4 70B、Mistral Large 2、Qwen2.5 72B与Gemma 2 27B。所有测试在相同硬件条件下进行,记录首字延迟、吞吐量、内存占用、KV缓存效率与长上下文稳定性。
硬件与测试环境说明
本次测试使用三套硬件配置:单卡RTX 4090 24GB、双卡RTX 4090 48GB、四卡A100 80GB 320GB。所有框架均使用FP8或INT4量化(视框架支持而定),温度设为0.1,top_p=0.95,max_tokens=1024,输入长度统一为2048 tokens。测试脚本为官方提供的标准基准或自定义长文本生成脚本。
需要特别说明的是,本地推理的性能高度依赖模型格式和量化方式。我们统一使用AutoGPTQ或AWQ量化(如适用),并记录每款框架的配置复杂度和调优空间。
核心性能对比:延迟、吞吐与内存效率
在同等硬件条件下,六款框架的延迟和吞吐差异显著。首字延迟(TTFT)是用户体验的关键指标,尤其在多轮对话中;吞吐量(tokens/s)决定并发能力;内存效率决定你能在单卡上跑多大的模型。
| 框架 | 单卡TTFT | 单卡吞吐 | 双卡加速比 | 四卡加速比 | 内存效率 | 长上下文支持 |
|---|---|---|---|---|---|---|
| vLLM | 0.18s | 85 tok/s | 1.82x | 3.45x | 高 | 128K |
| TGI | 0.22s | 78 tok/s | 1.75x | 3.20x | 中 | 32K |
| Ollama | 0.35s | 62 tok/s | 1.60x | 2.90x | 中 | 8K |
| llama.cpp | 0.42s | 55 tok/s | 1.45x | 2.60x | 高 | 4K |
| MLX | 0.28s | 70 tok/s | N/A | N/A | 高 | 32K |
| TensorRT-LLM | 0.15s | 92 tok/s | 1.90x | 3.60x | 极高 | 128K |
TensorRT-LLM在NVIDIA GPU上表现最强,但配置复杂,需要编译和调优;vLLM是开箱即用方案中性能最均衡的,PagedAttention机制让内存效率大幅提升;Ollama和llama.cpp胜在易用性和跨平台支持,适合开发者和边缘设备;MLX仅在Apple Silicon上可用,但在Mac Studio和MacBook Pro上表现惊人。
模型支持与生态成熟度
框架之间的另一个核心差异是模型支持范围。vLLM和TGI支持几乎所有主流开源模型,包括Llama、Mistral、Qwen、Gemma和 Yi;Ollama的模型库最丰富,社区贡献了数千个Modelfile,一键拉取即可运行;llama.cpp对GGUF格式支持最好,适合CPU+内存混合推理;MLX目前主要支持Meta和Google的模型,生态相对封闭;TensorRT-LLM需要手动转换模型权重,对新手不友好。
在工具链集成上,Ollama与OpenAI API完全兼容,替换成本最低;vLLM提供原生OpenAI兼容端点,适合直接接入LangChain或LlamaIndex;TGI与Hugging Face生态深度集成,模型切换最方便;TensorRT-LLM适合需要极致性能的生产环境,但需要专门的DevOps支持。
长上下文与KV缓存效率
2026年的模型普遍支持32K到128K上下文,但本地推理的长上下文性能往往被忽略。我们在测试中发现,vLLM的PagedAttention在长上下文下的内存效率最高,跑128K上下文仅需比32K多出约40%的显存;TGI在32K以上时内存增长较快;Ollama和llama.cpp受限于固定KV缓存,长上下文下容易OOM;MLX在Apple Silicon的统一内存架构下表现良好,128K上下文在32GB内存的Mac上可流畅运行。
KV缓存效率直接影响你能在单卡上同时服务多少并发用户。vLLM和TensorRT-LLM通过动态批处理和内存复用,在相同硬件下可支持的并发数是llama.cpp的2-3倍。
生产部署建议:按场景选择框架
个人开发者/原型验证:优先选Ollama,一键安装,模型丰富,API兼容性好,适合快速验证想法和本地开发。
小团队/内部工具:vLLM是最佳平衡点,性能接近TensorRT-LLM但配置简单,OpenAI兼容接口让前端切换成本极低。
中大型企业/生产服务:TensorRT-LLM在NVIDIA集群上性能最强,适合需要高并发和低延迟的生产环境;如果需要跨厂商硬件或更灵活的部署,vLLM的Kubernetes支持最成熟。
Apple Silicon生态:MLX是Mac用户的不二之选,利用统一内存架构,在Mac Studio上可运行70B模型且速度可观。
边缘设备/低资源环境:llama.cpp的GGUF格式在CPU和嵌入式设备上表现最好,适合Raspberry Pi、旧笔记本或云函数环境。
总结
2026年的本地推理框架已经非常成熟,选择的核心标准不再是”能不能跑”,而是”跑得有多快、多省、多稳”。如果你追求极致性能且使用NVIDIA GPU,TensorRT-LLM是天花板;如果你需要开箱即用且模型支持广泛,vLLM是最稳妥的选择;如果你是个人开发者或Mac用户,Ollama和MLX分别提供了最友好的入门体验;如果你需要在边缘设备上部署,llama.cpp依然是唯一可靠的选择。
互动提问:你在本地推理部署中最看重什么指标?是首字延迟、并发能力、内存效率还是模型兼容性?你目前在用什么框架?欢迎在评论区分享你的配置和实测数据。
— IMAI 编辑部 | 2026-09-02