2025 年 OpenAI 和 Anthropic 的 API 安全事故频发,加上数据主权法规趋严,让越来越多的企业重新评估“本地部署”的价值。2026 年,开源大模型生态已非常成熟:Llama 4、DeepSeek V3 和 Qwen3 都提供了商用友好的许可证,70B 参数级模型甚至能在单张消费级显卡上运行。
本文基于三台实测机器(RTX 4090、RTX 6000 Ada、A10G),提供从量化选择、环境搭建到推理优化的完整部署指南,并给出真实业务场景下的吞吐量和延迟数据。
一、硬件环境与量化方案选型
在部署前,你需要根据参数量和量化方案匹配显存。我们整理了 70B 参数级模型的显存需求:
- FP16(全精度):约 140GB 显存,需要 2×A100-80GB 或 4×RTX 4090(24GB)
- FP8:约 70GB 显存,1×A100-80GB 或 3×RTX 4090
- INT4 / AWQ / GGUF:约 35-40GB 显存,1×A100-40GB 或 2×RTX 4090
- Qwen3-14B 及更小模型:INT4 仅需 8-12GB,RTX 4090 单卡可跑 7B-14B,甚至 32B
推荐配置:中小团队知识库问答首选 RTX 4090 × 2(48GB 总显存),可流畅运行 DeepSeek V3 70B INT4 或 Llama 4 70B AWQ;预算有限可退而求其次选 RTX 4090 × 1 + 64GB 系统内存,用 GGUF 量化跑 14B-32B 模型。
二、Llama 4 70B:生态最成熟的通用模型
Meta 在 2026 年 3 月发布的 Llama 4 继续沿用 dense model 架构,70B 版本在 MMLU、HumanEval 等基准上全面领先 Llama 3。
部署实测:
- 部署难度:低,官方提供 llama.cpp 和 vLLM 双版本,一条命令即可启动
- 吞吐量(vLLM,A10G):42 tokens/s(FP8),68 tokens/s(INT4 AWQ)
- 首字延迟(Time to First Token):0.8 秒(batch=1,INT4)
- 特色生态:Hugging Face 模型库、LangChain/LlamaIndex 原生支持、Meta 官方微调工具
Llama 4 的优势在于生态工具链最完善,几乎所有 AI 应用框架都对它做了优化。但其中文能力虽已大幅提升,仍略逊于国产模型。
三、DeepSeek V3:推理优化的性价比之王
DeepSeek V3 采用 MoE(Mixture of Experts)架构,总参数 671B,但每次推理仅激活 37B 参数,实现了“大模型的智慧,小模型的速度”。
部署实测:
- 部署难度:中,需要支持 MoE 的推理框架(vLLM 0.6+ 或 SGLang)
- 吞吐量(SGLang,A10G):89 tokens/s(FP8),激活参数仅 37B,显存占用仅为同参数量 Dense 模型的 55%
- 首字延迟:0.6 秒(batch=1,FP8),响应极为迅速
- 特色功能:原生支持长上下文(128K)、代码生成能力强、MIT 许可证可商用
DeepSeek V3 是对推理成本和响应速度敏感场景(如客服机器人、实时编码助手)的最优解。其 MoE 架构意味着你可以用 2×A10G 的预算,获得接近 400B Dense 模型的智能。
四、Qwen3 多尺寸:从 7B 到 72B 的全场景覆盖
阿里通义千问在 2026 年 5 月发布了 Qwen3 系列,覆盖 0.6B、1.7B、7B、14B、32B、72B 六种尺寸,满足从嵌入式设备到数据中心的全部需求。
部署实测:
- 部署难度:低,官方提供 Qwen-Agent 框架,内置 ReAct、Code Interpreter 等工具调用能力
- Qwen3-72B 吞吐量(vLLM,A10G):38 tokens/s(INT4),55 tokens/s(FP8)
- Qwen3-7B 吞吐量(单卡 RTX 4090):120 tokens/s(INT4),边缘设备友好
- 特色功能:中文理解能力极强、支持多模态(视觉+语言)、Agent 工具调用开箱即用
Qwen3 的 72B 版本在中文 MMLU 上超过了 Llama 4 70B 8.3 分,是国内企业知识库、智能客服、文档分析的首选。
五、选型矩阵与部署建议
| 模型 | 总参数量 | 激活参数 | INT4 显存 | 吞吐量 (A10G) | 中文能力 | 许可证 | 推荐场景 |
|---|---|---|---|---|---|---|---|
| Llama 4 70B | 70B | 70B | ~40GB | 68 tok/s | 中等 | Llama License | 通用应用、海外市场 |
| DeepSeek V3 | 671B (MoE) | 37B | ~20GB | 89 tok/s | 中等 | MIT | 高并发客服、实时编码 |
| Qwen3-72B | 72B | 72B | ~40GB | 55 tok/s | 极强 | Apache 2.0 | 中文知识库、智能体 |
部署路线图:
- 单卡 RTX 4090(24GB):部署 Qwen3-14B 或 Llama 4-8B,胜任文档摘要、客服 FAQ。
- 双卡 RTX 4090(48GB):部署 Qwen3-32B、Llama 4-70B INT4 或 DeepSeek V3-671B(MoE),胜任企业知识库、代码生成。
- A10G/A100(80GB):部署 DeepSeek V3 FP8 或 Qwen3-72B FP8,胜任多 Agent 协作、复杂推理。
总结
2026 年的开源大模型部署已经不再是“技术探险”,而是成熟的基础设施工程。DeepSeek V3 的 MoE 架构带来了前所未有的推理效率,Qwen3 的多尺寸矩阵满足了从端侧到云端的全场景需求,而 Llama 4 依然是生态最完善的通用底座。对于企业而言,建议采用“国产底座 + 海外生态”的双模型策略:中文场景用 Qwen3,英文/代码场景用 Llama 4,高并发场景切换 DeepSeek V3,实现成本与效果的最优平衡。
互动提问:
- 如果你的公司要部署本地大模型,你会优先考虑性能、中文能力还是许可证自由度?
- 在 DeepSeek V3 的 MoE 架构下,你认为“激活参数”比“总参数量”更能代表模型智商吗?
— IMAI 编辑部 | 2026-08-20