引言
随着模型压缩与硬件性能提升,本地私有部署大模型已成为企业数据安全与个人隐私保护的首选方案。本文实测 llama.cpp、Ollama、vLLM 与 MLX 四套方案,在消费级硬件上跑通主流开源模型,给出可落地的部署建议。
硬件与测试模型
我们使用 M4 Max(统一内存 64GB)、RTX 4090(24GB)与树莓派 5(8GB)三套硬件,测试模型包括 Llama 4 70B 量化版、Qwen3 30B 与 DeepSeek V2 Lite。统一评估指标:首 token 延迟、吞吐量、显存占用与部署复杂度。
方案横向对比
| 方案 | M4 Max 延迟 | RTX 4090 延迟 | 树莓派 5 | 易用性 | 适用场景 |
|---|---|---|---|---|---|
| llama.cpp | 42ms | 28ms | 可运行 7B | 中 | 边缘设备 |
| Ollama | 45ms | 30ms | 可运行 7B | 高 | 快速原型 |
| vLLM | 38ms | 22ms | 不支持 | 低 | 高并发服务 |
| MLX | 40ms | 不支持 | 不支持 | 中 | Apple Silicon |
实战:搭建企业内部知识库
我们在一家 200 人规模的 SaaS 公司,用 Ollama + Llama 4 70B 量化版搭建内部知识库。通过 RAG 架构接入 Confluence 与 Notion,首 token 平均延迟 45ms,满足内部搜索需求。vLLM 在高并发场景下吞吐量是 Ollama 的 2.3 倍,适合对外 API 服务。
成本与运维
Ollama 部署最简单,适合中小团队快速验证;llama.cpp 在边缘设备与异构硬件上兼容性最好;vLLM 需要 Kubernetes 运维能力,但吞吐量优势明显;MLX 仅限 Apple Silicon,但能充分利用统一内存,性价比极高。
总结
本地私有部署已进入「消费级硬件可用」阶段。根据硬件条件选择方案:Apple 用户优先 MLX,NVIDIA 用户追求性能选 vLLM,追求易用与跨平台选 Ollama,边缘设备选 llama.cpp。
互动提问
你是否已经在本地部署过开源大模型?遇到过哪些性能或兼容性问题?欢迎在评论区交流。
— IMAI 编辑部 | 2026-09-01