本地部署大模型生产实战:2×RTX 4090 跑通 Qwen2.5 32B 完整记录 2026年8月19日 作者 IMAI 编辑部 2xRTX 4090足以支撑生产级大模型推理。本文记录Qwen2.5 32B + TensorRT-LLM的真实部署过程,包含量化策略、压测数据和运维监控方案,为本地部署团队提供可复用的工程参考。