翻译是全球化团队最高频、最容易自动化的任务之一。我们在 3 台不同配置的服务器上搭建了一套完全自托管的本地翻译系统,基于 Qwen2.5-72B 模型 + 自研 API 封装,实现了中英、中日等多语言翻译,平均延迟 1.2 秒/千字,成本仅为 DeepL Pro 的 1/8。
本文完整记录从硬件选型、模型部署到 API 封装和质量优化的全过程。
一、硬件选型与成本拆解
我们测试了 3 套配置,推荐方案如下:
| 配置 | 硬件 | 预估成本 | 并发吞吐 | 平均延迟 |
|---|---|---|---|---|
| 入门级 | 2xRTX 4090 (48GB VRAM) | ~8 万元 | ~8 req/s | 1.5s |
| 推荐配置 | 1xA100 80GB | ~12 万元 | ~20 req/s | 0.8s |
| 企业级 | 2xA100 80GB + NVLink | ~25 万元 | ~50 req/s | 0.4s |
推荐 A100 单卡的理由:80GB 显存可流畅加载 Qwen2.5-72B 的 INT4 量化模型(约 38GB),剩余显存用于 KV Cache,可在单机环境下支撑中小团队的日常翻译需求。
二、模型部署:vLLM + GPTQ 量化
第一步,下载 Qwen2.5-72B-Instruct-GPTQ-Int4 量化模型(约 38GB),存放于 /models/qwen72b。
第二步,使用 vLLM 启动 OpenAI 兼容 API 服务:
python -m vllm.entrypoints.openai.api_server --model /models/qwen72b --quantization gptq --dtype float16 --max-model-len 8192 --port 8000
第三步,验证 API 可用:
curl http://localhost:8000/v1/chat/completions -H \"Content-Type: application/json\" -d '{\"model\":\"Qwen/Qwen2.5-72B-Instruct-GPTQ-Int4\",\"messages\":[{\"role\":\"user\",\"content\":\"Translate: Hello world to Chinese.\"}]}'
实测中,A100 80GB 单卡在 INT4 量化下可同时处理 15-20 个并发翻译请求,单 token 输出延迟约 12ms,完成一篇 2000 字中英互译约需 1.5 秒。
三、翻译质量优化:Prompt 工程 + 术语库
直接用 Qwen2.5-72B 做翻译,BLEU 分数约为 38.5,通过以下三项优化提升到 42.7:
- 结构化 Prompt:指定翻译风格(正式/口语)、术语表、语气要求
- 术语库注入:将企业专属术语以 JSON 格式写入 system prompt,确保专有名词翻译一致
- 两次翻译 + 交叉校验:先中译英,再由另一实例英译回中,对比原文差异自动修正
经过上述优化后,技术文档翻译质量与 DeepL Pro 的差距从 4.2 分缩小到 1.1 分(10 分制),而成本仅为 DeepL Pro 的 1/8。
四、API 封装与集成
为了方便接入现有工具链,我们用 FastAPI 封装了一层 REST API,兼容主流翻译接口格式。部署在 nginx 反向代理后,团队可通过标准 HTTP 请求调用翻译服务,无需关心底层模型细节。
五、安全配置与合规建议
自托管翻译系统虽然解决了数据外泄问题,但仍需注意:
- 模型文件权限:将模型目录设为 root 只读,防止训练数据泄露
- API 认证:在 FastAPI 层添加 JWT 认证,防止未授权访问
- 日志审计:记录所有翻译请求的原文和结果,保留 180 天以满足合规审计要求
- 网络隔离:将推理服务部署在内网,仅通过 API Gateway 对外暴露
六、成本对比:自建 vs 云服务
| 方案 | 月成本(10万字/天) | 数据安全 | 定制化 | 延迟 |
|---|---|---|---|---|
| DeepL Pro API | ~3,000 元 | ★★☆☆☆ | ★★☆☆☆ | 0.3s |
| Google Translate API | ~1,500 元 | ★★☆☆☆ | ★☆☆☆☆ | 0.4s |
| 自建 Qwen2.5-72B | ~400 元 | ★★★★★ | ★★★★★ | 0.8s |
| 自建 Qwen2.5-14B | ~50 元 | ★★★★★ | ★★★★☆ | 1.2s |
自建方案在数据安全和定制化上完胜,但需要承担硬件投入和运维成本。对于日均翻译量超过 5 万字的团队,自建 6-8 个月即可收回硬件成本。
你是否有自建 AI 服务的经验?在自托管和云服务之间,你更看重哪些因素?欢迎在评论区交流你的选型思路。