2026 年上半年,Claude Opus 4、GPT-5、Gemini 2.5 Pro 相继发布,三者都声称在推理、代码、多模态上取得突破。到底谁更强?我们设计了一套 120 题的标准化测试,覆盖代码生成、逻辑推理、数学证明、长文本理解、多模态分析五个维度。
1. 测试方法与基准说明
测试包含 120 道题,每题独立评分,满分 5 分。测试环境为各自官方 API 默认参数,温度设为 0。代码题采用 HumanEval+ 与 MBPP 扩展;推理题采用 GSM8K 与 MATH 竞赛题;多模态使用 ChartQA、TextVQA、MMMU。
| 维度 | Claude Opus 4 | GPT-5 | Gemini 2.5 Pro |
|---|---|---|---|
| 代码生成 (HumanEval+) | 92.1% | 94.3% | 90.7% |
| 数学推理 (MATH) | 88.4% | 91.2% | 86.5% |
| 长文本理解 (128k) | 94.8% | 96.1% | 97.3% |
| 多模态 (MMMU) | 72.3% | 75.6% | 78.1% |
| 综合平均分 | 86.9 | 89.3 | 88.2 |
2. 代码与推理能力实测
GPT-5 在复杂算法题上表现最强,尤其擅长递归与动态规划;Claude Opus 4 在代码可读性与风格一致性上胜出,生成的注释更专业;Gemini 在数学证明上进步明显,但在边界条件处理上偶有疏漏。
3. 多模态与长上下文处理
Gemini 2.5 Pro 凭借原生多模态架构,在图像理解上以 78.1% 领先;GPT-5 在长文本检索任务中准确率最高,128k 上下文下几乎无信息丢失;Claude Opus 4 在 200k 上下文测试中表现稳定,适合处理整本电子书级别的任务。
4. 速度与成本对比
GPT-5 首 token 延迟约 280ms,Claude Opus 4 约 340ms,Gemini 2.5 Pro 约 220ms。成本上,Gemini 2.5 Pro 输入 $2/M tokens,输出 $6/M tokens,性价比最高;GPT-5 输入 $5/M,Claude Opus 4 输入 $15/M。
5. 结论与场景推荐
综合来看,GPT-5 是当前综合能力最强的模型,尤其在代码与推理上领先;Gemini 2.5 Pro 在长文本和多模态上性价比突出;Claude Opus 4 在长上下文与写作质量上保持优势。建议按场景选用,而非盲目追求单一模型。
互动提问:你目前在主要使用哪款大模型?哪项能力最让你满意或失望?
互动提问:你认为 2026 年下半年会出现颠覆性更强的模型吗?最期待什么方向?
— IMAI 编辑部 | 2026-09-29