分享一个刚整理的榜单合集:6 个主流大模型评测榜,我把每家官方最新的头部数据都翻出来了,排个队给大家看个热闹。数据快照基本都在 2026 年 8 月中下旬,更新也算及时:LMArena 08-12 / AA 指数 08-06 / HLE 08-19 / LiveBench 06-25 / GPQA 08-14 / SWE 08-18。
先看六榜榜首
| 榜单 | 榜首 | 厂商 | 分数 |
|---|---|---|---|
| LMArena 综合 | Claude Fable 5 | Anthropic | Elo 1507 |
| AA 智能指数 | Claude Opus 5 | Anthropic | 63 |
| HLE 人类最后的考试 | Claude Fable 5 | Anthropic | 55.5% |
| LiveBench | Claude Fable 5 Max | Anthropic | 83.0 |
| GPQA Diamond | Gemini 3.7 Flash | 94.8% | |
| SWE-bench Verified | Claude Opus 5 | Anthropic | 96% |
六榜里 Anthropic 拿了五个第一,只剩 GPQA 被 Google 抢走——这轮的格局相当清晰。
LMArena:真人盲测偏好榜(节选 Top 20)
靠真实用户盲测投票跑出来的榜,最反映"人觉得谁好用"。Elo 归一化到 0-100:
| # | 模型 | Elo |
|---|---|---|
| 1 | claude-fable-5 | 100 |
| 2 | claude-opus-4-6-high | 99.7 |
| 3 | claude-opus-4-7-high | 99.2 |
| 4 | muse-spark-1.2 (xHigh) | 98.6 |
| 5 | claude-opus-4-6 | 98.3 |
| 6 | claude-opus-4-7 | 97.7 |
| 6 | claude-opus-5-high | 97.7 |
| 8 | claude-opus-5-max | 97.2 |
| 9 | qwen3.8-max | 97.1 |
| 10 | muse-spark-1.1 | 96.8 |
| 10 | kimi-k3-max | 96.8 |
| 12 | muse-spark | 96.6 |
| 13 | gemini-3.1-pro-preview | 96.3 |
| 14 | gemini-3-pro | 96.2 |
| 15 | gemini-3.6-flash-high | 96 |
| 16 | claude-opus-4-8-high | 95.5 |
| 16 | gpt-5.5-high | 95.5 |
| 18 | gpt-5.6-sol-xhigh | 95.4 |
| 19 | gemini-3.5-flash-high | 94.7 |
| 20 | gpt-5.5 | 94.6 |
头几名咬得很紧,Elo 差距都在个位数。
AA 智能指数:独立机构的能力标尺(节选 Top 15)
Artificial Analysis 用九个难任务加权合成 0-100 智能指数,比单看刷题靠谱。全表 265 个模型、257 个有分:
| # | 模型 | 指数 |
|---|---|---|
| 1 | Claude Opus 5 (max) | 63 |
| 1 | Claude Opus 5 (xhigh) | 63 |
| 3 | Claude Fable 5 (with fallback) | 62 |
| 4 | Claude Opus 5 (high) | 61 |
| 4 | GPT-5.6 Sol (max) | 61 |
| 4 | Grok 4.6 (high) | 61 |
| 7 | Kimi K3 (max) | 60 |
| 7 | GLM-5.3 (max) | 60 |
| 9 | GPT-5.6 Sol (xhigh) | 59 |
| 9 | Claude Opus 5 (medium) | 59 |
| 11 | Qwen3.8 Max | 58 |
| 11 | Qwen3.8 2.4T A95B | 58 |
| 13 | GPT-5.6 Sol (high) | 57 |
| 13 | Muse Spark 1.2 (xhigh) | 57 |
| 13 | GPT-5.6 Terra (max) | 57 |
Opus 5 拿到 63,上 6 字头的独一档。
HLE:人类最后的考试(31 个有成绩模型全列)
2500 道连人都难答的专家题,模型普遍翻车,中位数只有个位数。满分 100%:
| # | 模型 | 得分 |
|---|---|---|
| 1 | Claude Fable 5 (with fallback) | 55.5% |
| 2 | Claude Opus 5 (max) | 54.9% |
| 3 | Claude Opus 5 (xhigh) | 54.4% |
| 4 | Claude Opus 5 (high) | 52.8% |
| 5 | Claude Opus 5 (medium) | 51.3% |
| 6 | GPT-5.6 Sol (max) | 49.5% |
| 7 | Gemini 3.7 Flash (high) | 47.9% |
| 8 | Kimi K3 (max) | 46.9% |
| 9 | Muse Spark 1.2 (xhigh) | 45.5% |
| 10 | Qwen3.8 Max | 43% |
榜首 55.5%,离 60% 都还差得远。这榜确实是给 AI 泼冷水专用。
LiveBench:客观题综合(44 模型全列,节选 Top 15)
Abacus.AI 出品,每题都有标准答案,满分 100:
| # | 模型 | 综合分 |
|---|---|---|
| 1 | Claude Fable 5 Max Effort | 83.0 |
| 2 | GPT-5.6 Sol Max Effort | 81 |
| 3 | GPT-5.5 Thinking xHigh Effort | 80.2 |
| 4 | Claude 5 Opus Thinking Max Effort | 80.1 |
| 5 | Smaug-Agentic | 79.5 |
| 6 | Kimi K3 | 79.2 |
| 7 | Gemini 3.7 Flash High | 78.8 |
| 8 | Qwen 3.8 Max | 78.5 |
| 9 | Grok 4.6 | 78 |
| 10 | GPT-5.4 Thinking xHigh Effort | 78 |
| 11 | Muse Spark 1.2 xHigh Effort | 78 |
| 12 | GPT-5.6 Terra Max Effort | 77.9 |
| 13 | DeepSeek V4 Pro 0813 | 77.4 |
| 14 | Gemini 3.1 Pro Preview High | 77 |
| 15 | Claude 4.7 Opus Thinking xHigh Effort | 76.5 |
GPQA Diamond:榜首换人了(节选 Top 15)
研究生级别的自然科学题。我用 Epoch AI 官方 CSV 的 263 模型版本,注意这榜榜首被 Google 抢走了:
| # | 模型 | 得分 |
|---|---|---|
| 1 | gemini-3.7-flash high | 94.8% |
| 2 | gpt-5.4-pro-2026-03-05 xhigh | 94.6% |
| 3 | gemini-3.1-pro-preview high | 94.4% |
| 4 | gemini-3.6-flash high | 94.1% |
| 5 | grok-4.6 high | 94% |
| 5 | gpt-5.5-pre-release xhigh | 94% |
| 7 | gpt-5.5-pro-pre-release xhigh | 93.9% |
| 7 | claude-opus-5 max | 93.9% |
| 9 | gpt-5.6-sol max | 93.5% |
| 10 | grok-4.5 high | 93.4% |
94.8%,这榜头部已经接近刷满。
SWE-bench Verified:真实仓库修 bug(节选 Top 20)
让 AI 在真实 GitHub 仓库里修 bug,500 道验证过的题:
| # | 模型 | 解决率 |
|---|---|---|
| 1 | Claude Opus 5 | 96% |
| 2 | Claude Mythos 5 | 95.5% |
| 3 | Claude Fable 5 | 95% |
| 4 | Claude Opus 4.8 | 88.6% |
| 5 | Claude Opus 4.7 (Adaptive) | 87.6% |
| 6 | Claude Sonnet 5 | 85.2% |
| 7 | GPT-5.3 Codex | 85% |
| 8 | Ornith-1.0-397B | 82.4% |
| 9 | Claude Opus 4.5 | 80.9% |
| 10 | Claude Opus 4.6 | 80.8% |
| 11 | DeepSeek V4 Pro 0813 | 80.6% |
| 12 | MiniMax M3 | 80.5% |
| 13 | Qwen3.7 Max | 80.4% |
| 14 | Kimi K2.6 | 80.2% |
| 14 | Inkling-Small | 80.2% |
| 16 | GPT-5.2 | 80% |
| 17 | Claude Sonnet 4.6 | 79.6% |
| 18 | DeepSeek V4 Pro (High) | 79.4% |
| 19 | DeepSeek V4 Flash 0731 | 79% |
| 20 | Qwen3.6 Plus | 78.8% |
榜首 96%,前几名挤在 95-96%,基本到顶了。
几句总结
- Anthropic 五榜第一,只剩 GPQA 被 Google 抢走;OpenAI 的 GPT-5.6 系列紧咬第二梯队
- 开源模型头部(Qwen3.8、DeepSeek V4、GLM-5.3、Kimi K3)在各榜都能进前 30,性价比依然能打
- HLE 中位数极低,说明"考试式基准"对难推理题的区分度一直很强,短期还是别指望模型通考
- 榜单数值随发布随时变,看的时候注意快照日期,别拿旧数开杠
我没法预测未来涨跌,也不替任何一家站台。数据都来自各家官方或独立复评机构的公开榜单。想深挖的可以自己点开官网表格看全量。