近期多份公开大模型榜单几乎同时刷新。把 DataLearnerAI、LLMPodium、Arena AI(LMArena)、CocoLoop、infoAI 五份结果叠在一起看,会比盯着单一分数更接近真实格局:谁在综合能力上压阵,谁在对话、代码、Agent、多模态上冒尖,谁又在用性价比往前挤。
本文不做单一榜单复读,而是做交叉核对后的原创整理,方便选型时快速抓主线。
品牌标识为站内示意图标,便于阅读识别;分数与名次均来自各榜单近期公开结果,实际以源站更新为准。
一、五份榜单交叉后的综合位置
先看“综合分”最常被引用的几份名单。名次会因权重不同而抖动,但前排面孔高度重合。
1. LLMPodium 综合 Podium Score
Anthropic Claude
LLMPodium 的前十几乎被 Claude 与 GPT 系列瓜分,Mythos / Fable 两条线分数尤为靠前:
- Claude Mythos Preview — 97.4
- Claude Fable 5 — 93.4
- Claude Fable 5.1 — 88.4
- GPT‑6 Astra — 86.2
- Kimi K3 — 83.3
- Claude Opus 5 — 81.4
- GPT‑5.6 Sol — 80.8
- Qwen3.8 Max — 79.8
- Claude Opus 4.8 — 76.0
- Claude Opus 4.6 Thinking — 75.0
2. DataLearnerAI 综合智能指数
OpenAI
在 AA Intelligence Index 上,Claude Fable 5.1 多个版本长期落在 53–51 区间;GPT‑6 Astra(max / xhigh / high)同样卡在这一带。Claude Opus 5、Claude Fable 5 也稳定在 50 分以上,说明“综合智能”头部已经被两家旗舰锁住,波动更多来自版本切片,而不是突然换帅。
3. LMArena 文本对话 Elo
偏真实偏好的 Chatbot Arena 文本榜,前五仍是 Anthropic 系占优,同时出现新面孔:
- Claude Fable 5 (High) — Elo 1506
- Claude Opus 4.6 (High) — 1505
- Opus 4.7 (High) — 1502
- Muse Spark 1.2 — 1500
- Claude Fable 5.1 (Max) — 1498
对话体验上,Fable 5 高配版本几乎贴着 Opus 高配并跑,差距已经薄到“体感误差”级别。
4. CocoLoop 全球综合榜
OpenAI GPT
CocoLoop 的 Arena 分把 OpenAI 与 Claude 再次拉到同一桌:
- GPT‑5.6 Sol — 1558
- Claude Fable 5 — 1554
- Seedance 2.5 — 1554
- GPT‑5.6 Cyber — 1549
- MiniMax H3 — 1540
- HappyHorse 1.0 — 1534
- Claude Sonnet 5 — 1534
- Claude Opus 4.8 — 1530
- Seedance 2.0 — 1524
- Gemini Omni — 1519
Seedance
MiniMax
Google Gemini
这份榜单的信息量在于:除了两家美厂旗舰,视频/生成向模型(Seedance)与国内选手(MiniMax)已经能稳定挤进前十。
5. infoAI 综合评分
Anthropic
DeepSeek
xAI
智谱
- Claude Opus 5 — 97.0
- DeepSeek V4 Pro — 96.4
- GPT‑5.6 Sol — 96.2
- Grok 4.6 — 95.6
- GPT‑5.6 Terra — 95.4
- GLM 5.3 — 95.4
- Claude Fable 5 — 95.0
- Kimi K3 — 93.4
- GPT‑5.6 Luna — 93.0
- GLM 5.3 Flash — 92.0
infoAI 把 DeepSeek、Grok、GLM、Kimi 一并抬进第一梯队,提醒读者:综合分并不等于“只有两家能打”。
二、按能力维度的“榜首画像”
把多榜冠军按任务切开,更容易对应真实工作流:
- 综合智能:Claude Mythos Preview(LLMPodium)
- 文本对话:Claude Fable 5 (High)(LMArena)
- 数学推理:Grok 4 Heavy / Claude Mythos Preview(DataLearnerAI / LLMPodium)
- 代码能力:Claude Fable 5.1 / DeepSeek V4.1 Flash(LLMPodium / DataLearnerAI)
- Agent 能力:Claude Fable 5(DataLearnerAI)
- 视觉理解:Claude Fable 5 (High)(LMArena)
- 文生图:GPT Image 2.5 Sunburst(LMArena)
- 文生视频:Gemini Omni 1.1 Flash(LMArena)
一句话概括:对话、Agent、视觉理解仍是 Anthropic 的舒适区;图像与工程向旗舰 OpenAI 依旧强硬;视频与部分多模态任务上,Google Gemini 更常站上桌。
三、当前格局:四条清晰主线
Anthropic
1)整体能力天花板:Anthropic Claude 系列。 Mythos、Fable、Opus 三条产品线在综合智能、对话质量、推理、Agent、视觉等维度反复占坑,属于“多榜同时出现”的那种领先,而不是单榜偶然。
OpenAI
2)通用旗舰双雄之一:OpenAI GPT‑6 / GPT‑5.6。 Astra 与 Sol 在综合榜与 Arena 分数上都站得住,工程、代码与生成类任务是其稳定加分项。
Moonshot Kimi
DeepSeek
阿里 Qwen
智谱 GLM
3)中国模型加速挤进前十: Kimi K3、DeepSeek V4 Pro、Qwen3.8 Max、GLM 5.3 已在多份名单进入前列。它们的卖点不只是分数,还有推理效率与性价比——对站长、开发者、批量调用场景往往更敏感。
Google
4)多模态赛道:Google Gemini 领跑感更强。 Gemini Omni / Flash 在视频、图像与 Agent 多模态任务上更常被点名,适合作为“跨模态工作流”的优先候选,而不是只看文本 Elo。
四、给选型的实用结论
当前全球大模型公开榜呈现相当一致的趋势:
- Anthropic 与 OpenAI 继续占据综合能力的绝对前列;
- 中国厂商 在前十席位与推理/性价比维度上快速追赶;
- Google 在多模态(尤其视频相关)上更有辨识度。
若你在挑 API 或云上推理资源:先按任务切榜(对话 / 代码 / Agent / 视频),再回看综合分;同一厂商不同后缀(High、Max、Flash、Thinking)可能差一个体感档位。分数会变,任务匹配度更稳。
数据来源交叉整理自 DataLearnerAI、LLMPodium、Arena AI(LMArena)、CocoLoop、infoAI 等近期公开榜单。榜单口径不同,本文侧重“多榜一致”的结论,不替代各站原始排行页。