近期多份公开大模型榜单几乎同时刷新。把 DataLearnerAI、LLMPodium、Arena AI(LMArena)、CocoLoop、infoAI 五份结果叠在一起看,会比盯着单一分数更接近真实格局:谁在综合能力上压阵,谁在对话、代码、Agent、多模态上冒尖,谁又在用性价比往前挤。

本文不做单一榜单复读,而是做交叉核对后的原创整理,方便选型时快速抓主线。

OpenAIGoogleDeepSeekKimiQwen智谱 GLMxAI GrokMiniMaxSeedance

品牌标识为站内示意图标,便于阅读识别;分数与名次均来自各榜单近期公开结果,实际以源站更新为准。

一、五份榜单交叉后的综合位置

先看“综合分”最常被引用的几份名单。名次会因权重不同而抖动,但前排面孔高度重合。

1. LLMPodium 综合 Podium Score

Anthropic ClaudeAnthropic Claude

LLMPodium 的前十几乎被 Claude 与 GPT 系列瓜分,Mythos / Fable 两条线分数尤为靠前:

  1. Claude Mythos Preview — 97.4
  2. Claude Fable 5 — 93.4
  3. Claude Fable 5.1 — 88.4
  4. GPT‑6 Astra — 86.2
  5. Kimi K3 — 83.3
  6. Claude Opus 5 — 81.4
  7. GPT‑5.6 Sol — 80.8
  8. Qwen3.8 Max — 79.8
  9. Claude Opus 4.8 — 76.0
  10. Claude Opus 4.6 Thinking — 75.0

2. DataLearnerAI 综合智能指数

OpenAIOpenAI

在 AA Intelligence Index 上,Claude Fable 5.1 多个版本长期落在 53–51 区间;GPT‑6 Astra(max / xhigh / high)同样卡在这一带。Claude Opus 5、Claude Fable 5 也稳定在 50 分以上,说明“综合智能”头部已经被两家旗舰锁住,波动更多来自版本切片,而不是突然换帅。

3. LMArena 文本对话 Elo

偏真实偏好的 Chatbot Arena 文本榜,前五仍是 Anthropic 系占优,同时出现新面孔:

  1. Claude Fable 5 (High) — Elo 1506
  2. Claude Opus 4.6 (High) — 1505
  3. Opus 4.7 (High) — 1502
  4. Muse Spark 1.2 — 1500
  5. Claude Fable 5.1 (Max) — 1498

对话体验上,Fable 5 高配版本几乎贴着 Opus 高配并跑,差距已经薄到“体感误差”级别。

4. CocoLoop 全球综合榜

OpenAI GPT OpenAI GPT

CocoLoop 的 Arena 分把 OpenAI 与 Claude 再次拉到同一桌:

  1. GPT‑5.6 Sol — 1558
  2. Claude Fable 5 — 1554
  3. Seedance 2.5 — 1554
  4. GPT‑5.6 Cyber — 1549
  5. MiniMax H3 — 1540
  6. HappyHorse 1.0 — 1534
  7. Claude Sonnet 5 — 1534
  8. Claude Opus 4.8 — 1530
  9. Seedance 2.0 — 1524
  10. Gemini Omni — 1519

Seedance Seedance

MiniMax MiniMax

Google Gemini Google Gemini

这份榜单的信息量在于:除了两家美厂旗舰,视频/生成向模型(Seedance)与国内选手(MiniMax)已经能稳定挤进前十。

5. infoAI 综合评分

Anthropic Anthropic

DeepSeek DeepSeek

xAI xAI

智谱 智谱

  1. Claude Opus 5 — 97.0
  2. DeepSeek V4 Pro — 96.4
  3. GPT‑5.6 Sol — 96.2
  4. Grok 4.6 — 95.6
  5. GPT‑5.6 Terra — 95.4
  6. GLM 5.3 — 95.4
  7. Claude Fable 5 — 95.0
  8. Kimi K3 — 93.4
  9. GPT‑5.6 Luna — 93.0
  10. GLM 5.3 Flash — 92.0

infoAI 把 DeepSeek、Grok、GLM、Kimi 一并抬进第一梯队,提醒读者:综合分并不等于“只有两家能打”。

二、按能力维度的“榜首画像”

把多榜冠军按任务切开,更容易对应真实工作流:

  • 综合智能:Claude Mythos Preview(LLMPodium)
  • 文本对话:Claude Fable 5 (High)(LMArena)
  • 数学推理:Grok 4 Heavy / Claude Mythos Preview(DataLearnerAI / LLMPodium)
  • 代码能力:Claude Fable 5.1 / DeepSeek V4.1 Flash(LLMPodium / DataLearnerAI)
  • Agent 能力:Claude Fable 5(DataLearnerAI)
  • 视觉理解:Claude Fable 5 (High)(LMArena)
  • 文生图:GPT Image 2.5 Sunburst(LMArena)
  • 文生视频:Gemini Omni 1.1 Flash(LMArena)

一句话概括:对话、Agent、视觉理解仍是 Anthropic 的舒适区;图像与工程向旗舰 OpenAI 依旧强硬;视频与部分多模态任务上,Google Gemini 更常站上桌。

三、当前格局:四条清晰主线

Anthropic Anthropic

1)整体能力天花板:Anthropic Claude 系列。 Mythos、Fable、Opus 三条产品线在综合智能、对话质量、推理、Agent、视觉等维度反复占坑,属于“多榜同时出现”的那种领先,而不是单榜偶然。

OpenAI OpenAI

2)通用旗舰双雄之一:OpenAI GPT‑6 / GPT‑5.6。 Astra 与 Sol 在综合榜与 Arena 分数上都站得住,工程、代码与生成类任务是其稳定加分项。

Moonshot Kimi Moonshot Kimi

DeepSeek DeepSeek

阿里 Qwen 阿里 Qwen

智谱 GLM 智谱 GLM

3)中国模型加速挤进前十: Kimi K3、DeepSeek V4 Pro、Qwen3.8 Max、GLM 5.3 已在多份名单进入前列。它们的卖点不只是分数,还有推理效率与性价比——对站长、开发者、批量调用场景往往更敏感。

Google Google

4)多模态赛道:Google Gemini 领跑感更强。 Gemini Omni / Flash 在视频、图像与 Agent 多模态任务上更常被点名,适合作为“跨模态工作流”的优先候选,而不是只看文本 Elo。

四、给选型的实用结论

当前全球大模型公开榜呈现相当一致的趋势:

  • Anthropic 与 OpenAI 继续占据综合能力的绝对前列;
  • 中国厂商 在前十席位与推理/性价比维度上快速追赶;
  • Google 在多模态(尤其视频相关)上更有辨识度。

若你在挑 API 或云上推理资源:先按任务切榜(对话 / 代码 / Agent / 视频),再回看综合分;同一厂商不同后缀(High、Max、Flash、Thinking)可能差一个体感档位。分数会变,任务匹配度更稳。

数据来源交叉整理自 DataLearnerAI、LLMPodium、Arena AI(LMArena)、CocoLoop、infoAI 等近期公开榜单。榜单口径不同,本文侧重“多榜一致”的结论,不替代各站原始排行页。