🌐 全球大模型能力排名榜单

2026年5月 · 综合 Intelligence Index · GPQA Diamond · 代码 · 推理
数据来源:Artificial Analysis · LLM Stats · Vellum AI


🟣 S 梯队 — 顶尖前沿

排名模型开发商综合指数GPQA开源擅长领域
🥇 1GPT-5.5 (xhigh)OpenAI6093%综合、代码、推理
🥈 2GPT-5.5 (high)OpenAI5992%综合、多模态
🥉 3Claude Opus 4.7(推理增强)Anthropic5792%推理、写作、代码
4Gemini 3.1 Pro PreviewGoogle5791%代码、多模态
5Claude Mythos PreviewAnthropic5695% ★推理全球第一

★ Claude Mythos Preview 的 GPQA Diamond 得分 95%,为当前全球最高。


🟢 A 梯队 — 强力竞争者

排名模型开发商综合指数GPQA开源擅长领域
6Grok 4xAI5589%综合、速度
7Kimi K2.6月之暗面5491%开源第一、推理
8GLM-5智谱AI5387%中文、代码
NEW 9DeepSeek V4-Pro深度求索5390.1%代码、性价比极高
10DeepSeek V3.2深度求索5286%开源、性价比

💡 DeepSeek V4-Pro:2026年4月24日发布,1.6T 参数 / 49B 激活,支持 100万 token 上下文,MIT 开源,定价仅 $3.48/M tokens,比 GPT-5.5 便宜约 8 倍


🟡 B 梯队 — 高效主力

排名模型开发商综合指数GPQA开源擅长领域
11Claude Sonnet 4.6Anthropic5184%效率、写作
12Gemini 3.1 FlashGoogle4982%速度、性价比
13GPT-5 (standard)OpenAI4881%综合
14DeepSeek V4-Flash深度求索4783%速度、极低成本
15GLM-4.7 Thinking智谱AI4783%开源代码
16Llama 4 MaverickMeta4678%开源多模态
17Qwen3-235B (MoE)阿里巴巴4579%中文开源

⚪ C 梯队 — 实用选择

排名模型开发商综合指数GPQA开源擅长领域
18DeepSeek R1深度求索4476%推理、开源
19Mistral Large 3Mistral4172%欧洲、开源
20GPT-4oOpenAI3867%多模态经典
21Llama 3.3 70BMeta3458%本地部署

📌 关键结论

维度最强模型
综合能力第一GPT-5.5 (xhigh) · 指数 60
推理能力第一Claude Mythos Preview · GPQA 95%
开源综合第一Kimi K2.6 · 指数 54
性价比之王DeepSeek V4-Pro · $3.48/M tokens
国产最强闭源GLM-5 · 指数 53
本地部署推荐Llama 3.3 70B / DeepSeek V4-Flash

说明: 综合指数基于 Artificial Analysis Intelligence Index,融合 GPQA Diamond(博士级推理)、SWE-Bench(代码)、AIME 2025(数学)、MMLU-Pro(知识)等多项基准。排名为预览版数据,仅供参考,实际表现因任务类型而异。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐