链世界
网站首页
网站导航
文章列表
AI 模型榜
实用工具
像素广场
设置
联系我们RSS友情链接提交网站
隐私政策·免责声明
陕ICP备2025083618号-2

热门频道

AI 工具开发工具效率工具娱乐影音招聘求职
导航文章工具
返回首页

AI 模型排行榜 · 链世界

按对话、图像、视频三类展示主流模型的综合分与扩展指标,支持切换排序维度。排名由站点运营维护,仅供参考。

排名模型厂商
综合分运营维护的综合排名分,越高越靠前
上下文 (K)上下文窗口长度(千 tokens)
输入价输入 tokens 单价(美元/百万 tokens)
输出价输出 tokens 单价(美元/百万 tokens)
MMLU大规模多任务语言理解基准准确率(%),越高越好
HumanEval代码生成能力评测 HumanEval(%),越高越好
Elo竞技场人类偏好对战 Elo 分,越高表示实战表现越强
1
G
GPT-5.5
OpenAI 最新旗舰模型,1050K 超长上下文,AI 推理和编程能力业界领先
OpenAI98.0105053091.5091.401420
2
C
Claude Fable 5
Anthropic 最强模型,定位高于 Opus 层级。Mythos 级别公开版,1M 上下文,SWE-Bench 等多项基准超越 Opus 4.8 超过 10%。支持自适应思维模式。
Anthropic97.010001050———
3
G
Gemini 3.5 Pro
Google DeepMind 旗舰模型,1000K 上下文窗口,综合能力强
Google DeepMind96.010001.5099189.501400
4
G
GPT-5.6 Sol
OpenAI 新旗舰模型,三款中的最强版本。在 HealthBench Professional 得分 60.5%,网络安全和生物风险评估均为 High 级别。API 新增 Fast mode:比 Standard 快 2.5 倍、价格 2 倍、智能不变(2026-07-30)。
OpenAI96.010505300—0
5
G
Grok 4.6
xAI 旗舰模型,2026-08-12 发布(对外以 SpaceXAI 名义运营)。AA Intelligence Index 61 分,与 GPT-5.6 Sol 持平,仅次于 Claude Opus 5 / Fable 5。强项在 agent 场景:GDPval-AA v2 Elo 1753(仅次 Opus 5)、Terminal-Bench v2.1 88.4%、τ³-Banking 50.7%。定价 $2/$6,500K 上下文,每任务成本约 $0.84,与 Kimi K3 相当。
xAI95.0500260—1753
6
C
Claude Opus 4.8
Anthropic 最新旗舰推理模型
Anthropic95.010005250—0
7
C
Claude Opus 5
Anthropic 最新 Opus 旗舰,接近 Fable 5 前沿智能(差异 <0.5%),定价 $5/$25 每百万 token,2026-07-25 发布后即登顶 AA 智能榜 #1
Anthropic94.0100052589.20—1320
8
K
Kimi K3
月之暗面最新旗舰模型,2.8T 参数 MoE(激活 16/896 专家),1M 上下文,原生视觉能力。AA 智能指数 #4,性能仅次于 Fable 5 和 GPT-5.6 Sol。开源权重将于 7 月 27 日发布。
月之暗面 / Moonshot AI94.01049315———
9
G
GPT-5.6 Terra
GPT-5.6 系列均衡版本,日常工作的主力选择。2026-07-30 起 API 降价 20%($2.00/M 输入、$12.00/M 输出),缓存输入 $0.20/M。
OpenAI93.510502120—0
10
G
Gemini 3.7 Flash
谷歌 2026-08-13 发布的 Flash 系列全能模型,主打编码与 Agent 场景,年底前定价为 3.6 Flash 原始价的一半($0.75/$3.75 每百万 token)。FrontierCode 1.1 43.6%,DeepSWE v1.1 65.3%。
Google DeepMind93.000.753.750—0
11
C
Claude Opus 4.7
Anthropic 高端推理模型,1000K 上下文,面向复杂任务和企业级应用
Anthropic93.010005259192.501400
12
C
Claude Opus 5 Fast
Claude Opus 5 的 Fast 模式变体,能力与 Opus 5 相同,运行速度约 2.5 倍,定价为基础版 2 倍($10/$50 每百万 token),1M 上下文,适合对延迟敏感的长任务 Agent 场景
Anthropic92.01000105089.20—1320
13
G
Gemini 3.6 Flash
Google 最新的 Gemini Flash 系列旗舰,面向编程、知识工作和多模态任务。输出 token 用量减少 17%,DeepSWE 49%,OSWorld-Verified 83.0%。API 输入 $1.50/输出 $7.50。
Google DeepMind92.010491.507.500—0
14
M
Muse Spark 1.1
Meta 旗舰多模态推理模型,百万 token 上下文,支持 Agent 任务、编码、计算机操作
Meta92.010241.254.250—0
15
C
Claude Sonnet 5
Anthropic Claude 系列中端模型,性能与成本的平衡之选
Anthropic92.01000210——1312
16
G
GLM-5.2
开源推理模型新标杆,MIT 许可,AA Intelligence Index 51 分位居开源模型榜首。MoE 架构 753B 总参数/40B 活跃参数,1M 上下文。GDPval-AA v2 得分 1524,与 GPT-5.5(1514)持平。科学推理能力突出:GPQA Diamond 89%,HLE 40%。
智谱AI / Z.ai91.010001.404.40———
17
S
Sakana Fugu Ultra
Fugu Ultra 是 Sakana AI 的旗舰多智能体编排模型,通过自主调用专家模型池处理复杂多步任务,基准测试媲美 Fable 5 与 Mythos Preview。1M 上下文窗口,支持多模态输入。
Sakana AI91.01000530———
18
G
GPT-5.6 Luna
GPT-5.6 系列最快速、最低价版本。2026-07-30 起 API 降价 80%($0.20/M 输入、$1.20/M 输出),性能接近一年前旗舰级模型,成本约为其 6%。支持工具调用与多步工作流。
OpenAI91.010500.201.200—0
19
Q
Qwen3.8 Max
阿里 Qwen 系列最新旗舰,2.4T 参数(95B 激活)MoE,主打编程与智能体协同(cowork)长任务,API 版支持 1M 上下文与多模态。2026-08-13 开源权重 Qwen3.8-2.4T-A95B 上架 Hugging Face(BF16/FP8),为史上最大开源权重模型;开源版纯文本、强制思考,原生上下文 262K。PaperBench 93.0 全场最高。API 定价 $2/$6(隐式缓存 $0.25)。
Alibaba (Qwen)90.01000260—0
20
C
Claude Opus 4.6
Anthropic 1M 上下文推理模型,标准版 $5/$25,快速版 $30/$150
Anthropic90.010005250—0
21
G
GPT-5.4 Pro
OpenAI最强推理模型,1M+上下文,已解决前沿数学难题(Ramsey超图、Erdős问题)
OpenAI90.0105030180———
22
G
Gemini 3.5 Flash
Google 轻量级旗舰模型,支持 Computer Use 屏幕操控、函数调用、Search/Maps Grounding,适合 Agent 场景
Google DeepMind90.010491.50992.3086.801370
23
G
GPT-5.5 Instant
GPT-5.5 低延迟版,快速响应适合对话场景
OpenAI88.09220.75389.5088.201350
24
D
DeepSeek V4 Flash
DeepSeek-V4-Flash-0731 正式版(2026-07-31):MoE 架构 284B 总参数/13B 活跃,1M 上下文、384K 最大输出。agent 能力大幅升级,Terminal Bench 2.1 82.7、Toolathlon 70.3、Cybergym 76.7、DeepSWE 54.4,均远超 V4-Pro-Preview。ARC Prize 验证成绩(2026-08-07):ARC-AGI-1 89.0%、ARC-AGI-2 61.4%(max effort,每任务 $0.02/$0.04)。原生支持 Responses API 并适配 Codex。定价输入 $0.14/M、输出 $0.28/M,极致性价比。
DeepSeek (深度求索)88.010490.220.660—0
25
V
VibeThinker-3B
3B参数稠密推理模型,AIME26得分94.3,基于Qwen2.5,采用Spectrum-to-Signal后训练范式。不支持工具调用,专注数学和代码推理。
Weibo AI88.032—————
26
D
DeepSeek V4 Pro
DeepSeek 旗舰推理模型,2026-08-13 正式版 deepseek-v4-pro-0813 上线(替代 V4-Pro-Preview)。1M 上下文,最大输出 384K,定价 $0.435/$0.87。agent 能力大幅提升:Terminal Bench 2.1 87.9、DeepSWE 62.7、Cybergym 83.3(预览版分别为 72.1/12.8/52.7),多项超 GLM-5.2、与 Kimi K3 / Opus 4.8 同档。原生支持 Responses API(适配 Codex)。
DeepSeek (深度求索)87.010490.661.98———
27
K
Kimi K2.7 Code
1T MoE 编程专用模型,256K 上下文,Modified MIT 开源,推理 token 消耗降低 30%
月之暗面 / Moonshot AI85.02560.743.50———
28
Q
Qwen3.7 Max
阿里 Qwen 系列最强模型,1000K 上下文,MoE 架构
Alibaba (Qwen)85.010001.253.7587871300
29
G
Gemini 3.1 Pro
Google DeepMind 前代旗舰模型,1049K 上下文
Google DeepMind85.0104921287.50851300
30
G
Grok 4.5
xAI 最新编码与智能体模型,基于 1.5T V9 基座,500K 上下文,定价 $2/$6/M,编程能力对标 GPT-5.5
xAI83.0500260—0
31
G
Grok 4.20 Multi-Agent
xAI 多智能体推理模型,基于 Grok 4.20 构建,支持多 Agent 协作编排,2M 上下文,适合复杂任务分解与并行执行
xAI82.020001.252.5086851275
32
C
Cursor Composer 2.5
Cursor AI IDE 内置 Agent 编程模式,256K 上下文
Cursor82.02560085861260
33
K
Kimi K2.6
月之暗面 Kimi 最新模型,262K 上下文,Agent 能力突出
月之暗面 / Moonshot AI82.02620.683.4285.5084.501280
34
G
GPT-5.4
OpenAI GPT-5.4 旗舰模型,1050K 上下文
OpenAI82.010502.501588.2087.501320
35
G
Grok 4.20
xAI推理模型,2M上下文,最低幻觉率,支持Agent工具调用
xAI81.020001.252.50———
36
C
Claude Sonnet 4.6
Anthropic Claude Sonnet 系列,中高端推理模型
Anthropic80.0100031586.50881280
37
M
MiniMax M3
首个开源权重模型同时具备前沿编码、1M 上下文和原生多模态能力。MSA 稀疏注意力架构,SWE-Bench Pro 59.0%,TerminalBench 66.0%。定价极具竞争力。
MiniMax (稀宇科技)80.010000.301.20———
38
W
Windsurf SWE-1.6
Windsurf 全栈 AI 编程助手,200K 上下文
Windsurf (Codeium)80.020000000
39
G
Grok 4.3
xAI Grok 最新旗舰,1000K 上下文
xAI80.010001.252.5086851270
40
M
MiMo-V2.5 Pro
小米 MiMo-V2.5 Pro 端侧大模型
Xiaomi78.010000.440.8885841260
41
Q
Qwen3.8-27B
Qwen3.8 系列开源模型(2026-08-14 发布,Apache 2.0):27B 稠密多模态模型,原生图像/视频理解,262K 原生上下文(YaRN 可扩 1M),Gated DeltaNet 混合架构,思考模式默认开启且可按请求关闭。SWE-bench Pro 61.7、QwenSWEBench 79.0、DeepSWE 1.1 42.2、LiveCodeBench v6 90.3、OSWorld 84.3,多项编码与 Agent 基准超过 Claude Opus 4.6 Max。消费级硬件可本地运行(4090 上 q4km 约 48 tps)。
Alibaba (Qwen)78.0262000—0
42
L
LongCat-2.0
美团推出的1.6万亿总参MoE大模型,48B激活参数,国产AI ASIC芯片训练,支持1M上下文,MIT开源协议
Meituan (美团)78.0104900———
43
M
Muse Glimmer
Meta Superintelligence Labs 开源的 30B 端侧智能体模型,Apache 2.0,从 Muse Spark 蒸馏,4-bit 量化后不足 20GB,单张消费级 GPU 本地运行,支持多模态输入与工具调用。
Meta (Superintelligence Labs)78.0128000—0
44
Q
Qwen3.6 Plus
阿里 Qwen3.6 Plus 中高端模型,1000K 上下文
Alibaba (Qwen)76.010000.331.9584841250
45
G
GPT-4o
OpenAI GPT-4o 多模态模型,128K 上下文
OpenAI75.01282.501088.7090.201287
46
G
Gemini 3.5 Flash-Lite
Google 最快的 3.5 系列模型,350 tokens/s,面向代理搜索和文档处理等低延迟高吞吐任务。定价 $0.30/$2.50。SWE-Bench Pro 54.2%,OSWorld 74.0%。1M 上下文。
Google DeepMind75.010000.302.500—0
47
Q
Qwen3.7 Plus
阿里通义千问3.7系列性价比模型,1M上下文,支持多模态Agent
Alibaba (Qwen)75.010000.321.28———
48
X
Xiaomi-Robotics-1
小米具身基座模型,10 万小时真实轨迹预训练,支持自然语言指令,1600+ 场景泛化
Xiaomi75.0128000—0
49
G
GLM-5.1
智谱 AI GLM 系列前代旗舰,200K 上下文
智谱AI (Zhipu)75.02000.401.2083821240
50
G
Gemini Robotics 2
谷歌 DeepMind 新一代具身智能模型家族:Gemini Robotics 2(VLA 全身控制)、Gemini Robotics ER 2(具身推理,AI Studio 可用)与 On-Device 2(端侧部署),支持精细操作、多机器人协作,数小时即可适配新机器人本体。
Google DeepMind74.0128000—0
51
C
Cursor Composer 2
Cursor Composer 2 AI 编程助手
Cursor72.02560082821220
52
M
MiMo-V2.5
小米 MiMo-V2.5 端侧大模型
Xiaomi72.010490.150.29———
53
M
MiniMax-M2.7
MiniMax M2.7 对话模型
MiniMax (稀宇科技)72.02050.281.2082811220
54
K
Kimi K2.5
月之暗面 Kimi K2.5 对话模型,262K 上下文
月之暗面 / Moonshot AI72.02620.401.9082821220
55
G
Gemini 3 Flash
Google DeepMind 轻量级 Gemini 模型,1000K 上下文
Google DeepMind70.010000.150.608280.501220
56
G
GLM-5
智谱 AI GLM-5 模型,前代旗舰
智谱AI (Zhipu)70.02000.300.9081791210
57
Q
Qwen3.5 397B
阿里 Qwen3.5 397B 参数大模型
Alibaba (Qwen)68.02620.451.3580.5080.501200
58
I
Inkling
Thinking Machines Lab 推出的开源 MoE 模型,975B 总参数 / 41B 激活。支持文本、图像、音频多模态输入,1M 上下文窗口。AA 智能指数 41,为首个登顶的美国开源模型。Agent 能力突出,在 GDPval-AA v2 上 Elo 1238,优于 Kimi K2.6 和 DeepSeek V4 Flash。
Thinking Machines Lab68.0104914.050—1238
59
G
GPT-5.4 Mini
GPT-5.4高效变体,400K上下文,优化高吞吐场景
OpenAI67.04000.754.50———
60
Q
Qwen3 Coder 480B
Qwen 最强开源编码模型,480B MoE 架构(35B 激活),原生 256K 上下文(YaRN 可扩展至 1M)。SWE-Bench 表现优异,Apache 2.0 开源。配套 Qwen Code CLI 工具。
Alibaba (Qwen)66.02560.221.80———
61
I
Inkling Small
Thinking Machines 开源权重 MoE 模型,276B 总参数/12B 激活,仅 Inkling 四分之一规模但性能相当。原生音频与图像推理,可变思考强度,最高 1M 上下文。ARC Prize 评分最高的开源权重模型。
Thinking Machines Lab66.0524000—0
62
G
Gemini 2.5 Pro
Google DeepMind 上一代 Gemini 高端模型
Google DeepMind65.010000.351.4080.50781180
63
G
Grok 3
xAI 上一代 Grok 模型,1000K 上下文
xAI65.010000.150.6080801180
64
混
混元 Hy3 Preview
腾讯混元 Hy3 Preview 预览模型,256K 上下文
腾讯混元65.02560.060.1879781180
65
P
Poolside Laguna S 2.1
Poolside 编码专用 Agent 模型,118B-A8B MoE 架构,1M 上下文,Terminal-Bench 70.2%,DeepSWE 40.4%,专注长时工程任务自主完成
Poolside65.010000.100.20———
66
D
DeepSeek V3.2
DeepSeek V3 系列最新版,131K 上下文,高性价比
DeepSeek (深度求索)63.01640.230.340—0
67
N
Nemotron 3 Ultra
NVIDIA Nemotron 3 Ultra is an open frontier-reasoning and orchestration model with 550B total params (55B active, MoE). Built on hybrid Mamba-Transformer architecture, it achieves 95% Long Context Ruler @1M and 65-70% SWE-bench Verified. Fully open weights, data, and training recipes.
NVIDIA62.010000.502.20———
68
G
GPT-Live-1
OpenAI 实时语音对话模型,支持打断和继续对话,可同时完成语音对话及推理过程
OpenAI62.032000—0
69
C
Claude 4.5 Haiku
Anthropic 轻量级快速模型,200K 上下文
Anthropic60.02000.80478751150
70
G
Gemini 3.1 Flash Lite
Google 超低价 1M 上下文模型,适合大批量处理
Google DeepMind60.010490.251.500—0
71
C
Codestral 2508
Mistral 代码专用模型,256K上下文,低定价
Mistral AI60.02560.300.900—0
72
S
Step 3.7 Flash
StepFun 最新多模态 MoE 模型,196B 参数语言骨干 + 视觉编码器,原生支持图像和视频理解
StepFun (阶跃星辰)60.02560.201.157875—
73
G
GPT-5.4 Nano
GPT-5.4最轻量变体,400K上下文,极速低成本
OpenAI58.04000.201.25———
74
L
Laguna XS 2.1
Poolside Laguna XS 2.1 is a 33B-A3B MoE coding agent model optimized for local deployment. Builds on XS.2 with improved SWE-bench Multilingual (63.1%) and stronger terminal-style task performance. Supports 256K context, runs locally in vLLM/SGLang.
Poolside58.02560.060.12———
75
N
Nex AGI Nex-N2-Pro
Nex-N2-Pro 是 Nex AGI 的 agentic MoE 模型,基于 Qwen3.5 架构,17B 活跃参数 / 397B 总参数。支持文本和图像输入,262K 上下文,以极低价格提供接近前沿的推理能力。
Nex AGI58.02620.251———
76
C
Cursor Composer 1.5
Cursor Composer 1.5 早期版本
Cursor58.02000076741150
77
Q
Qwen3.7 Flash
阿里 Qwen3.7 系列轻量视觉语言推理模型,1M 上下文,支持图像/视频输入,适合多模态 Agent、视觉编码、搜索与计算机交互场景,定价 $0.03/$0.13 每百万 token
Alibaba (Qwen)58.010000.030.130—0
78
D
DeepSeek R1
DeepSeek R1 推理增强模型,128K 上下文,MIT 开源
DeepSeek55.01280.552.1978.5078.501100
79
N
Nova 2.0 Pro
Amazon Nova 2.0 Pro 企业级模型
Amazon55.02560.803.2076721120
80
N
Nemotron 3 Super
NVIDIA Nemotron 3 Super 开源模型
NVIDIA55.010000.140.4276741120
81
M
Mistral Large 2512
Mistral Large 2025年12月更新版,262K上下文,定价大幅下降
Mistral AI55.02620.501.500—0
82
M
Mistral Medium 3.5
Mistral 中端模型,262K上下文
Mistral AI55.02621.507.500—0
83
C
Cohere North Mini Code
Cohere North Mini Code 是 Cohere 的首个 agentic 编程模型,North 系列的首发产品。30B 总参数/3B 活跃参数的稀疏 MoE 架构,针对端到端编程任务优化,256K 上下文。
Cohere55.025600———
84
S
Step 3.5 Flash
阶跃星辰 Step 3.5 Flash 快速模型
StepFun (阶跃星辰)55.02560.030.0975721100
85
豆
豆包 Seed Code
字节跳动豆包 Seed Code 编程模型
字节跳动 (ByteDance)55.02560.100.3076741120
86
M
Mistral Large 3
Mistral AI 前代旗舰模型,256K 上下文
Mistral AI50.02560.300.9075701100
87
G
Grok Build 0.1
xAI 编程专用模型,专为代理式软件工程工作流优化,支持文本和图像输入
xAI50.025612———
88
N
Nemotron 3.5 Lightning
NVIDIA 开源智能体模型:30B 总参 3B 激活 MoE,Mamba-2+MoE+Attention 混合架构,最高 100 万 token 上下文,输出速度最高 4 倍于同类,主打长时 agent 工作负载与本地部署(RTX PC / DGX Spark / Jetson),OpenMDW-1.1 商用许可。
NVIDIA48.010000.100.2581.62—0
89
C
Command A+
Cohere Command A+ 增强版企业级生成模型,128K 上下文
Cohere48.0128000—0
90
L
Llama 4 Maverick
Meta Llama 4 Maverick 开源模型,1000K 上下文
Meta45.010000.170.5072721080
91
E
ERNIE 5.0 Thinking
百度文心 ERNIE 5.0 Thinking 推理增强
百度 (Baidu)45.01280.250.7570681050
92
G
Granite 4.1 8B
IBM 开源企业级 8B 密集模型,性能匹敌 32B MoE 模型,131K 上下文,专为企业任务设计
IBM40.01310.050.10———
93
L
Llama 4 Scout
Meta Llama 4 Scout 超长上下文开源模型,10000K 上下文
Meta35.0100000.110.3365651000
94
M
Mistral Small 4
Mistral AI 轻量级模型,256K 上下文
Mistral AI35.02560.100.306562980
95
C
Command A
Cohere Command A 企业级生成模型
Cohere35.02561.504.506260970
96
P
Phi-4
Microsoft Phi-4 轻量级模型,16K 上下文
Microsoft30.0160.080.246065950
97
J
Jamba 1.7 Large
AI21 Labs Jamba 1.7 Large 混合架构模型
AI21 Labs30.02561.303.905860930

免责声明

本排行榜由 LinkWord 站点运营人工整理与更新,综合分、基准测试分数、价格与能力指标等仅供浏览与横向对比参考,不构成购买建议、性能承诺或商业背书。数据可能滞后于厂商官方发布,不同评测方法、版本与使用场景下结果会有差异;第三方商标与产品名称归各自权利人所有。使用本页信息所产生的任何后果由使用者自行承担,转载或引用请注明来源。