| 1 | GGPT-5.5 OpenAI 最新旗舰模型,1050K 超长上下文,AI 推理和编程能力业界领先 | OpenAI | 98.0 | 1050 | 5 | 30 | 91.50 | 91.40 | 1420 |
| 2 | CClaude Fable 5 Anthropic 最强模型,定位高于 Opus 层级。Mythos 级别公开版,1M 上下文,SWE-Bench 等多项基准超越 Opus 4.8 超过 10%。支持自适应思维模式。 | Anthropic | 97.0 | 1000 | 10 | 50 | — | — | — |
| 3 | GGemini 3.5 Pro Google DeepMind 旗舰模型,1000K 上下文窗口,综合能力强 | Google DeepMind | 96.0 | 1000 | 1.50 | 9 | 91 | 89.50 | 1400 |
| 4 | GGPT-5.6 Sol OpenAI 新旗舰模型,三款中的最强版本。在 HealthBench Professional 得分 60.5%,网络安全和生物风险评估均为 High 级别。API 新增 Fast mode:比 Standard 快 2.5 倍、价格 2 倍、智能不变(2026-07-30)。 | OpenAI | 96.0 | 1050 | 5 | 30 | 0 | — | 0 |
| 5 | CClaude Opus 4.8 Anthropic 最新旗舰推理模型 | Anthropic | 95.0 | 1000 | 5 | 25 | 0 | — | 0 |
| 6 | CClaude Opus 5 Anthropic 最新 Opus 旗舰,接近 Fable 5 前沿智能(差异 <0.5%),定价 $5/$25 每百万 token,2026-07-25 发布后即登顶 AA 智能榜 #1 | Anthropic | 94.0 | 1000 | 5 | 25 | 89.20 | — | 1320 |
| 7 | KKimi K3 月之暗面最新旗舰模型,2.8T 参数 MoE(激活 16/896 专家),1M 上下文,原生视觉能力。AA 智能指数 #4,性能仅次于 Fable 5 和 GPT-5.6 Sol。开源权重将于 7 月 27 日发布。 | 月之暗面 / Moonshot AI | 94.0 | 1049 | 3 | 15 | — | — | — |
| 8 | GGPT-5.6 Terra GPT-5.6 系列均衡版本,日常工作的主力选择。2026-07-30 起 API 降价 20%($2.00/M 输入、$12.00/M 输出),缓存输入 $0.20/M。 | OpenAI | 93.5 | 1050 | 2 | 12 | 0 | — | 0 |
| 9 | CClaude Opus 4.7 Anthropic 高端推理模型,1000K 上下文,面向复杂任务和企业级应用 | Anthropic | 93.0 | 1000 | 5 | 25 | 91 | 92.50 | 1400 |
| 10 | CClaude Opus 5 Fast Claude Opus 5 的 Fast 模式变体,能力与 Opus 5 相同,运行速度约 2.5 倍,定价为基础版 2 倍($10/$50 每百万 token),1M 上下文,适合对延迟敏感的长任务 Agent 场景 | Anthropic | 92.0 | 1000 | 10 | 50 | 89.20 | — | 1320 |
| 11 | GGemini 3.6 Flash Google 最新的 Gemini Flash 系列旗舰,面向编程、知识工作和多模态任务。输出 token 用量减少 17%,DeepSWE 49%,OSWorld-Verified 83.0%。API 输入 $1.50/输出 $7.50。 | Google DeepMind | 92.0 | 1049 | 1.50 | 7.50 | 0 | — | 0 |
| 12 | MMuse Spark 1.1 Meta 旗舰多模态推理模型,百万 token 上下文,支持 Agent 任务、编码、计算机操作 | Meta | 92.0 | 1024 | 1.25 | 4.25 | 0 | — | 0 |
| 13 | CClaude Sonnet 5 Anthropic Claude 系列中端模型,性能与成本的平衡之选 | Anthropic | 92.0 | 1000 | 2 | 10 | — | — | 1312 |
| 14 | GGLM-5.2 开源推理模型新标杆,MIT 许可,AA Intelligence Index 51 分位居开源模型榜首。MoE 架构 753B 总参数/40B 活跃参数,1M 上下文。GDPval-AA v2 得分 1524,与 GPT-5.5(1514)持平。科学推理能力突出:GPQA Diamond 89%,HLE 40%。 | 智谱AI / Z.ai | 91.0 | 1000 | 1.40 | 4.40 | — | — | — |
| 15 | SSakana Fugu Ultra Fugu Ultra 是 Sakana AI 的旗舰多智能体编排模型,通过自主调用专家模型池处理复杂多步任务,基准测试媲美 Fable 5 与 Mythos Preview。1M 上下文窗口,支持多模态输入。 | Sakana AI | 91.0 | 1000 | 5 | 30 | — | — | — |
| 16 | GGPT-5.6 Luna GPT-5.6 系列最快速、最低价版本。2026-07-30 起 API 降价 80%($0.20/M 输入、$1.20/M 输出),性能接近一年前旗舰级模型,成本约为其 6%。支持工具调用与多步工作流。 | OpenAI | 91.0 | 1050 | 0.20 | 1.20 | 0 | — | 0 |
| 17 | QQwen3.8 Max 阿里 Qwen 系列最新旗舰模型,2.4T 参数(95B 激活)MoE,主打编程与智能体协同(cowork)长任务,支持 1M 上下文与多模态理解,综合表现超 Qwen3.7 Max。这是 Qwen 首次开源 Max 级模型权重(官方宣布下周发布)。API 定价 $2/$6 每百万 token(隐式缓存 $0.25)。 | Alibaba (Qwen) | 90.0 | 1000 | 2 | 6 | 0 | — | 0 |
| 18 | CClaude Opus 4.6 Anthropic 1M 上下文推理模型,标准版 $5/$25,快速版 $30/$150 | Anthropic | 90.0 | 1000 | 5 | 25 | 0 | — | 0 |
| 19 | GGPT-5.4 Pro OpenAI最强推理模型,1M+上下文,已解决前沿数学难题(Ramsey超图、Erdős问题) | OpenAI | 90.0 | 1050 | 30 | 180 | — | — | — |
| 20 | GGemini 3.5 Flash Google 轻量级旗舰模型,支持 Computer Use 屏幕操控、函数调用、Search/Maps Grounding,适合 Agent 场景 | Google DeepMind | 90.0 | 1049 | 1.50 | 9 | 92.30 | 86.80 | 1370 |
| 21 | GGPT-5.5 Instant GPT-5.5 低延迟版,快速响应适合对话场景 | OpenAI | 88.0 | 922 | 0.75 | 3 | 89.50 | 88.20 | 1350 |
| 22 | DDeepSeek V4 Flash DeepSeek-V4-Flash-0731 正式版(2026-07-31):MoE 架构 284B 总参数/13B 活跃,1M 上下文、384K 最大输出。agent 能力大幅升级,Terminal Bench 2.1 82.7、Toolathlon 70.3、Cybergym 76.7、DeepSWE 54.4,均远超 V4-Pro-Preview。ARC Prize 验证成绩(2026-08-07):ARC-AGI-1 89.0%、ARC-AGI-2 61.4%(max effort,每任务 $0.02/$0.04)。原生支持 Responses API 并适配 Codex。定价输入 $0.14/M、输出 $0.28/M,极致性价比。 | DeepSeek (深度求索) | 88.0 | 1049 | 0.14 | 0.28 | 0 | — | 0 |
| 23 | VVibeThinker-3B 3B参数稠密推理模型,AIME26得分94.3,基于Qwen2.5,采用Spectrum-to-Signal后训练范式。不支持工具调用,专注数学和代码推理。 | Weibo AI | 88.0 | 32 | — | — | — | — | — |
| 24 | DDeepSeek V4 Pro 深度推理模型,MIT 开源许可,1M 上下文窗口,MoE 架构 1.6T 总参数/49B 活跃参数。AA Intelligence Index 44 分,仅次于 GLM-5.2 的开源模型第二名。缓存命中价格极低($0.004/M tokens)。 | DeepSeek (深度求索) | 87.0 | 1049 | 0.43 | 0.87 | — | — | — |
| 25 | KKimi K2.7 Code 1T MoE 编程专用模型,256K 上下文,Modified MIT 开源,推理 token 消耗降低 30% | 月之暗面 / Moonshot AI | 85.0 | 256 | 0.74 | 3.50 | — | — | — |
| 26 | QQwen3.7 Max 阿里 Qwen 系列最强模型,1000K 上下文,MoE 架构 | Alibaba (Qwen) | 85.0 | 1000 | 1.25 | 3.75 | 87 | 87 | 1300 |
| 27 | GGemini 3.1 Pro Google DeepMind 前代旗舰模型,1049K 上下文 | Google DeepMind | 85.0 | 1049 | 2 | 12 | 87.50 | 85 | 1300 |
| 28 | GGrok 4.5 xAI 最新编码与智能体模型,基于 1.5T V9 基座,500K 上下文,定价 $2/$6/M,编程能力对标 GPT-5.5 | xAI | 83.0 | 500 | 2 | 6 | 0 | — | 0 |
| 29 | GGrok 4.20 Multi-Agent xAI 多智能体推理模型,基于 Grok 4.20 构建,支持多 Agent 协作编排,2M 上下文,适合复杂任务分解与并行执行 | xAI | 82.0 | 2000 | 1.25 | 2.50 | 86 | 85 | 1275 |
| 30 | CCursor Composer 2.5 Cursor AI IDE 内置 Agent 编程模式,256K 上下文 | Cursor | 82.0 | 256 | 0 | 0 | 85 | 86 | 1260 |
| 31 | KKimi K2.6 月之暗面 Kimi 最新模型,262K 上下文,Agent 能力突出 | 月之暗面 / Moonshot AI | 82.0 | 262 | 0.68 | 3.42 | 85.50 | 84.50 | 1280 |
| 32 | GGPT-5.4 OpenAI GPT-5.4 旗舰模型,1050K 上下文 | OpenAI | 82.0 | 1050 | 2.50 | 15 | 88.20 | 87.50 | 1320 |
| 33 | GGrok 4.20 xAI推理模型,2M上下文,最低幻觉率,支持Agent工具调用 | xAI | 81.0 | 2000 | 1.25 | 2.50 | — | — | — |
| 34 | CClaude Sonnet 4.6 Anthropic Claude Sonnet 系列,中高端推理模型 | Anthropic | 80.0 | 1000 | 3 | 15 | 86.50 | 88 | 1280 |
| 35 | MMiniMax M3 首个开源权重模型同时具备前沿编码、1M 上下文和原生多模态能力。MSA 稀疏注意力架构,SWE-Bench Pro 59.0%,TerminalBench 66.0%。定价极具竞争力。 | MiniMax (稀宇科技) | 80.0 | 1000 | 0.30 | 1.20 | — | — | — |
| 36 | WWindsurf SWE-1.6 Windsurf 全栈 AI 编程助手,200K 上下文 | Windsurf (Codeium) | 80.0 | 200 | 0 | 0 | 0 | 0 | 0 |
| 37 | GGrok 4.3 xAI Grok 最新旗舰,1000K 上下文 | xAI | 80.0 | 1000 | 1.25 | 2.50 | 86 | 85 | 1270 |
| 38 | MMiMo-V2.5 Pro 小米 MiMo-V2.5 Pro 端侧大模型 | Xiaomi | 78.0 | 1000 | 0.44 | 0.88 | 85 | 84 | 1260 |
| 39 | LLongCat-2.0 美团推出的1.6万亿总参MoE大模型,48B激活参数,国产AI ASIC芯片训练,支持1M上下文,MIT开源协议 | Meituan (美团) | 78.0 | 1049 | 0 | 0 | — | — | — |
| 40 | QQwen3.6 Plus 阿里 Qwen3.6 Plus 中高端模型,1000K 上下文 | Alibaba (Qwen) | 76.0 | 1000 | 0.33 | 1.95 | 84 | 84 | 1250 |
| 41 | GGPT-4o OpenAI GPT-4o 多模态模型,128K 上下文 | OpenAI | 75.0 | 128 | 2.50 | 10 | 88.70 | 90.20 | 1287 |
| 42 | GGemini 3.5 Flash-Lite Google 最快的 3.5 系列模型,350 tokens/s,面向代理搜索和文档处理等低延迟高吞吐任务。定价 $0.30/$2.50。SWE-Bench Pro 54.2%,OSWorld 74.0%。1M 上下文。 | Google DeepMind | 75.0 | 1000 | 0.30 | 2.50 | 0 | — | 0 |
| 43 | QQwen3.7 Plus 阿里通义千问3.7系列性价比模型,1M上下文,支持多模态Agent | Alibaba (Qwen) | 75.0 | 1000 | 0.32 | 1.28 | — | — | — |
| 44 | XXiaomi-Robotics-1 小米具身基座模型,10 万小时真实轨迹预训练,支持自然语言指令,1600+ 场景泛化 | Xiaomi | 75.0 | 128 | 0 | 0 | 0 | — | 0 |
| 45 | GGLM-5.1 智谱 AI GLM 系列前代旗舰,200K 上下文 | 智谱AI (Zhipu) | 75.0 | 200 | 0.40 | 1.20 | 83 | 82 | 1240 |
| 46 | GGemini Robotics 2 谷歌 DeepMind 新一代具身智能模型家族:Gemini Robotics 2(VLA 全身控制)、Gemini Robotics ER 2(具身推理,AI Studio 可用)与 On-Device 2(端侧部署),支持精细操作、多机器人协作,数小时即可适配新机器人本体。 | Google DeepMind | 74.0 | 128 | 0 | 0 | 0 | — | 0 |
| 47 | CCursor Composer 2 Cursor Composer 2 AI 编程助手 | Cursor | 72.0 | 256 | 0 | 0 | 82 | 82 | 1220 |
| 48 | MMiMo-V2.5 小米 MiMo-V2.5 端侧大模型 | Xiaomi | 72.0 | 1049 | 0.15 | 0.29 | — | — | — |
| 49 | MMiniMax-M2.7 MiniMax M2.7 对话模型 | MiniMax (稀宇科技) | 72.0 | 205 | 0.28 | 1.20 | 82 | 81 | 1220 |
| 50 | KKimi K2.5 月之暗面 Kimi K2.5 对话模型,262K 上下文 | 月之暗面 / Moonshot AI | 72.0 | 262 | 0.40 | 1.90 | 82 | 82 | 1220 |
| 51 | GGemini 3 Flash Google DeepMind 轻量级 Gemini 模型,1000K 上下文 | Google DeepMind | 70.0 | 1000 | 0.15 | 0.60 | 82 | 80.50 | 1220 |
| 52 | | 智谱AI (Zhipu) | 70.0 | 200 | 0.30 | 0.90 | 81 | 79 | 1210 |
| 53 | QQwen3.5 397B 阿里 Qwen3.5 397B 参数大模型 | Alibaba (Qwen) | 68.0 | 262 | 0.45 | 1.35 | 80.50 | 80.50 | 1200 |
| 54 | IInkling Thinking Machines Lab 推出的开源 MoE 模型,975B 总参数 / 41B 激活。支持文本、图像、音频多模态输入,1M 上下文窗口。AA 智能指数 41,为首个登顶的美国开源模型。Agent 能力突出,在 GDPval-AA v2 上 Elo 1238,优于 Kimi K2.6 和 DeepSeek V4 Flash。 | Thinking Machines Lab | 68.0 | 1049 | 1 | 4.05 | 0 | — | 1238 |
| 55 | GGPT-5.4 Mini GPT-5.4高效变体,400K上下文,优化高吞吐场景 | OpenAI | 67.0 | 400 | 0.75 | 4.50 | — | — | — |
| 56 | QQwen3 Coder 480B Qwen 最强开源编码模型,480B MoE 架构(35B 激活),原生 256K 上下文(YaRN 可扩展至 1M)。SWE-Bench 表现优异,Apache 2.0 开源。配套 Qwen Code CLI 工具。 | Alibaba (Qwen) | 66.0 | 256 | 0.22 | 1.80 | — | — | — |
| 57 | IInkling Small Thinking Machines 开源权重 MoE 模型,276B 总参数/12B 激活,仅 Inkling 四分之一规模但性能相当。原生音频与图像推理,可变思考强度,最高 1M 上下文。ARC Prize 评分最高的开源权重模型。 | Thinking Machines Lab | 66.0 | 524 | 0 | 0 | 0 | — | 0 |
| 58 | GGemini 2.5 Pro Google DeepMind 上一代 Gemini 高端模型 | Google DeepMind | 65.0 | 1000 | 0.35 | 1.40 | 80.50 | 78 | 1180 |
| 59 | GGrok 3 xAI 上一代 Grok 模型,1000K 上下文 | xAI | 65.0 | 1000 | 0.15 | 0.60 | 80 | 80 | 1180 |
| 60 | 混混元 Hy3 Preview 腾讯混元 Hy3 Preview 预览模型,256K 上下文 | 腾讯混元 | 65.0 | 256 | 0.06 | 0.18 | 79 | 78 | 1180 |
| 61 | PPoolside Laguna S 2.1 Poolside 编码专用 Agent 模型,118B-A8B MoE 架构,1M 上下文,Terminal-Bench 70.2%,DeepSWE 40.4%,专注长时工程任务自主完成 | Poolside | 65.0 | 1000 | 0.10 | 0.20 | — | — | — |
| 62 | DDeepSeek V3.2 DeepSeek V3 系列最新版,131K 上下文,高性价比 | DeepSeek (深度求索) | 63.0 | 164 | 0.23 | 0.34 | 0 | — | 0 |
| 63 | NNemotron 3 Ultra NVIDIA Nemotron 3 Ultra is an open frontier-reasoning and orchestration model with 550B total params (55B active, MoE). Built on hybrid Mamba-Transformer architecture, it achieves 95% Long Context Ruler @1M and 65-70% SWE-bench Verified. Fully open weights, data, and training recipes. | NVIDIA | 62.0 | 1000 | 0.50 | 2.20 | — | — | — |
| 64 | GGPT-Live-1 OpenAI 实时语音对话模型,支持打断和继续对话,可同时完成语音对话及推理过程 | OpenAI | 62.0 | 32 | 0 | 0 | 0 | — | 0 |
| 65 | CClaude 4.5 Haiku Anthropic 轻量级快速模型,200K 上下文 | Anthropic | 60.0 | 200 | 0.80 | 4 | 78 | 75 | 1150 |
| 66 | GGemini 3.1 Flash Lite Google 超低价 1M 上下文模型,适合大批量处理 | Google DeepMind | 60.0 | 1049 | 0.25 | 1.50 | 0 | — | 0 |
| 67 | CCodestral 2508 Mistral 代码专用模型,256K上下文,低定价 | Mistral AI | 60.0 | 256 | 0.30 | 0.90 | 0 | — | 0 |
| 68 | SStep 3.7 Flash StepFun 最新多模态 MoE 模型,196B 参数语言骨干 + 视觉编码器,原生支持图像和视频理解 | StepFun (阶跃星辰) | 60.0 | 256 | 0.20 | 1.15 | 78 | 75 | — |
| 69 | GGPT-5.4 Nano GPT-5.4最轻量变体,400K上下文,极速低成本 | OpenAI | 58.0 | 400 | 0.20 | 1.25 | — | — | — |
| 70 | LLaguna XS 2.1 Poolside Laguna XS 2.1 is a 33B-A3B MoE coding agent model optimized for local deployment. Builds on XS.2 with improved SWE-bench Multilingual (63.1%) and stronger terminal-style task performance. Supports 256K context, runs locally in vLLM/SGLang. | Poolside | 58.0 | 256 | 0.06 | 0.12 | — | — | — |
| 71 | NNex AGI Nex-N2-Pro Nex-N2-Pro 是 Nex AGI 的 agentic MoE 模型,基于 Qwen3.5 架构,17B 活跃参数 / 397B 总参数。支持文本和图像输入,262K 上下文,以极低价格提供接近前沿的推理能力。 | Nex AGI | 58.0 | 262 | 0.25 | 1 | — | — | — |
| 72 | CCursor Composer 1.5 Cursor Composer 1.5 早期版本 | Cursor | 58.0 | 200 | 0 | 0 | 76 | 74 | 1150 |
| 73 | QQwen3.7 Flash 阿里 Qwen3.7 系列轻量视觉语言推理模型,1M 上下文,支持图像/视频输入,适合多模态 Agent、视觉编码、搜索与计算机交互场景,定价 $0.03/$0.13 每百万 token | Alibaba (Qwen) | 58.0 | 1000 | 0.03 | 0.13 | 0 | — | 0 |
| 74 | DDeepSeek R1 DeepSeek R1 推理增强模型,128K 上下文,MIT 开源 | DeepSeek | 55.0 | 128 | 0.55 | 2.19 | 78.50 | 78.50 | 1100 |
| 75 | NNova 2.0 Pro Amazon Nova 2.0 Pro 企业级模型 | Amazon | 55.0 | 256 | 0.80 | 3.20 | 76 | 72 | 1120 |
| 76 | NNemotron 3 Super NVIDIA Nemotron 3 Super 开源模型 | NVIDIA | 55.0 | 1000 | 0.14 | 0.42 | 76 | 74 | 1120 |
| 77 | MMistral Large 2512 Mistral Large 2025年12月更新版,262K上下文,定价大幅下降 | Mistral AI | 55.0 | 262 | 0.50 | 1.50 | 0 | — | 0 |
| 78 | MMistral Medium 3.5 Mistral 中端模型,262K上下文 | Mistral AI | 55.0 | 262 | 1.50 | 7.50 | 0 | — | 0 |
| 79 | CCohere North Mini Code Cohere North Mini Code 是 Cohere 的首个 agentic 编程模型,North 系列的首发产品。30B 总参数/3B 活跃参数的稀疏 MoE 架构,针对端到端编程任务优化,256K 上下文。 | Cohere | 55.0 | 256 | 0 | 0 | — | — | — |
| 80 | SStep 3.5 Flash 阶跃星辰 Step 3.5 Flash 快速模型 | StepFun (阶跃星辰) | 55.0 | 256 | 0.03 | 0.09 | 75 | 72 | 1100 |
| 81 | 豆豆包 Seed Code 字节跳动豆包 Seed Code 编程模型 | 字节跳动 (ByteDance) | 55.0 | 256 | 0.10 | 0.30 | 76 | 74 | 1120 |
| 82 | MMistral Large 3 Mistral AI 前代旗舰模型,256K 上下文 | Mistral AI | 50.0 | 256 | 0.30 | 0.90 | 75 | 70 | 1100 |
| 83 | GGrok Build 0.1 xAI 编程专用模型,专为代理式软件工程工作流优化,支持文本和图像输入 | xAI | 50.0 | 256 | 1 | 2 | — | — | — |
| 84 | CCommand A+ Cohere Command A+ 增强版企业级生成模型,128K 上下文 | Cohere | 48.0 | 128 | 0 | 0 | 0 | — | 0 |
| 85 | LLlama 4 Maverick Meta Llama 4 Maverick 开源模型,1000K 上下文 | Meta | 45.0 | 1000 | 0.17 | 0.50 | 72 | 72 | 1080 |
| 86 | EERNIE 5.0 Thinking 百度文心 ERNIE 5.0 Thinking 推理增强 | 百度 (Baidu) | 45.0 | 128 | 0.25 | 0.75 | 70 | 68 | 1050 |
| 87 | GGranite 4.1 8B IBM 开源企业级 8B 密集模型,性能匹敌 32B MoE 模型,131K 上下文,专为企业任务设计 | IBM | 40.0 | 131 | 0.05 | 0.10 | — | — | — |
| 88 | LLlama 4 Scout Meta Llama 4 Scout 超长上下文开源模型,10000K 上下文 | Meta | 35.0 | 10000 | 0.11 | 0.33 | 65 | 65 | 1000 |
| 89 | MMistral Small 4 Mistral AI 轻量级模型,256K 上下文 | Mistral AI | 35.0 | 256 | 0.10 | 0.30 | 65 | 62 | 980 |
| 90 | CCommand A Cohere Command A 企业级生成模型 | Cohere | 35.0 | 256 | 1.50 | 4.50 | 62 | 60 | 970 |
| 91 | PPhi-4 Microsoft Phi-4 轻量级模型,16K 上下文 | Microsoft | 30.0 | 16 | 0.08 | 0.24 | 60 | 65 | 950 |
| 92 | JJamba 1.7 Large AI21 Labs Jamba 1.7 Large 混合架构模型 | AI21 Labs | 30.0 | 256 | 1.30 | 3.90 | 58 | 60 | 930 |