先定测试集
按推理、代码、长上下文、结构化输出、多模态分组准备固定题集。
Model Intelligence Ranking
先看模型智商排行,再决定拿哪一个模型去测中转站。第一版只做模型排名,不接入任何第三方站点数据。
指数越高,代表综合推理、代码、长任务和工具使用表现越强。
| 排名 | 模型 | 智商指数 | 评级 | 适合任务 | 数据状态 |
|---|---|---|---|---|---|
| #1 |
Claude Fable 5
Anthropic
|
96.2
|
S | 复杂分析、代码审查、长任务拆解 | 样例基准 |
| #2 |
Claude Opus 4.8
Anthropic
|
94.1
|
S | 高质量写作、复杂推理、代码生成 | 样例基准 |
| #3 |
GPT 5.6 Sol
OpenAI
|
95.0
|
S | 复杂开发、深度推理、长任务执行 | 样例基准 |
| #4 |
GPT 5.6 Terra
OpenAI
|
92.5
|
S | 日常开发、工具调用、综合任务 | 样例基准 |
| #5 |
GPT 5.6 Luna
OpenAI
|
89.5
|
A | 快速代码任务、高频交互、成本敏感场景 | 样例基准 |
| #6 |
Claude Opus 4.7
Anthropic
|
91.8
|
A | 长上下文、严肃文本、复杂判断 | 样例基准 |
| #7 |
Claude Sonnet 5
Anthropic
|
91.2
|
A | 代码、客服、文档分析 | 样例基准 |
| #8 |
GPT 5.4
OpenAI
|
88.7
|
A | 高频对话、轻量代码、性价比任务 | 样例基准 |
| #9 |
GLM 5.2
智谱
|
87.9
|
A | 中文问答、办公写作、知识整理 | 样例基准 |
| #10 |
Gemini 3.5 Flash
Google
|
86.5
|
A | 多模态、快速摘要、图文理解 | 样例基准 |
| #11 |
Qwen3.7 Max
通义千问
|
85.8
|
A | 中文代码、Agent、结构化输出 | 样例基准 |
| #12 |
DeepSeek V4 Pro
DeepSeek
|
85.1
|
A | 数学推理、代码补全、低成本批处理 | 样例基准 |
| #13 |
Gemini 3.1 Pro Preview
Google
|
84.7
|
A | 图文理解、长文摘要、研究检索 | 样例基准 |
| #14 |
GPT 5
OpenAI
|
84.3
|
A | 通用问答、函数调用、业务自动化 | 样例基准 |
| #15 |
Claude Opus 4.6
Anthropic
|
83.9
|
A | 高可靠文本、复杂评审、长文写作 | 样例基准 |
| #16 |
Grok 4
xAI
|
83.2
|
A | 实时讨论、创意问答、轻量研究 | 样例基准 |
| #17 |
Kimi 2.6
月之暗面
|
82.7
|
A | 长文阅读、中文资料整理、办公写作 | 样例基准 |
按推理、代码、长上下文、结构化输出、多模态分组准备固定题集。
同一批题跑官方模型和中转站模型,记录正确率、稳定性和延迟。
榜单保留样本数和更新时间,避免把一次测试当成绝对排名。