TestAI.vip 公告:交流群即将开放,后续这里会展示最新检测动态与站点通知。

Model Intelligence Ranking

不知道用哪个模型?

先看模型智商排行,再决定拿哪一个模型去测中转站。第一版只做模型排名,不接入任何第三方站点数据。

TestAI Intelligence Index 96.2 已收录 17 个模型

模型智商排行榜

指数越高,代表综合推理、代码、长任务和工具使用表现越强。

样例榜单 · 17 个模型
排名 模型 智商指数 评级 适合任务 数据状态
#1
Claude Fable 5 Anthropic
96.2
S 复杂分析、代码审查、长任务拆解 样例基准
#2
Claude Opus 4.8 Anthropic
94.1
S 高质量写作、复杂推理、代码生成 样例基准
#3
GPT 5.6 Sol OpenAI
95.0
S 复杂开发、深度推理、长任务执行 样例基准
#4
GPT 5.6 Terra OpenAI
92.5
S 日常开发、工具调用、综合任务 样例基准
#5
GPT 5.6 Luna OpenAI
89.5
A 快速代码任务、高频交互、成本敏感场景 样例基准
#6
Claude Opus 4.7 Anthropic
91.8
A 长上下文、严肃文本、复杂判断 样例基准
#7
Claude Sonnet 5 Anthropic
91.2
A 代码、客服、文档分析 样例基准
#8
GPT 5.4 OpenAI
88.7
A 高频对话、轻量代码、性价比任务 样例基准
#9
GLM 5.2 智谱
87.9
A 中文问答、办公写作、知识整理 样例基准
#10
Gemini 3.5 Flash Google
86.5
A 多模态、快速摘要、图文理解 样例基准
#11
Qwen3.7 Max 通义千问
85.8
A 中文代码、Agent、结构化输出 样例基准
#12
DeepSeek V4 Pro DeepSeek
85.1
A 数学推理、代码补全、低成本批处理 样例基准
#13
Gemini 3.1 Pro Preview Google
84.7
A 图文理解、长文摘要、研究检索 样例基准
#14
GPT 5 OpenAI
84.3
A 通用问答、函数调用、业务自动化 样例基准
#15
Claude Opus 4.6 Anthropic
83.9
A 高可靠文本、复杂评审、长文写作 样例基准
#16
Grok 4 xAI
83.2
A 实时讨论、创意问答、轻量研究 样例基准
#17
Kimi 2.6 月之暗面
82.7
A 长文阅读、中文资料整理、办公写作 样例基准

这个指数后面怎么变成真实榜

1

先定测试集

按推理、代码、长上下文、结构化输出、多模态分组准备固定题集。

2

同题多模型跑

同一批题跑官方模型和中转站模型,记录正确率、稳定性和延迟。

3

只展示可复核结论

榜单保留样本数和更新时间,避免把一次测试当成绝对排名。