AI 模型评测与比较

在私有数据集上,
比较模型的实际表现。

查看新模型的成绩,比较换代前后的提升,以及提高思考档位带来的得分、耗时和费用变化。

35 个模型 · 83 个配置

综合前五名

满分 100
1
gpt-6-astraxhigh95.3
2
3
4
5

代际与档位差异

综合得分

后端 40% · 前端 30% · 推理 30%,采用同一实测配置。

私有数据集上的公开评测

比较模型,
需要不同的测试依据。

同一个模型在不同榜单上的名次可能不同。部分公开基准的得分已接近上限;测试题公开后,也可能进入训练数据或被用于针对性优化。

ModelDial 使用自建私有数据集,公开后端、前端和知识推理的评测成绩。你可以据此比较新旧模型,以及同一模型不同思考档位的表现。

了解我们的评测集

评测内容与评分依据

分别测试后端开发、前端交互和知识推理,在对比页查看任务与学科的详细成绩。

后端与测试

测试内容
服务契约、重试策略、事务状态与缓存回归中的规则和边界。
评分依据
检查约束分析、异常场景与回归测试是否覆盖关键问题。

前端与交互

测试内容
页面布局、交互行为,以及多步操作后的状态变化。
评分依据
按功能、状态连续性、可访问性与回归测试等检查项计分。

知识与推理

测试内容
数学、计算机、物理、工程、生物医学及人文社科等学科。
评分依据
核对答案正确性,并保留各学科的答对情况。

对比页提供各项任务和学科的成绩。

查看评测说明 →

得分与费用对比

按综合或单项成绩筛选,在预算范围内比较模型和思考档位。费用按本次评测的 API 用量估算。