返回模型榜
评测来源
每个来源测什么、怎样更新、是否进入排名,都可以在这里找到。
20本轮参与排名69已审查来源与专项
排名怎么算 综合评测与体验
17跨能力的综合测试与真人盲选。
- ClasséAA Index把多项当前评测放到同一套环境里复跑,得到一个综合能力分。价格只作参考,不进总分。Artificial Analysis证据预算 30%
- Référence croiséeLiveBench题库持续更换,答案可以自动核对。用来看模型换题之后还能不能站住。LiveBench
- ClasséArena Text真人匿名两两比较回答,看大家更愿意读哪一个。补上选择题看不出的整体体验。LMArena证据预算 5%
- ClasséArena WebDev同样是真人盲选,比的是网页好不好用、能不能交付。LMArena证据预算 2.4%
- ClasséLiveBench · 语言与指令Language + IF 两项均分,各占 50%。LiveBench证据预算 3%
- ClasséArena 创作盲选真人盲选故事、诗歌和其他创意表达,观察作品是否吸引读者。LMArena证据预算 5%
- En observationDesign Arena · 视觉设计真人盲选网页、界面、图表和幻灯片的设计作品。Design Arena / Intelligence
- En observationEQ-Bench 4 · 情绪与人际理解在多轮交流中理解人物情绪、隐含需求与不同的沟通偏好。EQ-Bench
- En observationShort-Story · 短篇小说把固定人物、情节与风格要求自然写进一篇完整短篇小说。Lech Mazur
- En observationToneBench · 文风与脚本按指定作者文风写视频脚本,考查开场、结构、表达与口播节奏。Towards AI
- En observationTubeLab · 视频脚本面向不同视频频道写脚本,比较故事组织、文风、节奏与清晰度。TubeLab
- En observationNC Bench · 作家工作流帮助作家改写、续写、总结、翻译和整理创作想法。Novelcrafter
- En observationOpenVibeEval · 网页作品对照网页作品、可访问性和盲选偏好,观察不同工具下的设计表现。OpenVibeEval
- En observationSVGBench · 矢量图盲选按相同提示盲选 SVG,考查视觉清晰度与图形表现。SVGBench
- En observationRapidata SVG真人比较模型生成的矢量图,直接评价视觉偏好。Rapidata
- ClasséCreative Writing v3短篇创作与表达EQ-Bench证据预算 3.6%
- ClasséLongform Writing长篇故事的连贯性与完整性EQ-Bench证据预算 2.4%
编程
13从写代码到改仓库,看模型能不能把软件做出来。
- ClasséDeepSWE v1.1在统一的编程助手环境里改仓库、修缺陷,比较的是写代码的模型本身。DataCurve证据预算 3.6%
- ClasséTapTap Maker在真实游戏引擎里用 Lua 写出能跑起来的功能。分数由引擎执行判定,不用另一个模型打分。TapTap Maker证据预算 3.6%
- ClasséLiveBench · 编程综合Coding + Agentic Coding 两项均分,各占 50%。LiveBench证据预算 2.4%
- En observationHyper-τ-bench根据业务资料构建并测试能工作的客户服务代理。Sierra
- En observationSWE-rebench持续收集真实仓库问题,比较模型在多种编程语言中的软件修复能力。Nebius
- En observationLHTB在较长时间内持续使用终端,完成复杂工程与工具任务。Tencent HY / Lehigh 等
- Référence seuleTerminal-Bench 4保留模型搭配不同 Agent 在终端任务中的原始成绩,供交叉核对。Harbor / Terminal-Bench
- Référence seuleMirrorCode长时间的软件复现Epoch AI
- En observationCode Migration软件迁移与接口改造Vals AI
- En observationProgramBench完整程序的实现与交付Vals AI
- En observationFrontierCode真实仓库任务的质量、测试与修改范围Cognition
- En observationFrontierSWE v2长时间运行的工程实现与研究任务Proximal Labs
- En observationWeirdML在陌生数据上实现机器学习方案WeirdML
推理
11数学、逻辑与陌生规则,看模型能不能想明白新问题。
- ClasséLiveBench · 推理与数学Reasoning + Mathematics 两项均分,各占 50%。LiveBench证据预算 4.2%
- En observationSimpleBench用日常常识和逻辑问题,检验模型能否识别问题中的实际约束。SimpleBench
- ClasséFrontierMath v2 · Tiers 1–3研究级数学推理Epoch AI证据预算 3.6%
- ClasséFrontierMath v2 · Tier 4更高难度的数学研究题Epoch AI证据预算 1.2%
- ClasséChess Puzzles根据文字棋局寻找正确走法Epoch AI证据预算 1.8%
- ClasséMystery Game Puzzles从陌生规则推导正确行动Epoch AI证据预算 1.2%
- En observationMathArena · ArXivLean用 Lean 验证数学证明MathArena / ETH Zurich
- En observationMathArena · BrokenArXiv发现和修复数学证明中的错误MathArena / ETH Zurich
- En observationMathArena · ArXivMath从近期数学论文提炼的新题MathArena / ETH Zurich
- En observationARC-AGI-2从陌生规则中学习和泛化ARC Prize
- En observationARC-AGI-3从陌生规则中学习和泛化ARC Prize
知识
5事实问答与研究生级科学知识,看知识掌握与回答准确性。
- En observationFACTS Parametric不借助搜索工具回答世界事实问题,检验模型自身知识的准确性。Google DeepMind / Kaggle
- En observationHumanity’s Last Exam横跨学科的高难度学术知识与推理。CAIS / Scale AI
- En observationBullshitBench · 错误前提识别问题里的错误前提,观察模型会不会顺着错误继续编造。Peter Gostev / BullshitBench
- ClasséSimpleQA Verified短问题的事实准确性Epoch AI证据预算 4%
- ClasséGPQA Diamond研究生水平的物理、化学与生物知识Epoch AI证据预算 2%
专业办公
19金融分析、法律咨询与银行业务,看专业任务能否完成。
- ClasséAPEX-Agents 1.1投行、咨询和法律里的长任务,看模型当助手能不能把一件完整的工作做完。Mercor证据预算 4%
- ClasséVals Finance Agent金融分析师的日常办公题,看研报、建模这类工作做得怎样。Vals AI证据预算 3%
- En observationOfficeQA Pro从大量真实财务文件中检索、计算并回答问题。Databricks
- En observationHarvey Legal Agent Benchmark处理法律资料并交付 Word、Excel、幻灯片等可审阅文件。Vals AI / Harvey
- En observationMCP Atlas通过真实 MCP 服务检索资料、操作文档与数据库,完成跨软件任务。Scale AI
- En observationFinanceBenchmark完成金融定价、资本计算和风控任务,用数值与代码执行结果核验。FinanceBenchmark
- En observationPRBench · Legal回答真实法律工作中的复杂问题,检验专业判断和论证质量。Scale AI
- En observationPRBench · Finance回答真实金融决策问题,检验专业判断、推导和风险说明。Scale AI
- En observationSpreadsheetBench 2完成财务建模、修复工作簿和数据可视化的整套表格工作。SpreadsheetBench / Renmin University / AfterQuery
- En observationVending-Bench 2经营模拟商店一年,处理采购、谈判、库存与定价。Andon Labs
- Résultats attendusτ³-Banking在统一工具环境中办理银行业务,检验规则理解、客户沟通与任务完成。Sierra证据预算 2%
- Référence seuleEBR-bench在长任务中学习新规则并使用记忆Epoch AI
- En observationExcel · EMB表格编辑与 Excel 办公Vals AI
- En observationLegal Research法律检索和论证Vals AI
- En observationTaxAgentBench税务专业问题Vals AI
- En observationMedScribe临床记录整理与撰写Vals AI
- En observationBioMysteryBench生物学研究推理Vals AI
- En observationAutomationBench跨办公软件完成自动化工作Zapier
- En observationTerminal-Bench Science在终端里完成科研任务Harbor
视觉理解
2理解图片的证据继续保留在综合榜;读懂图片与设计美观是不同能力。
中文与多语言
2语言基础的补充证据,不把英文写作表现当作中文能力。
“观察中”表示仍在核对数据、运行条件或使用边界,不参与综合榜和分类榜。同一评测的重复抓取和展示切片不会增加票权;不同评测之间的题库重叠仍需持续核对。