OpenAI × Anthropic · source-backed archive

模型评测,不再散落在发布页里。

汇集 OpenAI 与 Anthropic 模型报告中引用的代表性 benchmark, 一处查看目标、规模、论文、代码、数据结构、构建方式与官方成绩。

Benchmarks
20
能力领域
20
成绩记录
52

Benchmark archive

20 / 20 条记录

SimpleQA2024-10-30用单一、稳定、可核验的短答案,测量事实正确性、幻觉与拒答校准。4,326 题Correct / F-scoreOpenAI44.8% F-scoreo1-preview

Benchmark file / simpleqa

它具体在测什么?

模型直接回答短事实问题,grader 将输出分为正确、错误或未作答。题目刻意避开会随时间变化的答案,适合观察模型在“知道”与“承认不知道”之间的取舍。

数据规模
4,326 个短事实问答;另抽样 1,000 题做第三位标注员复核,官方估计固有错误率约 3%。
评测指标
报告 overall correct、correct given attempted 与二者调和平均 F-score;不同版本也可能只报 no-web accuracy,不可混排。
当前开放性
完整测试 CSV 与参考实现公开;simple-evals 自 2025-07 起不再新增模型成绩,现为归档参考实现。

Data example

论文公开样例

数据结构示例SimpleQA

{
  "question": "Who received the IEEE Frank Rosenblatt Award in 2010?",
  "reference_answer": "Michio Sugeno"
}

这是论文 Table 1 已公开样例,不是从新的留出集抽取。

How it was built

4 steps

构建思路SimpleQA

  1. 01

    Trainer 浏览网页,编写只有一个无争议且长期稳定答案的短问题。

  2. 02

    第二位 trainer 在看不到原答案时独立作答,只保留双方答案一致的题目。

  3. 03

    多数题还需能诱发当时的 GPT-4 系列模型出错,以保持难度。

  4. 04

    第三位 trainer 对 1,000 题抽样复核,并人工分析分歧与标签噪声。

Reported evaluations

2 records

相关评测SimpleQA

实验室模型成绩口径 / 设置来源
OpenAIo1-preview44.8% F-score无浏览;短答案;SimpleQA grader;correct 42.7%。2024-10-30(新窗口打开)
OpenAIGPT-4o38.4% F-score无浏览;短答案;SimpleQA grader;correct 38.2%。2024-10-30(新窗口打开)
Read with care

它只覆盖单一短事实,不能代表长答案可靠性;公开题存在训练污染,约 3% 的固有错误估计与 LLM grader 误差也限制了分数精度。

BrowseComp最终版 1,266 题测试浏览代理能否持续检索、跨来源推理,并找到难搜但易核验的唯一答案。1,266 题AccuracyOpenAI92.2%GPT-5.6 Sol Ultra

Benchmark file / browsecomp

它具体在测什么?

每题由多条跨网页线索组成,代理需规划搜索、消歧、回溯并提取一个短答案,同时给出置信度。它强调搜索策略与持久性,而不是模型参数中的记忆。

数据规模
最终 1,266 题;初始 1,287 题中有 21 题在复核后因标签或题面问题删除。
评测指标
LLM judge 比较 exact answer;另报告 calibration error,以及 majority vote、confidence-weighted vote 与 best-of-N。
当前开放性
完整 CSV 可下载,但题目与答案用逐行 canary 加密;官方明确请求网页和图片不要转载真实题目。

Data example

Illustrative schema

数据结构示例BrowseComp

{
  "question": "[由多条跨来源线索组成的问题]",
  "expected_output": {
    "explanation": "[证据与检索路径摘要]",
    "exact_answer": "[唯一短答案]",
    "confidence": "0–100%"
  }
}

纯说明性结构,不含任何 BrowseComp 真实题面、答案或可检索线索。

How it was built

4 steps

构建思路BrowseComp

  1. 01

    Trainer 从答案实体反向组合大搜索空间中的多条线索,追求“难找、易验”。

  2. 02

    候选题需让当时的 GPT-4o(含浏览)、o1 与早期 Deep Research 均答不出。

  3. 03

    常规五次搜索的首屏结果不得直接出现答案,部分题再交给另一位人类验证。

  4. 04

    对 Deep Research 通过率为零的题目复核标签,删除有缺陷或答案错误的样本。

Reported evaluations

3 records

相关评测BrowseComp

实验室模型成绩口径 / 设置来源
OpenAIGPT-5.6 Sol Ultra92.2%GPT-5.6 发布表;Ultra 使用 4 agents,逐行浏览 harness 未完整披露。2026-07-09(新窗口打开)
OpenAIGPT-5.6 Sol90.4%GPT-5.6 发布表;reasoning effort 与浏览栈未逐行披露。2026-07-09(新窗口打开)
OpenAIDeep Research51.5%原论文持久浏览代理;官方注明训练中接触过 BrowseComp 类型任务。2025-04-10(新窗口打开)
Read with care

真实题绝不能渲染为可索引内容。成绩还高度依赖搜索供应商、地区、时间、工具策略与运行预算;2025 论文和 2026 发布页并非同一运行栈。

PaperBench20-paper full split让长时程代理从零理解并复现一篇前沿 AI 论文的代码、实验与核心结果。20 篇论文Replication ScoreOpenAI13.2% ± 0.3o1 (high)

Benchmark file / paperbench

它具体在测什么?

代理获得论文、作者补充说明和计算环境,在最长数小时内搭建代码库、运行实验并提交日志。评分不只看代码能否运行,还按作者参与制定的 rubric 判断结果是否真正复现。

数据规模
20 个 ICML 2024 Spotlight/Oral 论文复现任务,共 8,316 个可二元评分的 rubric 叶节点。
评测指标
叶节点 pass/fail,沿 rubric 树加权聚合为单次 Replication Score,再对 20 篇论文取平均。
当前开放性
任务、rubric、运行代码通过 openai/frontier-evals 与 Git LFS 公开;部分论文仍依赖受限数据或外部 API。

Data example

Illustrative schema

数据结构示例PaperBench

{
  "input": {"paper_pdf": "ICML paper", "runtime": "Ubuntu + A10"},
  "submission": {"codebase": "files", "script": "reproduce.sh"},
  "rubric": [
    {"type": "result_match", "weight": 0.5},
    {"type": "execution", "weight": 0.3},
    {"type": "code_quality", "weight": 0.2}
  ]
}

说明性结构,不展示任一任务的保留 rubric 或复现答案。

How it was built

4 steps

构建思路PaperBench

  1. 01

    选择 20 篇 ICML 2024 Spotlight/Oral 论文,并为每篇准备作者补充说明。

  2. 02

    至少一位原作者参与把“复现论文”拆成可快速判断的加权 rubric 叶节点。

  3. 03

    代理在干净 VM 中提交代码、reproduce.sh 与日志,先执行再交给 SimpleJudge 审阅。

  4. 04

    用人类评分的部分复现构建 JudgeEval,验证自动 judge 的准确率与 macro-F1。

Reported evaluations

3 records

相关评测PaperBench

实验室模型成绩口径 / 设置来源
OpenAIo1 (high)13.2% ± 0.3BasicAgent;20 papers × 3 runs;单 A10;允许网络;12 小时。2025-04-02(新窗口打开)
OpenAIo1 (high)24.4% ± 0.7IterativeAgent;12 小时;与 BasicAgent 是不同 scaffold。2025-04-02(新窗口打开)
OpenAIGPT-4o4.1% ± 0.1BasicAgent;20 papers × 3 runs;单 A10;允许网络;12 小时。2025-04-02(新窗口打开)
Read with care

8,316 是 rubric 叶节点,不是独立论文任务。分数对 scaffold、prompt、网络、GPU 与时间预算极敏感;后续 10-paper 子集也不能与完整 20-paper 榜直接比较。

SWE-LancerFull 1,488 / offline public 463用真实付费自由职业任务,评估编码代理的解决率与可创造的经济价值。1,488 原始题Pass@1 / Earn rateOpenAI32.9% / 38.0% earno1 (high)

Benchmark file / swe-lancer

它具体在测什么?

任务来自 Expensify 在 Upwork 上已由工程师完成的真实工作,包含直接修改代码的 IC SWE 与从多份方案中作选择的 SWE Manager。除通过率外,还以原任务奖金计算 dollars earned。

数据规模
论文 Full 为 1,488 题、总奖金 US$1M;当前离线公开集为 463 题(198 IC + 265 manager)。
评测指标
IC 要求隐藏端到端测试全部通过;Manager 要匹配原经理选择;同时报告赚取奖金及 earned / total payout。
当前开放性
原始 1,488 题未全部开放;2025-07 后公开 463 题,IC 环境改造成可离线执行。

Data example

Illustrative schema

数据结构示例SWE-Lancer

{
  "question_id": "illustrative_issue_001",
  "variant": "ic_swe",
  "price_usd": 1000,
  "set": "diamond",
  "title": "Fix inconsistent settings validation",
  "codebase_checkpoint": "pre-fix commit",
  "grader": "hidden Playwright tests"
}

说明性字段,不包含真实 Upwork 题面、代码、gold patch 或隐藏测试。

How it was built

4 steps

构建思路SWE-Lancer

  1. 01

    从 Expensify 已付费解决的 Upwork 软件工程任务及其历史代码状态中抽样。

  2. 02

    100 名专业工程师复核任务与环境,并为 IC 题编写端到端 Playwright 测试。

  3. 03

    IC 测试经过三重核验;Manager 标签来自原经理选择并由额外专家验证。

  4. 04

    2025 更新将可公开 IC split 改造成离线环境,减少网络与依赖漂移。

Reported evaluations

2 records

相关评测SWE-Lancer

实验室模型成绩口径 / 设置来源
OpenAIo1 (high)32.9% / 38.0% earn论文 Full 1,488;Docker、无网络、basic scaffold;单次 pass@1。2025-02-18(新窗口打开)
OpenAIGPT-4o23.3% / 30.4% earn论文 Full 1,488;gpt-4o-2024-08-06;单次 pass@1。2025-02-18(新窗口打开)
Read with care

“1,488 题 / US$1M”与“公开 463 题”是不同快照;运行环境、单次采样与 dataset revision 都会改变结果。任务集中于一个代码库,也限制跨技术栈外推。

GeneBench-ProFull 129 / public 10评估代理在带噪生物数据上进行多阶段统计推断、质量控制与科研决策的能力。129 题Mean pass rateOpenAI31.5%GPT-5.6 Sol Pro

Benchmark file / genebench-pro

它具体在测什么?

模型获得最少背景、数据文件、目标 estimand 和固定输出 schema,需自行完成 QC、探索、建模、诊断与迭代。合成生成过程提供可知因果真值,使复杂开放分析仍能做严格数值评分。

数据规模
129 evaluations,覆盖 10 个领域、21 个子领域;82 题经外部专家审阅,10 题公开、50 题交由 Artificial Analysis。
评测指标
每题按 exact match 与数值容差二元判定;对重复运行求题目 pass rate,再对 129 题等权平均。
当前开放性
公开包仅含 10 题;Artificial Analysis 使用 50 题,其余为内部留出,完整主结果无法由第三方独立复现。

Data example

Illustrative schema

数据结构示例GeneBench-Pro

{
  "input": {
    "files": ["clinical.tsv", "assay.tsv"],
    "target_estimand": "benefit-risk decision"
  },
  "output": {"effect_pp": "<float>", "risk_pp": "<float>"},
  "reasoning": "<method and QC summary>"
}

从官方案例抽象出的输出结构,不含数据文件、题目细节或 ground truth。

How it was built

4 steps

构建思路GeneBench-Pro

  1. 01

    以可控生成过程合成真实感强的数据,从而保留完整因果结构与数值真值。

  2. 02

    只提供最低限度背景、目标 estimand 与固定 schema,让代理自主选择分析路线。

  3. 03

    通过 frontier-model pilots、轨迹审计与外部专家复核排除泄漏、捷径和不可识别目标。

  4. 04

    在无网络容器中提供 Python、R、PLINK 2.0 与常见生信统计包,重复运行后严格判分。

Reported evaluations

3 records

相关评测GeneBench-Pro

实验室模型成绩口径 / 设置来源
OpenAIGPT-5.6 Sol Pro31.5%完整 129 题;Pro / Extended;每题 5 attempts。2026-06-30(新窗口打开)
OpenAIGPT-5.6 Sol28.7%完整 129 题;max reasoning;每题 10 attempts。2026-06-30(新窗口打开)
OpenAIGPT-5.6 Luna16.5% / 10.8%论文 full/max 为 16.5%;7 月发布页为 10.8%,官方未解释差异。2026-07-09(新窗口打开)
Read with care

仅 10/129 题公开,且真实感合成数据并非真实患者或实验数据。Luna 的论文 16.5% 与发布页 10.8% 存在未解释冲突,必须保留两套 provenance。

LifeSciBench2026 preprint用开放回答与异构附件,测试真实生命科学研究中的证据综合、实验设计和转化判断。750 题Rubric score / Pass rateOpenAI0.576 / 36.1%GPT-Rosalind

Benchmark file / lifescibench

它具体在测什么?

题目覆盖分析、实验设计、优化、证据综述与科学沟通,常包含表格、图像、序列或结构文件。模型单轮作答,由专家细粒度 rubric 衡量科学主张、计算、决策与不确定性。

数据规模
750 个专家题、1,062 个 artifacts、19,020 条 rubric criteria;173 位科学家撰写、453 位独立专家复核。
评测指标
Normalized Rubric Score 为所得 rubric points / 总分;达到每题 70% 阈值计入 Task Pass Rate,750 题等权。
当前开放性
论文与项目页公开,但未发现完整任务、rubric、grader 代码、数据下载页或官方 GitHub。

Data example

Illustrative schema

数据结构示例LifeSciBench

{
  "workflow": "Analysis",
  "prompt": "Analyze the supplied spatial assay and recommend targets.",
  "artifacts": ["matrix.h5", "spatial.tar.gz"],
  "expected": [
    "cluster annotations", "effect estimates",
    "recommendation", "limitations"
  ],
  "grading": "task-specific expert rubric"
}

由论文公开任务类型压缩而成,不包含真实附件、参考答案或评分细则。

How it was built

4 steps

构建思路LifeSciBench

  1. 01

    173 位具 PhD 训练及生物技术/制药经验的科学家按真实工作流撰写任务。

  2. 02

    题目可附异构研究材料,并要求像科研合作者一样给出自由回答与明确限制。

  3. 03

    每题经历自动自查和至少两轮专家复核,被接受题平均经历六轮自动审查。

  4. 04

    专家编写细粒度 rubric,独立专家再验证任务的现实性、科学性与可评分性。

Reported evaluations

3 records

相关评测LifeSciBench

实验室模型成绩口径 / 设置来源
OpenAIGPT-Rosalind0.576 / 36.1%论文单轮、允许浏览;normalized rubric score / task pass rate。2026-06-17(新窗口打开)
OpenAIGPT-5.50.519 / 25.7%论文单轮、允许浏览;normalized rubric score / task pass rate。2026-06-17(新窗口打开)
OpenAIGPT-5.6 Sol59.9%发布页只称 eval score,未明示 metric 或完整 harness;不可当作 pass rate。2026-07-09(新窗口打开)
Read with care

完整数据与 grader 未公开,主结果难以外部复现;单轮评测也弱化了真实科研的多轮迭代。GPT-5.6 发布页百分比未命名指标,不能与论文 pass rate 混排。

BioMysteryBenchv11 · 2026-07让代理从原始真实生物数据出发,自主选择工具与分析路径,回答有客观真值的研究问题。90 题 · 155 GBFinal-answer accuracyAnthropic82.6% / 29.6%Claude Mythos Preview

Benchmark file / biomysterybench

它具体在测什么?

模型在容器中处理 WGS、RNA-seq、单细胞、甲基化、蛋白组或结构生物学数据,可安装工具并访问白名单权威数据库。评分只看最终生物学答案,不强制复现作者方法。

数据规模
v11 为 90 题,其中 73 题至少被一位人类专家解出、17 题未被专家组解出;发布实验使用的是旧 99 题版。
评测指标
原始实验每题 5 次,分别汇总 human-solvable 与 human-difficult 子集,并观察每题 0/5–5/5 的稳定性。
当前开放性
5 题 preview 完全公开;90 题 full 可申请 evaluation-only 访问,明确禁止训练、微调、强化、蒸馏或再分发。
Paper未公开
GitHub未公开

Data example

Illustrative schema

数据结构示例BioMysteryBench

{
  "id": "illustrative_bio_001",
  "question": "Identify the organism represented by the supplied data.",
  "files": ["structure.cif"],
  "allowed_domains": ["ncbi.nlm.nih.gov", "uniprot.org"],
  "answer_rubric": "exact binomial name; no accession lookup",
  "human_solvable": "yes"
}

说明性字段;不包含 full split 的题面、数据、答案或可反查 accession。

How it was built

5 steps

构建思路BioMysteryBench

  1. 01

    领域专家从真实多组学与结构生物学数据设计有客观答案的问题。

  2. 02

    每题作者提交验证 notebook,证明信号可观测,但不要求模型采用同一路线。

  3. 03

    匿名化数据并禁止通过 accession 反查原研究,同时允许正常使用参考数据库。

  4. 04

    代理在受限容器中可安装分析工具,并只访问白名单权威站点。

  5. 05

    每题最多由 5 名领域专家建立人类基线,最终答案采用 method-agnostic 评分。

Reported evaluations

2 records

相关评测BioMysteryBench

实验室模型成绩口径 / 设置来源
AnthropicClaude Mythos Preview82.6% / 29.6%旧 99 题版;76 verified / 23 hard;每题 5 次;非 v11。2026-04-21(新窗口打开)
AnthropicClaude Opus 4.778.9% / 20.9%旧 99 题版;76 verified / 23 hard;每题 5 次;非 v11。2026-04-21(新窗口打开)
Read with care

v11 在答案审计后由 99 题缩为 90 题,旧成绩不能迁移成 v11 分数。“Hard”只表示专家组未解出;数据库白名单、工具安装、时限与 scaffold 都会影响结果。

BloomAnthropic 2025 release把研究者定义的行为自动转成多样交互场景,测量目标模型出现该行为的频率与强度。动态生成Elicitation rateAnthropicSpearman ρ=0.86Claude Opus 4.1 judge

Benchmark file / bloom-behavioral-evals

它具体在测什么?

Bloom 不是固定题库,而是从行为定义、示例和 seed 配置生成评测套件,再驱动目标模型完成多轮 rollout,并由 judge 与 meta-judge 评分。发布包附四个固定行为套件。

数据规模
发布时有 4 个固定行为套件、16 个模型;每套 100 个 rollout、重复 3 次。验证另覆盖 10 种 quirky behavior。
评测指标
behavior_presence ≥7/10 的 rollout 比例;同时报告平均存在度、unrealism、evaluation awareness 与 invalidity。
当前开放性
代码与配置以 MIT 许可公开,可导出 Inspect transcripts;原仓库已冻结并迁往 Meridian Labs,适合作为版本归档。

Data example

Illustrative config

数据结构示例Bloom

behavior: self-preferential-bias
ideation:
  model: claude-opus-4.1
  num_scenarios: 100
rollout:
  target: claude-sonnet-4
  max_turns: 2
judgment: {scale: "0–10", threshold: 7}

压缩后的说明性 seed;引用任何 Bloom 分数时都应同时公开实际 seed 与模型配置。

How it was built

5 steps

构建思路Bloom

  1. 01

    Understanding 阶段把行为描述与示例轨迹转成边界清晰的测量说明。

  2. 02

    Ideation 自动生成角色、情境、提示、工具与变化维度。

  3. 03

    Rollout 让目标模型与模拟用户或工具并行完成多轮交互。

  4. 04

    Judge 评行为存在度与质量维度,meta-judge 汇总整个 suite。

  5. 05

    Seed 固化行为定义、示例与各阶段模型配置,使一次生成可追溯。

Reported evaluations

2 records

相关评测Bloom

实验室模型成绩口径 / 设置来源
AnthropicClaude Opus 4.1 judgeSpearman ρ=0.8640 条 transcript、12 种行为;与人工评分相关性。2025-12-19(新窗口打开)
AnthropicBloom validation suite9 / 10 behaviors每版本 50 rollouts、重复 3 次;区分刻意行为模型与 production baseline。2025-12-19(新窗口打开)
Read with care

绝对分数随 seed、对话长度、judge 及 reasoning effort 变化,跨 seed 不可直接比较。judge 与目标同家族会产生 evaluator coupling,场景真实性也需看二级诊断。

SCONE-bench417-task snapshot在隔离的历史链分叉中,评估代理识别智能合约漏洞并产出可验证测试结果的能力。417 题Success rate / simulated valueAnthropic12 / 12Claude Mythos Preview

Benchmark file / scone-bench

它具体在测什么?

每题重放一个已公开事故发生前的链上状态,代理只在本地分叉和测试资产上工作。grader 在干净重启的环境中验证结果,并以成功题数和模拟资产变化做汇总。

数据规模
当前仓库 417 题:405 个 2020–2025 历史事故,加 12 个晚于被测模型知识截止日的 2026 子集。
评测指标
主指标为成功题数、Best@8 attack success rate 与隔离环境中的模拟资产增量;历史美元值按事故日汇率折算。
当前开放性
数据与 harness 以 Apache-2.0 公开但已停止维护;运行需 Docker、历史归档 RPC、API 凭证及较大算力。

Data example

Safe illustrative schema

数据结构示例SCONE-bench

{
  "case_id": "historical_case_<id>",
  "source": "public incident archive",
  "chain": "local-evm-fork",
  "snapshot": "pre-incident block",
  "target": "redacted test contract",
  "environment": "isolated; no real assets",
  "grader": "clean-fork state-change check"
}

仅展示隔离评测元数据;不含合约地址、漏洞机制、攻击代码或可用于真实目标的操作步骤。

How it was built

5 steps

构建思路SCONE-bench

  1. 01

    从公开事故复现材料整理已知被利用合约及其事故前区块状态。

  2. 02

    每题在本地 Anvil 历史分叉运行,隔离真实网络、账户与资产。

  3. 03

    代理在固定工具和时间预算内提交测试产物,不提供真实目标操作路径。

  4. 04

    grader 在干净重启的分叉验证状态变化,避免通过预先污染环境作弊。

  5. 05

    将结果按原始 405、post-cutoff 与新增 12 题分开汇总,并记录 Best@N 与预算。

Reported evaluations

2 records

相关评测SCONE-bench

实验室模型成绩口径 / 设置来源
AnthropicClaude Mythos Preview12 / 122026 post-cutoff 子集;Best@8;本地历史链分叉;模拟价值 $35M。2026-05-22(新窗口打开)
AnthropicClaude Opus 4.513 / 20 (65%)知识截止日之后的旧 post-cutoff 子集;Best@8;模拟价值 $3.7M。2025-12-01(新窗口打开)
Read with care

这是高度双用途评测,只应在隔离模拟环境中运行。样本先验上都是已知事故,不能推断普通合约漏洞率;405、417 与 12 题子集及不同时间预算也不可混排。

MCP-Atlas1,000-task full / 500 public衡量模型能否发现正确 MCP 工具、填写参数、跨服务器执行工作流并综合结果。1,000 题Claim coverage / Pass rateAnthropic77.3%Claude Opus 4.7

Benchmark file / mcp-atlas

它具体在测什么?

自然语言目标不会告诉模型该用哪个 server 或 tool,且工具目录混有语义相近的干扰项。系统需完成多步调用、从错误中恢复,并在最终答案覆盖预先拆分的事实 claims。

数据规模
论文为 1,000 题、36 个真实 MCP server、220 tools;500 public + 500 private。当前仓库工具目录已演化到 307 个。
评测指标
最终答案对 ground-truth claims 的覆盖率;coverage 达到 0.75(另报 0.50)计 pass,并诊断 11 类工具与认知错误。
当前开放性
公开 500 题、Docker harness 与 claim evaluator;私有 500 题保留给榜单,部分 server 还需要 API key 或数据配置。

Data example

Illustrative schema

数据结构示例MCP-Atlas

{
  "task_id": "illustrative_mcp_001",
  "prompt": "Compare two public facts and compute the difference.",
  "enabled_tools": ["search", "repository", "calculator"],
  "gt_claims": [
    "Source A establishes fact one.",
    "Source B establishes fact two.",
    "The computed difference is correct."
  ]
}

说明性任务,保留字段关系但不复制 public split 的真实问题或参考 claims。

How it was built

5 steps

构建思路MCP-Atlas

  1. 01

    专家编写并验证自然语言任务,不在 prompt 中泄露 server、tool 或参数。

  2. 02

    每题通常需要 3–6 次调用,并加入语义相近的 distractor tools。

  3. 03

    真实 MCP server 固定版本后在 Docker sandbox 运行,覆盖搜索、代码、数据库与生产力工具。

  4. 04

    把参考答案拆成原子 claims,允许不同的有效调用轨迹,以最终覆盖率评分。

  5. 05

    用 11 类 taxonomy 标记发现、参数、语法、恢复、综合与停止时机等失败。

Reported evaluations

3 records

相关评测MCP-Atlas

实验室模型成绩口径 / 设置来源
AnthropicClaude Opus 4.777.3%Scale AI refreshed judge + retry harness;adaptive thinking、max effort;标准榜设置。2026-04-21(新窗口打开)
AnthropicClaude Opus 4.779.5%Scale AI 扩展配置:max effort、256 turns、100 tools;非标准榜预算。2026-04-21(新窗口打开)
AnthropicClaude Opus 4.675.8%Scale AI refreshed judge + retry harness;与 2026-04 刷新后结果同口径。2026-04-21(新窗口打开)
Read with care

创建方是 Scale AI,不是 Anthropic。外部 API 与网络会漂移;public/full、220/307 tools、标准/扩展预算及 judge 刷新前后的成绩必须分开。

DeepSearchQA900-task release测试研究代理能否系统检索分散网页、去重消歧,并找全单一答案或答案集合。900 题Answer-set F1Anthropic95.1% ± 1.2 F1Claude Mythos Preview

Benchmark file / deepsearchqa

它具体在测什么?

题目通常形成依赖链:后一步筛选依赖前一步找到的实体集合。模型必须在开放搜索空间中决定何时停止,并以精确集合回答,而非只写一份看似完整的研究报告。

数据规模
900 个专家手工任务、17 个领域;约 65% 为 Set Answer,其余为 Single Answer。
评测指标
Gemini 2.5 Flash autorater 对齐预测与参考实体,计算 precision、recall、F1,并分类 Fully Correct、Incorrect 与 Excessive Answers。
当前开放性
完整 900 题在 Google Hugging Face 与 Kaggle 公开,数据页标注 Apache-2.0;未发现独立官方 GitHub harness。

Data example

Illustrative schema

数据结构示例DeepSearchQA

{
  "problem": "Find all entities satisfying conditions across sources A–C.",
  "problem_category": "Politics & Government",
  "answer_type": "Set Answer",
  "answer": ["<entity one>", "<entity two>"],
  "evaluation": "precision / recall / F1"
}

说明性结构,不复刻公开集的真实问题、答案或网页线索。

How it was built

4 steps

构建思路DeepSearchQA

  1. 01

    专家手工编写必须从开放网页汇集多个分散事实的问题。

  2. 02

    让后续筛选依赖前一步实体集合,形成有序的检索与推理链。

  3. 03

    以客观单答案或完整集合建立 ground truth,强调汇总、消歧与停止判断。

  4. 04

    autorater 对齐答案实体并计算 precision、recall 与 F1,同时标注漏答和过度罗列。

Reported evaluations

3 records

相关评测DeepSearchQA

实验室模型成绩口径 / 设置来源
AnthropicClaude Mythos Preview95.1% ± 1.2 F1web search/fetch + programmatic tools;总 compaction 上限 10M tokens。2026-04-21(新窗口打开)
AnthropicClaude Opus 4.691.3% ± 1.6 F1web search/fetch + programmatic tools;50k 触发 compaction。2026-04-21(新窗口打开)
AnthropicClaude Opus 4.789.1% ± 1.8 F1web search/fetch + programmatic tools;200k 触发 compaction。2026-04-21(新窗口打开)
Read with care

题目与答案完全公开且网页会变化,污染与时间漂移并存。分数对搜索供应商、token/compaction 预算极敏感;autorater 的实体对齐也可能改变 F1。

OfficeQA / OfficeQA ProPro 133 / Full 246在真实长文档与复杂表格中完成检索、跨期综合和精确数值计算。133 Pro / 246 FullExact-match accuracyAnthropic80.6% Pro / 86.3% FullClaude Opus 4.7

Benchmark file / officeqa-pro

它具体在测什么?

语料来自近一个世纪的美国 Treasury Bulletin。代理需定位正确文件、页码、表格和数值,再跨段落或跨期做推导;PDF、版面 JSON 与清洗文本三种表示可用于比较检索难度。

数据规模
OfficeQA Pro 133 题,Full 246 题;语料横跨 1939–2025,约 89,000 页、超过 2,600 万个数值。
评测指标
答案准确率;数值题可配置 0%、0.1%、1% 或 5% 相对误差。Anthropic 系统卡结果使用 0% 容差。
当前开放性
语料、解析脚本与 reward 代码公开;问题/答案 CSV 需在 Hugging Face 申请,以降低网页代理直接检索答案的风险。

Data example

Illustrative schema

数据结构示例OfficeQA / OfficeQA Pro

{
  "uid": "officeqa_<id>",
  "question": "Compute the requested change from cited issues.",
  "answer": "<numeric result>",
  "source_docs": ["treasury_bulletin_<date>.pdf"],
  "representation": "PDF | parsed JSON | text",
  "difficulty": "hard"
}

说明性字段,不泄露 gated 题面、答案、来源定位或计算结果。

How it was built

4 steps

构建思路OfficeQA / OfficeQA Pro

  1. 01

    整理美国 Treasury Bulletin 历史 PDF 及其版面 JSON 与清洗文本表示。

  2. 02

    编写需要精确抽取、跨章节或跨期综合、表格定位和数值推导的题目。

  3. 03

    以可自动验证的答案建立 Pro frontier 子集与包含较易题的 Full 集。

  4. 04

    reward 支持精确匹配和多档相对误差,发布成绩时必须绑定文档表示与 tolerance。

Reported evaluations

2 records

相关评测OfficeQA / OfficeQA Pro

实验室模型成绩口径 / 设置来源
AnthropicClaude Opus 4.780.6% Pro / 86.3% Fullbenchmark harness;exact match;0% allowable relative error。2026-04-21(新窗口打开)
AnthropicClaude Opus 4.657.1% Pro / 73.5% Fullbenchmark harness;exact match;0% allowable relative error。2026-03-09(新窗口打开)
Read with care

创建方是 Databricks,不是 Anthropic。单一美国财政文档域限制外推;PDF/JSON/TXT 表示、舍入与误差阈值都会显著改变 exact-match 成绩。

SWE-bench Verified / SWE-Bench ProVerified 500 / Pro public 731让编码代理修复真实 GitHub issue,并用隐藏测试验证补丁是否完整且无回归。500 / 731 题Resolved rateOpenAI64.6% ProGPT-5.6 SolAnthropic95.5% Verified / 80.3% ProClaude Mythos 5

Benchmark file / swe-bench-verified-pro

它具体在测什么?

每题固定 issue、仓库与 base commit,模型提交 patch 后必须让目标失败测试通过且保留既有测试。Verified 是人工复核子集,Pro 扩大了仓库和题型覆盖,但两者都在 2026 审计中暴露严重质量问题。

数据规模
原始 SWE-bench 2,294 题;Verified 从 1,699 个候选中人工保留 500 题;SWE-Bench Pro public split 731 题。
评测指标
FAIL_TO_PASS 全部转为通过且 PASS_TO_PASS 继续通过才算 resolved;必须记录 harness、预算、工具、尝试数、镜像与 test patch。
当前开放性
框架与 Verified 数据公开;样本代码受各上游仓库许可约束。两套数据均应保留历史分数,但默认退出当前综合榜。

Data example

Illustrative schema

数据结构示例SWE-bench Verified / SWE-Bench Pro

{
  "instance_id": "org__repo-1234",
  "repo": "org/repo",
  "base_commit": "<commit>",
  "problem_statement": "A documented behavior fails under X.",
  "gold_patch": "<hidden>",
  "FAIL_TO_PASS": ["tests/test_feature.py::test_x"],
  "PASS_TO_PASS": ["tests/test_existing.py::test_y"]
}

说明性字段,不含真实 issue、gold patch、测试补丁或仓库特异线索。

How it was built

4 steps

构建思路SWE-bench Verified / SWE-Bench Pro

  1. 01

    从真实 GitHub issue、修复 PR/commit 与可执行测试中构造固定仓库快照。

  2. 02

    以 FAIL_TO_PASS 和 PASS_TO_PASS 同时验证目标修复与回归安全。

  3. 03

    Verified 让每题由 3 名软件工程师复核可解性、题面与测试一致性。

  4. 04

    2026 年分别审计 Verified 与 Pro,记录缺陷、污染迹象并撤回当前主榜推荐。

Reported evaluations

3 records

相关评测SWE-bench Verified / SWE-Bench Pro

实验室模型成绩口径 / 设置来源
OpenAIGPT-5.6 Sol64.6% ProSWE-Bench Pro;发布页历史值;2026-07 审计后不再视为可信主榜。2026-07-09(新窗口打开)
AnthropicClaude Mythos 595.5% Verified / 80.3% Pro标准配置、平均 5 次;做过 memorization screening;两版本不可混排。2026-06-09(新窗口打开)
AnthropicClaude Opus 4.888.6% Verified / 69.2% Proadaptive thinking、max effort、默认采样;平均 5 次;版本分栏。2026-05-28(新窗口打开)
Read with care

两套数据都不应进入当前综合排名:Verified 失败题审计中至少 59.4% 有实质缺陷;Pro 人工审计认定 249/731(34.1%)有问题,OpenAI 估计整体约 30% broken 并撤回推荐。

Terminal-Bench2.1在隔离 Linux 环境中完成软件工程、系统管理、机器学习与数据处理等长链路任务。89 题Mean rewardOpenAI88.8% / 91.9%GPT-5.6 Sol / UltraAnthropic88.0 mean rewardClaude Mythos 5

Benchmark file / terminal-bench-2-1

它具体在测什么?

每题包含自然语言说明、独立容器、资源和超时约束、可执行 grader 及维护者 oracle。模型通过终端操作真实软件栈,最终按测试结果给 binary 或 partial reward。

数据规模
2.1 有 89 个唯一任务,并修复 2.0 中 28/89 题的依赖漂移、资源规格或题面/测试错配。
评测指标
报告 mean reward / task pass rate;若 grader 支持部分奖励应保留原 reward,并绑定 harness、parser、资源、超时与重复次数。
当前开放性
主框架 Apache-2.0;各任务容器中的第三方软件仍遵循各自许可,外部依赖可能继续漂移。

Data example

Illustrative schema

数据结构示例Terminal-Bench

instruction: "Configure the supplied service to satisfy the tests."
environment:
  dockerfile: "Dockerfile"
  resources: {cpu: 4, memory: "8Gi"}
tests: "tests/test_outputs.py"
timeout: "<task-specific>"
oracle_solution: "<maintainer-only artifact>"

说明性结构,不提供真实 oracle、测试答案或某一任务的执行捷径。

How it was built

4 steps

构建思路Terminal-Bench

  1. 01

    为每题编写真实终端任务、独立容器、资源/超时约束和人工 oracle solution。

  2. 02

    用可执行 grader 验证最终环境或产物,并保留任务支持的 partial reward。

  3. 03

    通过连续验证发现依赖、资源与题面/测试错配,2.1 修复其中 28 题。

  4. 04

    发布结果时固定 agent harness、parser、云实例、内存、超时倍率与重复次数。

Reported evaluations

3 records

相关评测Terminal-Bench

实验室模型成绩口径 / 设置来源
OpenAIGPT-5.6 Sol / Ultra88.8% / 91.9%Terminal-Bench 2.1;发布页未完整披露基础设施与 harness 细节。2026-07-09(新窗口打开)
AnthropicClaude Mythos 588.0 mean rewardmini-SWE-agent;high effort;89 题 × 5 = 445 trials。2026-06-09(新窗口打开)
AnthropicClaude Opus 4.882.7 mean rewardmini-SWE-agent;high effort;同卡重跑;89 题 × 5 trials。2026-06-09(新窗口打开)
Read with care

2.0 与 2.1 改了 28 题,不能直接比较。harness、等待策略与基础设施噪声可造成约 6pp 波动,2.1 修订甚至让同一模型/agent 变化超过 12pp。

GPQA DiamondDiamond 198用难以靠简单检索解决的生物、物理和化学多选题,测量专家级科学推理。198 题4-choice accuracyOpenAI94.6%GPT-5.6 SolAnthropic94.1%Claude Mythos 5

Benchmark file / gpqa-diamond

它具体在测什么?

题目由领域专家撰写,并同时让其他专家和熟练非专家验证。Diamond 只保留两位专家都答对、但多数非专家答错的高难样本,评测时需随机化选项顺序。

数据规模
完整 GPQA 为 448 题;Diamond 为 198 题。论文专家正确率约 65%,熟练非专家在可联网且投入较长时间时约 34%。
评测指标
四选一准确率;应报告重复次数、是否使用工具、提示模板与 choice shuffle seed。
当前开放性
代码仓库 MIT;数据需同意访问条件,官方 zip 也采用密码保护以减少无意训练污染。

Data example

Illustrative schema

数据结构示例GPQA Diamond

{
  "question": "<graduate-level science question>",
  "correct_answer": "<answer>",
  "distractors": ["<A>", "<B>", "<C>"],
  "explanation": "<expert rationale>",
  "choice_order": "randomized at evaluation"
}

说明性字段,不复制 gated 数据中的真实题目、答案或专家解释。

How it was built

4 steps

构建思路GPQA Diamond

  1. 01

    领域专家撰写问题、正确答案、三个干扰项与解释。

  2. 02

    另一批专家和有能力的非专家在允许检索的条件下独立验证。

  3. 03

    Diamond 只保留两名专家均答对而多数非专家答错的题目。

  4. 04

    评测时随机化正确答案位置,并记录提示、工具、重复次数与随机种子。

Reported evaluations

3 records

相关评测GPQA Diamond

实验室模型成绩口径 / 设置来源
OpenAIGPT-5.6 Sol94.6%官方 Academic 表;更细 sampling 与工具参数未公开。2026-07-09(新窗口打开)
AnthropicClaude Mythos 594.1%标准配置、平均 5 次;发布方认为该基准已接近饱和。2026-06-09(新窗口打开)
AnthropicClaude Opus 4.893.6%198 题;平均 25 trials。2026-05-28(新窗口打开)
Read with care

仅 198 题使置信区间较宽,静态题也有污染风险。前沿模型已集中在约 94%,区分度接近耗尽;Anthropic 已表示计划停止未来报告。

OSWorld 2.02.0 · 108 workflows让视觉代理在真实 Ubuntu、浏览器与办公应用中完成长链路专业工作流。108 工作流Binary / partial rewardOpenAI62.6%GPT-5.6 SolAnthropic83.4%Claude Opus 4.8

Benchmark file / osworld-2

它具体在测什么?

v2 使用真实输入文件、有状态用户配置、自托管动态网站和隐藏终态检查。任务平均超过 250 步、约 27 个 checkpoint,主设置允许最多 500 步。

数据规模
108 个长链路工作流、31 个自托管网站、7 个专业领域/21 子类;69.6% 的任务人类需超过一小时。
评测指标
binary completion 要求全部必要终态成立;partial reward 是 checkpoint 加权完成度,两种百分比必须分栏。
当前开放性
代码与数据页标注 Apache-2.0;任务类型 gated,且完整运行依赖应用、网站、凭据与大量初始化资产。

Data example

Illustrative schema

数据结构示例OSWorld 2.0

{
  "task_id": "workflow_001",
  "initial_state": "<profile and app setup>",
  "instruction": "Update supplied artifacts and record the result.",
  "checkpoints": [
    {"id": "cp1", "evaluator": "<hidden state>", "weight": 0.2},
    {"id": "cp2", "evaluator": "<hidden final state>", "weight": 0.8}
  ]
}

说明性结构,不含 gated 工作流、凭据、真实资产或隐藏 evaluator 实现。

How it was built

4 steps

构建思路OSWorld 2.0

  1. 01

    为真实 Ubuntu 应用和 31 个自托管网站准备带状态的用户环境与输入资产。

  2. 02

    编写跨应用长链路工作流,并把必要中间态与终态拆成隐藏 checkpoint。

  3. 03

    允许最多 500 步,通过环境状态而非表面文本判断任务是否完成。

  4. 04

    分别聚合 binary completion 与 checkpoint partial reward,记录分辨率和 action budget。

Reported evaluations

2 records

相关评测OSWorld 2.0

实验室模型成绩口径 / 设置来源
OpenAIGPT-5.6 Sol62.6%OSWorld 2.0;OpenAI 表未命名指标;与项目表对照推断为 partial reward。2026-07-09(新窗口打开)
AnthropicClaude Opus 4.883.4%OSWorld-Verified(v1 血缘,非 v2);361 题、1080p、100 actions、平均 5 次。2026-05-28(新窗口打开)
Read with care

62.6% 的指标名是来源对照后的推断,需在 UI 明示;Anthropic 83.4% 属于 v1 Verified,绝不能与 v2 同列排名。分辨率、动作协议、预算和网站状态都会改分数。

Humanity’s Last ExamStatic 2,500用全球专家编写的高难文字与多模态问题,测试跨学科知识、推理和 agentic search。2,500 题Accuracy / calibrationOpenAI43.1% / 57.2%GPT-5.5 ProAnthropic49.8% / 57.9%Claude Opus 4.8

Benchmark file / humanitys-last-exam

它具体在测什么?

静态 HLE 混合多项选择与短答案,覆盖数学、自然科学和人文等领域。题目追求精确、无歧义且难以简单检索;with-tools 设置还检验搜索、抓取、代码执行与上下文管理。

数据规模
最终静态版 2,500 题,包含文字与多模态、多选与短答案;后续 HLE-Rolling 是会变化的独立集合。
评测指标
多选通常精确评分,短答案由 grader 按 rubric 判断;另报 calibration error,并严格分开 no-tools 与 with-tools。
当前开放性
评测代码 MIT;数据需接受访问条件,数据卡要求不要再分发。静态题已有污染和网页答案泄漏风险。

Data example

Illustrative schema

数据结构示例Humanity’s Last Exam

{
  "id": "<id>",
  "question": "<expert-authored question>",
  "image": "<optional gated asset>",
  "answer_type": "multiple_choice | short_answer",
  "answer": "<hidden during evaluation>",
  "rationale": "<expert rationale>",
  "category": "<subject>"
}

说明性字段,不复制访问受限题目、答案、图像或专家 rationale。

How it was built

4 steps

构建思路Humanity’s Last Exam

  1. 01

    面向全球领域专家征集精确、无歧义且尽量难以搜索的高难题。

  2. 02

    用模型过滤与人工专家审核清理简单、含糊、可搜索或有缺陷的样本。

  3. 03

    通过 bug bounty 继续修正题目,并在 2025-04-03 冻结静态集合。

  4. 04

    多选精确评分、短答案按 rubric 判定;工具设置额外审计搜索来源与泄漏轨迹。

Reported evaluations

3 records

相关评测Humanity’s Last Exam

实验室模型成绩口径 / 设置来源
OpenAIGPT-5.5 Pro43.1% / 57.2%Static HLE;no tools / with tools;Pro 配置,完整 agent 细节未公开。2026-04-23(新窗口打开)
OpenAIGPT-5.541.4% / 52.2%Static HLE;no tools / with tools;工具栈细节未完整披露。2026-04-23(新窗口打开)
AnthropicClaude Opus 4.849.8% / 57.9%no tools / with tools;max effort;最高 1M tokens;web、程序化工具与代码执行。2026-05-28(新窗口打开)
Read with care

静态题公开后容易被训练或搜索吸收,canary 不能充分证明无污染;with-tools 还需屏蔽答案泄漏来源。grader、总 token 与工具预算不同的结果不可直接比较。

ARC-AGI-2Public 1,120 / verified-private从少量彩色网格示例推断隐藏变换,并为新输入生成逐格完全正确的输出。1,120 publicTask exact accuracyOpenAI85.0%GPT-5.5Anthropic69.17%Claude Opus 4.6

Benchmark file / arc-agi-2

它具体在测什么?

每题只给少量 input-output demonstrations,模型需识别对象、关系和变换规则,再迁移到 test grid。任务被校准为对人可解但对当前系统困难,避免依赖专有知识。

数据规模
开源仓库含 1,000 public training + 120 public evaluation;竞赛与官方验证另有约 120 题的 semi-private/private 集。
评测指标
所有 test output 的每个 cell 必须完全正确;题内任一 test 失败则整题失败。必须记录每题 attempts 与推理预算。
当前开放性
公开仓库 Apache-2.0;verified/private 任务不公开以降低针对性调参和污染。

Data example

Illustrative grid

数据结构示例ARC-AGI-2

{
  "train": [
    {"input": [[0,1],[0,0]], "output": [[1],[0]]},
    {"input": [[2,0],[2,2]], "output": [[0],[2]]}
  ],
  "test": [
    {"input": [[3,3],[0,3]], "output": "<hidden>"}
  ]
}

人为编写的微型结构示例,不是 ARC-AGI-2 公共或私有任务。真实 grid 可达 30×30。

How it was built

4 steps

构建思路ARC-AGI-2

  1. 01

    设计只需少量 demonstrations 即可归纳、且不依赖领域知识的网格变换。

  2. 02

    每题至少由两名人类在至多两次尝试内解出,确保对人类可解。

  3. 03

    以 public、semi-private 与 private split 隔离开发调参与可信验证。

  4. 04

    用逐格 exact match 判分,并将 attempts、thinking tokens 与搜索策略写入结果元数据。

Reported evaluations

2 records

相关评测ARC-AGI-2

实验室模型成绩口径 / 设置来源
OpenAIGPT-5.585.0%ARC-AGI-2 Verified;xhigh;研究评测环境可能不同于生产 API。2026-04-23(新窗口打开)
AnthropicClaude Opus 4.669.17%ARC Prize private dataset;high effort;120k thinking tokens;未专项训练。2026-02-05(新窗口打开)
Read with care

public 集容易被针对性调参;可信结果应绑定 private/verified 快照。两个厂商使用的 verified/private 集和预算并非严格同配,分数对 attempts、tokens 与程序搜索高度敏感。

GDPval-AAv2 · 220 gold tasks要求代理制作专业人士真实交付的文档、表格、幻灯片和图示,并以盲评比较成品质量。220 题Snapshot EloOpenAI1747.8 EloGPT-5.6 SolAnthropic1932 EloClaude Fable 5

Benchmark file / gdpval-aa

它具体在测什么?

任务由行业专家基于真实工作编写,包含 prompt、参考文件、参考成品和 rubric。Artificial Analysis 的 Stirrup agent 可使用 shell、文件系统与浏览器,产出文件后由匿名 pairwise judge panel 比较。

数据规模
GDPval 完整集 1,320 题、覆盖 9 行业和 44 职业;公开 gold set 220 题,GDPval-AA 与 v2 使用这 220 题。
评测指标
v2 由 3 个前沿 LLM judge 做盲式 pairwise comparison,聚合成以人类专家 1000 为锚的冻结 Elo;仅同一快照可比。
当前开放性
220 个 gold tasks 与参考文件可获取,完整 1,320 未全公开;实时模型池、judge 服务与完整执行基础设施不能仅靠数据复现。

Data example

Illustrative schema

数据结构示例GDPval-AA

{
  "task_id": "<id>",
  "sector": "<industry>",
  "occupation": "<occupation>",
  "prompt": "Create the requested professional deliverable.",
  "reference_files": ["input.xlsx"],
  "deliverable_files": ["output.xlsx"],
  "rubric": [{"criterion": "accuracy", "weight": 0.4}]
}

说明性字段,不复制 gold task 的真实题面、附件、参考成品或 rubric 内容。

How it was built

4 steps

构建思路GDPval-AA

  1. 01

    与平均约 14 年经验的行业专家合作,编写真实工作 prompt、输入和参考成品。

  2. 02

    专家同时制定任务特异 rubric,覆盖正确性、完整性与专业交付质量。

  3. 03

    Stirrup 在 sandbox 中提供 shell、文件系统和网页,v2 最多允许 250 turns。

  4. 04

    三个前沿 LLM judge 匿名比较成品,以人类专家 1000 为锚聚合当期 Elo。

Reported evaluations

3 records

相关评测GDPval-AA

实验室模型成绩口径 / 设置来源
OpenAIGPT-5.6 Sol1747.8 EloGDPval-AA v2;OpenAI 发布表冻结快照;不可与 v1 Elo 比较。2026-07-09(新窗口打开)
AnthropicClaude Fable 51932 Elo旧 GDPval-AA v1,截至 2026-06-06;含 Opus 4.8 safety fallback。2026-06-09(新窗口打开)
AnthropicClaude Opus 4.81890 Elo旧 GDPval-AA v1,截至 2026-06-06;非 v2 重新锚定结果。2026-06-09(新窗口打开)
Read with care

v1 与 v2 更换 sandbox、turn limit、judge panel 并重新锚定 Elo,1932/1890 与 1747.8 不可横比。Elo 还依赖对手池和日期,LLM judge 可能偏好特定写作或格式风格。

OpenAI MRCRv2 · 2025-12-05在超长多轮会话中精确找回第 n 次同形请求的回答,测试序数指代与抗干扰检索。2,400 rowsMean Match RatioOpenAI91.5 / 73.8GPT-5.6 SolAnthropic93.0 / 76.0Claude Opus 4.6

Benchmark file / openai-mrcr-v2

它具体在测什么?

上下文反复出现文字相同但回答不同的目标请求,并混入同分布干扰对话;结尾指定返回第几次回答并前置随机 hash。它同时检验 needle 定位和输出保真。

数据规模
2/4/8 needles × 8 个 token bins × 每组合 100 样本;使用 438 个实体与 10 种写作格式。
评测指标
以 difflib.SequenceMatcher 计算字符匹配率;缺少指定 hash 直接计 0。结果按 needle 数、token bin 与 tokenizer 分栏。
当前开放性
完整数据与说明在 Hugging Face 公开,数据卡标注 MIT;未发现 OpenAI 官方独立 GitHub。

Data example

Illustrative dialogue

数据结构示例OpenAI MRCR

User: Write a short note about topic A.
Assistant: <response 1>
… same-distribution distractor turns …
User: Write a short note about topic A.
Assistant: <response 2>
… very long context …
User: Return the second response and prepend token Z7K2.

仅展示合成任务结构;不是数据集真实 prompt、answer、实体或随机 hash。

How it was built

4 steps

构建思路OpenAI MRCR

  1. 01

    生成多个文字完全相同的目标请求,但让每次 assistant 回答不同。

  2. 02

    加入同分布干扰对话,并跨 2/4/8 needles 与 8 个长度区间采样。

  3. 03

    结尾用序数指定目标回答,并要求前置随机 hash 以检测精确定位和格式保真。

  4. 04

    用 SequenceMatcher 给部分相似度;v2 修正 needle 数量与 ground truth 错误。

Reported evaluations

3 records

相关评测OpenAI MRCR

实验室模型成绩口径 / 设置来源
OpenAIGPT-5.6 Sol91.5 / 73.8MRCR v2;8 needles;256K–512K / 512K–1M;Mean Match Ratio。2026-07-09(新窗口打开)
AnthropicClaude Opus 4.693.0 / 76.08 needles;256K / 1M bins;adaptive thinking、max effort、平均 5 次。2026-02-05(新窗口打开)
AnthropicClaude Opus 4.678.3 at 1M8 needles;1M;固定 64K extended-thinking budget;与 adaptive 配置分开。2026-02-05(新窗口打开)
Read with care

必须使用 v2:旧版约 10% 样本 needle 数超预期、约 5% ground truth 错误。它只测合成长上下文检索;tokenizer、hash 格式、thinking budget 与公开上下文上限都会影响分数。

Reading guide

如何读这份索引

01

Benchmark ≠ 模型

条目描述的是评测任务本身;模型成绩单独记录,并保留版本与运行设置。

02

开放性分级

“公开”表示题目或 harness 可获取;“部分公开”与“内部”会明确标注缺失项。

03

样例保护

为降低污染风险,本站展示字段结构或匿名化示意,不复制隐藏测试题和答案。

04

成绩需看上下文

同名 benchmark 可能因 scaffold、工具、采样次数、推理预算和版本而不可直接比较。