OpenAI 自研短答案事实性2024完全公开SimpleQA2024-10-30用单一、稳定、可核验的短答案,测量事实正确性、幻觉与拒答校准。4,326 题Correct / F-scoreOpenAI44.8% F-scoreo1-preview
Benchmark file / simpleqa
它具体在测什么?
模型直接回答短事实问题,grader 将输出分为正确、错误或未作答。题目刻意避开会随时间变化的答案,适合观察模型在“知道”与“承认不知道”之间的取舍。
- 数据规模
- 4,326 个短事实问答;另抽样 1,000 题做第三位标注员复核,官方估计固有错误率约 3%。
- 评测指标
- 报告 overall correct、correct given attempted 与二者调和平均 F-score;不同版本也可能只报 no-web accuracy,不可混排。
- 当前开放性
- 完整测试 CSV 与参考实现公开;simple-evals 自 2025-07 起不再新增模型成绩,现为归档参考实现。
Data example
论文公开样例数据结构示例:SimpleQA
{
"question": "Who received the IEEE Frank Rosenblatt Award in 2010?",
"reference_answer": "Michio Sugeno"
}这是论文 Table 1 已公开样例,不是从新的留出集抽取。
How it was built
4 steps构建思路:SimpleQA
- 01
Trainer 浏览网页,编写只有一个无争议且长期稳定答案的短问题。
- 02
第二位 trainer 在看不到原答案时独立作答,只保留双方答案一致的题目。
- 03
多数题还需能诱发当时的 GPT-4 系列模型出错,以保持难度。
- 04
第三位 trainer 对 1,000 题抽样复核,并人工分析分歧与标签噪声。
Reported evaluations
2 records相关评测:SimpleQA
| 实验室 | 模型 | 成绩 | 口径 / 设置 | 来源 |
|---|---|---|---|---|
| OpenAI | o1-preview | 44.8% F-score | 无浏览;短答案;SimpleQA grader;correct 42.7%。 | 2024-10-30 ↗(新窗口打开) |
| OpenAI | GPT-4o | 38.4% F-score | 无浏览;短答案;SimpleQA grader;correct 38.2%。 | 2024-10-30 ↗(新窗口打开) |
它只覆盖单一短事实,不能代表长答案可靠性;公开题存在训练污染,约 3% 的固有错误估计与 LLM grader 误差也限制了分数精度。