OfficeQA Pro
通用能力已核验最近更新 2026-10-04
面向企业级多文档落地推理,语料为美国财政部公报。
Databricks AI Research 于 2026 年 3 月 9 日发布的 OfficeQA Pro 发现,前沿模型仅凭参数知识答题的正确率不足 5%,即便提供 89,000 页原始语料,平均也只有 34.1%。
关键事实
| 2026 前沿 | 前沿模型仅凭参数知识不足 5%;给定文档后平均仅 34.1% |
|---|---|
| 可信度 | 它清晰量化了「知道」与「查得到」的差距:语料 89,000 页、2,600 万+ 数值,共 133 道题。即便把文档递给模型,前沿模型平均也仅 34.1%——对企业 RAG 规划而言,这个数字才是关键。 |
| 核验状态 | 已核验 |
| 来源 | Databricks AI Research (arXiv:2603.08655) |
FAQ
OfficeQA Pro 测的是什么?
面向企业级多文档落地推理,语料为美国财政部公报。
OfficeQA Pro 的 2026 年前沿水平是多少?
前沿模型仅凭参数知识不足 5%;给定文档后平均仅 34.1%
OfficeQA Pro 可信吗?
它清晰量化了「知道」与「查得到」的差距:语料 89,000 页、2,600 万+ 数值,共 133 道题。即便把文档递给模型,前沿模型平均也仅 34.1%——对企业 RAG 规划而言,这个数字才是关键。