Skip to content
A

OfficeQA Pro

通用能力已核验最近更新 2026-10-04

面向企业级多文档落地推理,语料为美国财政部公报。

Databricks AI Research 于 2026 年 3 月 9 日发布的 OfficeQA Pro 发现,前沿模型仅凭参数知识答题的正确率不足 5%,即便提供 89,000 页原始语料,平均也只有 34.1%。

关键事实

2026 前沿前沿模型仅凭参数知识不足 5%;给定文档后平均仅 34.1%
可信度它清晰量化了「知道」与「查得到」的差距:语料 89,000 页、2,600 万+ 数值,共 133 道题。即便把文档递给模型,前沿模型平均也仅 34.1%——对企业 RAG 规划而言,这个数字才是关键。
核验状态已核验
来源Databricks AI Research (arXiv:2603.08655)

Markdown 版本(供 LLM 读取)

FAQ

OfficeQA Pro 测的是什么?

面向企业级多文档落地推理,语料为美国财政部公报。

OfficeQA Pro 的 2026 年前沿水平是多少?

前沿模型仅凭参数知识不足 5%;给定文档后平均仅 34.1%

OfficeQA Pro 可信吗?

它清晰量化了「知道」与「查得到」的差距:语料 89,000 页、2,600 万+ 数值,共 133 道题。即便把文档递给模型,前沿模型平均也仅 34.1%——对企业 RAG 规划而言,这个数字才是关键。