Skip to content
A

MCP-Atlas

MCP已核验最近更新 2026-10-04

Scale AI 面向 MCP Server 的基准:1,000 个任务、36 个服务器、220 个工具。

Scale AI 的 MCP-Atlas 跨 36 个 MCP Server 与 220 个工具、共 1,000 个任务,其官方榜单最高为 62.3%,而第三方聚合站引用的 85-88% 大多属厂商自报。

常见的错误说法: 把某个 85-88% 的 MCP 榜单数字当作该基准的权威结果来引用。

关键事实

2026 前沿Scale 官方论文最高为 62.3%(Claude Opus 4.5);第三方聚合站列出 Muse Spark 1.1 为 88.1%
可信度存在两套差异极大的数字体系。Scale 官方榜单最高约 62%,而聚合站基于厂商自报给出 85-88%。以 BenchLM 为例,其 42 行中 40 行标注为厂商自报、仅 2 行为独立评测。
核验状态已核验
来源Scale AI MCP-Atlas leaderboard

Markdown 版本(供 LLM 读取)

FAQ

MCP-Atlas 测的是什么?

Scale AI 面向 MCP Server 的基准:1,000 个任务、36 个服务器、220 个工具。

MCP-Atlas 的 2026 年前沿水平是多少?

Scale 官方论文最高为 62.3%(Claude Opus 4.5);第三方聚合站列出 Muse Spark 1.1 为 88.1%

MCP-Atlas 可信吗?

存在两套差异极大的数字体系。Scale 官方榜单最高约 62%,而聚合站基于厂商自报给出 85-88%。以 BenchLM 为例,其 42 行中 40 行标注为厂商自报、仅 2 行为独立评测。

关于 MCP-Atlas 的常见说法准确吗?

把某个 85-88% 的 MCP 榜单数字当作该基准的权威结果来引用。