高分为什么不是通用人工智能

现在的数字

数条件来源
62.7%;99.9% 同一格、两种条件,不拆开。ARC-AGI-3 半私有集:标准接口(模型自己决定把哪些笔记带到下一步)、推理强度取最高时,62.7%,约 2.6 万美元(花费 26,098 美元);保留厂商推理状态(请求之间保留外界看不到的推理状态,并用压缩来应付更长对话)、推理强度取高时,99.9%,约 1.9 万美元(花费 18,817 美元)。 ARC Prize
约 85%;低于 50%;约 37% 另一套,不放进上一格。抽象与推理语料:人类解题者平均约 85%;截至 2024 年中,领先系统低于 50%;截至 2025 年晚,前沿模型在更难的 ARC-AGI-2 上约为 37%。条件是这一套封闭格子题。标准做满不等于通用人工智能。 通用人工智能
59.3% Agents’ Last Exam。与 ARC-AGI-3 那一格分开。 OpenAI
72.6% OSWorld 2.0 模拟中约 40 分钟完成任务、得分 72.6%。 OpenAI
64.6% Terminal-Bench Science 0.1。 OpenAI

还缺什么

数条件来源
尚无 截至 2026 年 9 月,没有单一被普遍接受的定义;也没有系统获得广泛科学共识,认为已经是通用人工智能。现在大规模部署的只有狭义人工智能。标准做满不等于通用人工智能。作者写明并不主张 ARC-AGI-3 的结果就是通用人工智能。这些环境范围很窄。 通用人工智能;ARC Prize
尚无 普通人能把什么交出去。 通用人工智能

没有人能承诺日期的事

数条件来源
尚无 没有共识的预测年份。不写成承诺。 通用人工智能

这些页上出现过的机构、人和课题

下面只列这次打开的页面上出现过的机构、人和课题。不是排名,不封最权威。

Stanford HAI 关于页写出的出版物:AI Index、On the Opportunities and Risks of Foundation Models、HELM、Foundation Model Transparency Index、2025 Annual Report。

通用人工智能正文出现 AAAI、Stanford HAI、AI Impacts、Metaculus。

人物或实验室:James Landay、Russell Wald、Fei-Fei Li、John Hennessy、Percy Liang、Yejin Choi、Erik Brynjolfsson、Peter Norvig、Melissa Valentine。

OpenAI(Sam Altman、Greg Brockman)、Google DeepMind(Demis Hassabis、Shane Legg)、Meta(Yann LeCun)、Anthropic(Dario Amodei、Daniela Amodei)、xAI(Elon Musk)、François Chollet 与 ARC-AGI、Yoshua Bengio、Stuart Russell。历史:Alan Turing;1956 达特茅斯 John McCarthy、Marvin Minsky、Nathaniel Rochester、Claude Shannon;Allen Newell、Herbert Simon。

课题:加速发现、改变教育、引导对社会有益的 AI;开放科学、开放源代码、开放课程;Foundations of AI。截至 2026 年 9 月没有单一被接受的定义;没有系统获得广泛共识为通用人工智能;现在部署的是窄义 AI。DeepMind Levels of AGI 把当前前沿放在 Emerging。ARC:人类约 85%;2024 年中领先系统低于 50%;2025 年底 ARC-AGI-2 约 37%。标准饱和不等于通用人工智能。62.7% 和 99.9% 不在这一页,领域页上原有的那一格保留,两种条件仍在同一格。

来源

62.7% 与 99.9% 留在同一格,条件分别是标准接口和保留厂商推理状态。约 37% 属于 ARC-AGI-2,来自通用人工智能,不并进去。

相关概念