高分为什么不是通用人工智能
现在的数字
| 数 | 条件 | 来源 |
|---|---|---|
| 62.7%;99.9% | 同一格、两种条件,不拆开。ARC-AGI-3 半私有集:标准接口(模型自己决定把哪些笔记带到下一步)、推理强度取最高时,62.7%,约 2.6 万美元(花费 26,098 美元);保留厂商推理状态(请求之间保留外界看不到的推理状态,并用压缩来应付更长对话)、推理强度取高时,99.9%,约 1.9 万美元(花费 18,817 美元)。 | ARC Prize |
| 约 85%;低于 50%;约 37% | 另一套,不放进上一格。抽象与推理语料:人类解题者平均约 85%;截至 2024 年中,领先系统低于 50%;截至 2025 年晚,前沿模型在更难的 ARC-AGI-2 上约为 37%。条件是这一套封闭格子题。标准做满不等于通用人工智能。 | 通用人工智能 |
| 59.3% | Agents’ Last Exam。与 ARC-AGI-3 那一格分开。 | OpenAI |
| 72.6% | OSWorld 2.0 模拟中约 40 分钟完成任务、得分 72.6%。 | OpenAI |
| 64.6% | Terminal-Bench Science 0.1。 | OpenAI |
还缺什么
| 数 | 条件 | 来源 |
|---|---|---|
| 尚无 | 截至 2026 年 9 月,没有单一被普遍接受的定义;也没有系统获得广泛科学共识,认为已经是通用人工智能。现在大规模部署的只有狭义人工智能。标准做满不等于通用人工智能。作者写明并不主张 ARC-AGI-3 的结果就是通用人工智能。这些环境范围很窄。 | 通用人工智能;ARC Prize |
| 尚无 | 普通人能把什么交出去。 | 通用人工智能 |
没有人能承诺日期的事
| 数 | 条件 | 来源 |
|---|---|---|
| 尚无 | 没有共识的预测年份。不写成承诺。 | 通用人工智能 |
这些页上出现过的机构、人和课题
下面只列这次打开的页面上出现过的机构、人和课题。不是排名,不封最权威。
Stanford HAI 关于页写出的出版物:AI Index、On the Opportunities and Risks of Foundation Models、HELM、Foundation Model Transparency Index、2025 Annual Report。
通用人工智能正文出现 AAAI、Stanford HAI、AI Impacts、Metaculus。
人物或实验室:James Landay、Russell Wald、Fei-Fei Li、John Hennessy、Percy Liang、Yejin Choi、Erik Brynjolfsson、Peter Norvig、Melissa Valentine。
OpenAI(Sam Altman、Greg Brockman)、Google DeepMind(Demis Hassabis、Shane Legg)、Meta(Yann LeCun)、Anthropic(Dario Amodei、Daniela Amodei)、xAI(Elon Musk)、François Chollet 与 ARC-AGI、Yoshua Bengio、Stuart Russell。历史:Alan Turing;1956 达特茅斯 John McCarthy、Marvin Minsky、Nathaniel Rochester、Claude Shannon;Allen Newell、Herbert Simon。
课题:加速发现、改变教育、引导对社会有益的 AI;开放科学、开放源代码、开放课程;Foundations of AI。截至 2026 年 9 月没有单一被接受的定义;没有系统获得广泛共识为通用人工智能;现在部署的是窄义 AI。DeepMind Levels of AGI 把当前前沿放在 Emerging。ARC:人类约 85%;2024 年中领先系统低于 50%;2025 年底 ARC-AGI-2 约 37%。标准饱和不等于通用人工智能。62.7% 和 99.9% 不在这一页,领域页上原有的那一格保留,两种条件仍在同一格。
来源
62.7% 与 99.9% 留在同一格,条件分别是标准接口和保留厂商推理状态。约 37% 属于 ARC-AGI-2,来自通用人工智能,不并进去。