人工智能

现在能做到什么

OpenAI 的 GPT-6 Astra 介绍页写明,该模型在其对比表里的计算机使用、浏览、软件工程、网络安全、科学和专业工作上处于其列出的最高一档:Agents’ Last Exam 59.3%,OSWorld 2.0 模拟中约 40 分钟完成任务、得分 72.6%,Terminal-Bench Science 0.1 为 64.6%。ARC Prize 评测写明,在标准接口下 Astra 在 ARC-AGI-3 半私有集上为 62.7%(约 2.6 万美元);在保留厂商推理状态的接口下为 99.9%(约 1.9 万美元)。这是两种不同评测条件。METR 对 Claude Opus 5.5 的评估写明,该模型相对前代有增量提升,但仍不太可能完全自动化人工智能研发。

还差什么

ARC Prize写明,ARC-AGI-3 的范围很窄,环境的机制和目标是确定的、封闭的,不代表现实世界的开放复杂性;该页明确写「我们并不声称它是通用人工智能」。METR写明,完全自动化人工智能研发仍需要预见、自建反馈和研究者判断上的大幅改进,现有证据不显示 Opus 5.5 在这些技能上相对前代有巨大跃迁。《卫报》对合著报告的报道引述该报告:人工智能研发自动化带来的生产率增益尚未到触发「智能爆炸」的阈值。

不能承诺的时间

通用人工智能是否已经实现、以及何时实现,完成时间未知。ARC Prize写明并不声称当前结果就是通用人工智能,也没有给出达到的日期。METR的结论是当前受评模型不太可能完全自动化人工智能研发,没有给出该里程碑的日程。《卫报》所引报告把相关影响写成不确定,并写明触发阈值尚未到达。

查阅日期:2026-10-04。没有来源的年份不写。

最近更新

OpenAI Astra 页介绍 GPT-6 Astra,并注明 2026 年 9 月 22 日扩展 GPT-6 Sol 与 Luna、9 月 29 日指向 GPT-6.1 Sol。METR 2026 年 9 月 22 日发布 Claude Opus 5.5 评估,结论为该模型不太可能完全自动化人工智能研发。