按现在的速度,AI 离 AGI 还有多远?

从 2026 年的大模型进展,看一个不能只靠跑分回答的问题

资料检索截至 2026 年 9 月 18 日

先说判断:如果把 AGI 限定为“能在广泛数字化工作中,像合格专业人员一样学习并交付任务的系统”,我倾向把 2028—2032 年作为值得重点观察的窗口。这是本文的低置信度主观情景判断,不是统计预测、行业共识或实现承诺。若要求它在开放现实世界中长期可靠、自主学习并全面适应新环境,现在的证据还不足以给出可信日期。

从会回答到能独立交付:本文讨论的 AGI 门槛

一、先说清楚:我们到底在等什么?

谈 AGI,很容易出现一种情况:两个人争论同一个年份,却在谈两种不同的东西。一个人指的是“绝大多数办公室任务都能做”,另一个人想的是“能够独立生活、研究、制造,甚至拥有意识的机器”。

Google DeepMind 研究者提出的《Levels of AGI》框架,把能力的深度、覆盖广度以及自主性分别讨论,而不是只用一个“是或不是”的标签。[8]

本文采用一个偏工程、偏数字工作的讨论标准:面对陌生但合理的任务,系统能够理解目标、学习必要知识、使用工具、发现错误,并在有限监督下持续交付合格结果。这是本文的工作定义,不是声称已经存在一套统一认证标准。

在这个定义下,AGI 不必先有身体,也不要求证明它有意识;但它不能只是一个擅长回答问题的聊天框。 至于把机器人、开放世界适应和长期自主学习全部纳入的更严格目标,必须另作判断。

二、2026 年的大模型,已经走到了哪一步?

先把“已发布的事实”和“未来可能性”分开。

OpenAI:从回答问题走向操作电脑和完成专业工作。 官方发布索引列出 GPT-6 Astra 于 2026 年 9 月 3 日发布;其介绍重点涵盖电脑操作、浏览、软件工程、科学和专业任务。[1][7] 这里的能力描述来自厂商,不能直接当作整个现实工作环境中的独立验证结论。

Anthropic:强调长时间运行的智能体。 9 月 1 日的官方更新说明,Claude Fable 5.1 面向长流程编码、知识工作和研究,默认支持 1M token 上下文;同时发布的 Claude Mythos 5.1 面向 Project Glasswing 参与者,不能把两者都描述成无差别公开可用。[2] 上下文容量是产品规格,不代表系统真的能毫无遗漏地理解、记住并利用所有内容。

Google:多模态输入与可规模化的任务执行。 9 月 2 日发布的 Gemini 3.8 Flash 模型卡说明,它支持文字、图片、音频和视频输入,面向软件工程和智能体知识工作;同一份模型卡仍列出了幻觉、偶发延迟或超时等局限。[3]

我对这些变化的理解是:竞争焦点正从“谁的答案更漂亮”转向“谁能把工作做完”。但这只是对上述产品方向的归纳,不是对所有模型的完整排名,也不是 AGI 已经实现的证明。

三、最值得注意的突破,也最容易被误读

ARC Prize 在 2026 年 9 月 3 日公开了 GPT-6 Astra 的 ARC-AGI-3 分析。在 Semi-Private 测试上,标准框架、max 推理设置下的成绩为 62.7%;采用保留推理状态和上下文压缩的 Provider Adapter 框架、high 设置时,成绩为 99.9%。[9]

同一模型在不同框架与推理设置下的 ARC-AGI-3 成绩;不可把差异全部归因于单一变量

这组结果重要,不只是因为分数很高。评测方观察到,模型能够把陌生环境整理成紧凑的符号规则,用来记录状态、规划和执行动作。[9] 这比复述一个已有答案更接近我们希望看到的泛化能力。

但需要保留三个限定:

  • 测到的是具体设置下的系统表现。 两个数分别来自不同框架及推理设置,不是严格控制单一变量的对照实验,不能把全部差异都归因于框架。
  • 动作效率不是全部效率。 在特定游戏里比人类少走几步,不自动意味着算力、成本、现实工作效率都优于人类。
  • 测试环境仍然有边界。 ARC Prize 明确指出,这些环境的机制和目标相对封闭、确定,不代表现实世界的复杂性和开放性,并明确表示没有据此宣称 Astra 是 AGI。[9]

因此,更准确的结论是:我们看到了一项实质性的泛化进展,但没有拿到“通用智能毕业证”。

四、能不能按现在的进步速度,算出 AGI 的年份?

METR 提供了一个比发布会频率更有参考价值的指标:任务完成时间跨度。它先估计人类专家完成某个任务需要多久,再测模型对这些任务的成功率。所谓“50% 时间跨度”,不是 AI 能连续工作多久,而是模型在该任务分布上达到约 50% 成功率时,对应的人类任务时长。[4]

METR 在 2026 年 1 月的 TH1.1 更新中报告:拼接早期数据的长期趋势,翻倍时间约为 196 天;如果只看 2023 年以后的 TH1.1 数据,估计约为 131 天。[5] 这些是该版本分析的历史结果,不是截至今天所有模型都适用的固定“智能增长定律”。

它们给了我们一个认真考虑较短时间线的理由:在部分可测量的任务上,系统能够处理的复杂度确实增长很快。

但不能把这条线直接延长到“某年必然 AGI”。METR 的任务主要来自软件工程、机器学习和网络安全,通常目标明确、可以自动验收;其公开页面还提醒,现有任务集上超过 16 小时的测量不可靠。[4] 后续方法分析也指出,任务分布、任务时长估计及拟合选择都会影响结果。[6]

半数成功,不等于可以放心交班;一类任务的指数增长,也不等于所有能力同时指数增长。 本文不把这一趋势机械外推成 AGI 倒计时。

五、从“很聪明”到“可托付”,还差什么?

以下是本文据此提出的工程判断,而不是一份声称已量化的模型缺陷排行榜。

1. 长任务的可靠性

用一个刻意简化的例子说明:假设一个任务包含 100 个步骤,每一步独立地有 99% 的成功率,且没有检查、重试或补救,那么全程无错的概率只有约 36.6%。把单步成功率提高到 99.9%,全程无错概率才约为 90.5%。

计算分别是 0.99^100 与 0.999^100。这不是任何模型的实测故障率;真实步骤往往相关,系统也可以纠错。这个例子只说明,单次回答很准和长流程稳定交付,是两道不同的门槛。

2. 从反馈中真正学会,而不只是暂时记住

我更想看到的是:系统在陌生任务中犯错后,能形成可验证、可迁移的新策略,并在之后的新任务里继续有效。把记录放进长上下文或外部记忆,可以帮助完成任务,但不能仅凭“存下来了”就认定完成了可靠的持续学习。

3. 在模糊目标下做判断

现实工作不是总有一个自动评分器。客户可能说不清需求,资料可能互相矛盾,任务可能涉及权限、隐私和利益冲突。真正可托付的系统不仅要知道下一步怎么做,还要知道什么时候应当停止、求证或请求授权。

4. 把验收和返工成本算进去

如果 AI 很快给出结果,却需要人逐行检查和大量返工,就不能只统计它生成内容的速度。对实用价值而言,我更关心的是:在同样质量和风险要求下,它是否真的减少了人的总投入。

六、我的判断:三个情景,而不是一个“神奇年份”

以下三个时间段只讨论前述“数字工作型 AGI”。它们是条件式的主观判断,不是由上述论文推导出的置信区间,也没有经过概率校准。

数字工作型 AGI 的三个主观情景窗口;不是概率分布,也不是确定时间表

乐观情景:2027—2028 年

如果最近在陌生环境学习、上下文管理和智能体执行上的进展,可以快速扩展到更多真实工作,而且失败后的自我恢复明显改善,那么较早出现满足本文工作定义的系统,是值得认真考虑的可能性。

但这条路径要求几项瓶颈同时被突破。只靠再刷新几个排行榜,还不足以支持它。

基准情景:2028—2032 年

这是我目前倾向重点观察的窗口。理由不是“下一代模型必定成功”,而是:已有产品正把多模态、工具使用和长流程执行整合到同一系统中,独立评测也出现了明显的陌生任务适应进展;与此同时,从受控环境到可靠生产系统仍需要验证和改进。

这个范围为系统可靠性、真实任务测试和部署磨合留出了时间。它是分析者的判断,不是数据唯一推出的答案;证据变化时,应当修改,而不是为年份辩护。

保守情景:2033—2040 年,甚至更晚

如果长任务可靠性、跨领域迁移或持续学习暴露出难以靠现有路线解决的问题,AI 可能长期停留在“极强助手,但仍需要人监督”的阶段。算力成本、组织采用和监管也可能让技术能力与实际部署出现时间差。

这个情景同样不保证 2040 年前一定实现。对包含实体世界适应、长期自主学习在内的更严格 AGI,本文不提供看似精确的到达日期。

七、比猜年份更重要的,是观察这些信号

与其盯着模型名字变了几代,我更建议观察五件事:

  1. 陌生任务是否真能迁移。 换一个行业、工具或规则,表现还能不能保持?
  2. 长流程是否需要越来越少的人工接管。 不是跑了多久,而是最终有没有完成。
  3. 错误能否被主动发现并修复。 不靠用户逐条指出问题。
  4. 表现是否在独立、动态的测试中复现。 不只看厂商挑出的演示。
  5. 计入监督、验收和返工后,是否仍有稳定收益。 把质量、成本和安全放在同一张账单上。

这些是本文建议的观察标准,不是现成的官方认证门槛。它们能让“AGI 快来了”变成一个可以持续检查的判断,而不只是一种情绪。

结语:AGI 可能先出现在工作方式里

我的判断不是“2030 年必有 AGI”,而是:2028—2032 年值得作为数字工作型 AGI 的重点观察窗口,但我们仍然缺少把它写成确定结论的证据。

最有可能改变日常生活的瞬间,也许不是某家公司宣布“我们成功了”,而是你开始发现:一个陌生而复杂的任务交给系统后,它能够学习、执行、自查,并交付你愿意接受的结果,而你不再需要一直盯着它。

在那之前,不必等 AGI 才使用 AI;也不必因为 AI 越来越强,就提前把核验和最终责任交出去。


资料与图片说明: 本文依据检索当日可访问的官方发布说明、模型卡、ARC Prize 分析和 METR 研究整理,未自行重跑模型基准,也未完成所有模型的全面横向评测。厂商声明、独立测评与作者情景判断在文中分别标注。三张配图均为本稿原创程序绘制的信息图;其中分数来自所引来源,框架与时间窗口为本文示意,非实测曲线。资料页面可能后续更新。

参考资料

[1] https://openai.com/research/index/release

[2] https://docs.anthropic.com/docs/en/release-notes/overview

[3] https://deepmind.google/models/model-cards/gemini-3-8-flash

[4] https://metr.org/time-horizons

[5] https://metr.org/blog/2026-1-29-time-horizon-1-1

[6] https://metr.org/notes/2026-03-20-impact-of-modelling-assumptions-on-time-horizon-results

[7] https://openai.com/index/gpt-6-astra

[8] https://arxiv.org/abs/2311.02462

[9] https://arcprize.org/blog/astra