返回博客

AI发展推演:从2026年8月到2028年8月

日期:2026年8月12日
范围:基于2026年7-8月最新信息,推演未来6-24个月AI发展轨迹与社会影响


当前基准线(2026年8月快照)

核心能力指标

领域 基准测试 当前水平 人类对比
数学推理 ARC-AGI-2 92.5% (GPT-5.6) 接近满分
科学推理 GPQA Diamond 94.6% (GPT-5.6) 超越人类博士
软件工程 SWE-bench Pro 80% (Claude Fable 5) 专业级
前沿推理 Humanity's Last Exam ~45% (Gemini 3.1 Pro) 仍有差距
代码生成 Terminal-Bench 2.1 领先 (GPT-5.6 Sol) 专业级

标志性突破(2026年5-8月)

三个月内三次重大数学突破:

  1. 2026年5月20日:OpenAI内部推理模型独立解决了Erdős单位距离问题(1946年提出,80年未决),证伪了离散几何中的核心猜想。这是第一个可能发表在顶级数学期刊的AI独立证明

  2. 2026年7月20日:Anthropic研究员Levent Alpöge使用Claude Fable 5发现了Jacobian猜想(1939年提出,87年未决)的反例,仅用216个字符的公式推翻了三维及以上的情况。

  3. 2026年8月10日:Anthropic宣布一个未公开的Claude研究版本黎曼猜想上取得重大进展。虽然未完全证明该猜想,但将黎曼zeta函数零点位于临界线上比例的已证明下界从41.6%提升至67.2%。精确常数为 3/2 - cot(1/√2) ≈ 67.25%。该证明经过:

    • 两名Anthropic数学家审查
    • 外部专家Brian Conrey和Dan Goldston(黎曼zeta函数领域领先专家)快速检查
    • Lean形式化验证(机器可检查)

    研究过程:两次Claude Code会话,约60个子代理协调,2400条shell命令,3100万输出token,约650个失败想法后才找到可行路径。

意义:这三个突破标志着AI从"模仿人类已有知识"进入"产生全新知识"的阶段。这不是通过暴力计算,而是通过真正的推理和创新思维。

主要模型格局(2026年7-8月)

社会信号


技术推演(未来6-24个月)

推理能力演进

时间点 ARC-AGI HLE 关键里程碑
2026.8(当前) 92.5% ~45% 解决80+年数学猜想
2027.2(6个月) 97%+ 55-60% ARC-AGI基本饱和
2027.8(12个月) 99%+ 65-70% 接近人类顶尖专家
2028.2(18个月) 饱和 75-80% 部分领域超越人类
2028.8(24个月) 饱和 80-85% 大多数认知任务达专家级

关键判断:ARC-AGI将在2027年初基本饱和(接近100%),此后需要新的基准测试来衡量进步。HLE(人类最后考试)将成为更有意义的指标,但到2028年也可能需要升级。

软件工程能力

时间点 SWE-bench Pro 能力描述
2026.8 80% 独立完成大部分软件任务
2027.2 90%+ 独立维护大型代码库
2027.8 95%+ 独立设计中小型项目架构
2028.2 97%+ 主导大型软件项目
2028.8 98%+ 完全替代初级到中级开发者

影响:到2028年,"程序员"这一职业将发生根本性变化。人类角色从"编写代码"转向"定义问题、审核代码、做架构决策"。初级开发者的培训周期将从数年缩短到数周(AI辅助学习)。

科学发现能力

当前状态:AI已从"辅助工具"变为"独立研究者"。

推演路径:

自主代理能力

当前状态:OpenClaw已证明AI可自主操作电脑完成复杂任务。Anthropic推出Claude Code(终端代理)和Claude Cowork(桌面代理)。

推演路径:

多模态能力

当前状态:视频生成(Sora 2、Veo 3、Kling 3.0)、音频生成、图像生成均已成熟。

推演路径:


社会影响推演

就业市场

短期冲击(2027年):

中期调整(2028年):

关键判断:这不是"创造性破坏"的温和版本,而是认知工作的工业革命。过去工业革命替代体力劳动,现在AI替代认知劳动。调整速度远快于历史先例。

教育体系

传统教育崩溃:

教育转型方向:

科学研究

范式转变:

具体领域影响:

治理与安全

监管滞后:

安全风险:

地缘政治:

创意产业

颠覆性影响:

2028年可能景象:每个人都是"创作者",AI帮助实现创意。但"专业创意工作者"的经济价值大幅下降。


关键不确定性与风险

可能减缓AI发展的因素

  1. 算力瓶颈:训练成本指数增长,可能需要新硬件架构(光计算、量子计算)
  2. 数据墙:高质量训练数据可能耗尽
  3. 监管收紧:欧盟AI法案、美国行政命令、中国法规可能强制安全审查
  4. 社会反弹:就业冲击可能引发政治反弹
  5. 安全事件:重大AI安全事故可能引发全面监管

可能加速AI发展的因素

  1. 资本涌入:AI被视为下一代基础设施,投资持续增加
  2. 开源社区:开源模型加速创新,降低使用门槛
  3. 竞争压力:中美欧竞相领先,不愿自我限制
  4. 正向反馈:AI加速AI研发,形成加速循环

最可能的路径

"加速但非指数"路径:


结论

核心判断

  1. AI已在2026年8月达到"人类专家水平"的临界点,在数学推理(三个月三次重大突破)、软件工程、科学发现等核心领域已证明可独立产生新知识。

  2. 未来2年内,AI将在大多数认知任务上达到或超越人类专家水平。这不是预测,而是基于当前趋势的自然延伸。

  3. 最大的挑战不是技术,而是社会适应。就业冲击、教育转型、治理滞后、安全风险——这些才是真正的不确定性来源。

  4. AI不会"取代人类",但会"重新定义人类的价值"。当AI能完成大多数认知工作时,人类的独特价值可能在于:提出正确的问题、定义价值取向、创造意义、以及AI无法模拟的人类体验。

对个人的建议


附录:信息来源

本报告基于2026年7-8月公开信息,主要来源包括: