2026 年 8 月 18 日 星期二
  • 登录
  • 注册
周天财经
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金
没有结果
查看所有结果
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金
没有结果
查看所有结果
周天财经
没有结果
查看所有结果
首页 商业

AI 科研范式革命:花 200 美元即可攻克一道数学世纪难题

2026 年 8 月 4 日
在 商业
阅读时间: 2 mins read
阅读:799
A A


(本文作者为 硅谷 Tech news,钛媒体经授权发布)

Related articles

左手推Harness,右手涨价:DeepSeek为何把开发者往外推?

左手推 Harness,右手涨价:DeepSeek 为何把开发者往外推?

2026 年 8 月 18 日
AI为主人插队踢飞第一名,千万别让黄牛知道

AI 为主人插队踢飞第一名,千万别让黄牛知道

2026 年 8 月 18 日

广告

OpenAI 日前确认,其下一代模型 Astra 以约 2000 美元推理成本攻克了十道数学与理论计算机科学前沿难题,全部成果通过 Lean 形式化验证,代码开放在 GitHub 仓库中。这些难题涵盖高维球堆积、编码理论、群论、量子复杂性和极值组合学等多个领域,每道题学术积压均超十年。

需要说明的是,这十道题是从多次尝试中筛选出的成功案例。

据 OpenAI 披露,模型在早期探索阶段存在大量失败,GPT-5.2 Pro 对 Erdős 问题的一次通过率仅 1%-2%。Astra 呈现的是“ 成功精选集”,而非无差别的全面碾压。

即便如此,Astra 交出的成绩单仍然是一道分水岭:AI 已从“ 解已知答案的题” 跨越为“ 产出人类也未知的原创证明”。AI 不再是科研的“ 助手”,而是科研的“ 参与者”。此次重塑基础科学发现范式的不是单一技术突破,是形式化验证、多智能体协同与成本崩塌三股力量的交汇。

从“ 解题” 到“ 发现”

要理解 Astra 十题意味着什么,必须回溯 AI 数学能力的进化曲线。

2025 年 10 月,OpenAI 宣称 GPT-5 解决了十个 Erdős 问题,但随后被澄清——GPT-5 所做的不是原创证明,而是文献搜索,在已有论文中找到了未被数据库收录的解答。AI 擅长检索,不证明 AI 擅长创造。

转折发生在 2026 年 1 月。软件工程师 Neel Somani 使用 GPT-5.2 Pro 在短时间内生成了一份 Erdős 问题 #397 的原创证明,经 Harmonic 的 Aristotle 系统完成 Lean 形式化验证,菲尔兹奖得主陶哲轩亲自确认该证明为此前文献中不存在的新论证。随后问题 #728 和 #729 也在此后数日内相继被攻克。

今年 5 月 20 日,OpenAI 内部通用推理模型推翻了平面单位距离问题的核心猜想,一个自 1946 年提出、近 80 年无人撼动的离散几何命题。AI 找到了一族反例,核心思路借用了代数数论领域的 Golod-Shafarevich 定理,实现了多项式级别的改进。菲尔兹奖得主 Tim Gowers 称之为“AI 数学的里程碑”。

从 GPT-5 的“ 查资料” 到 GPT-5.2 的“ 原创三题”,再到 5 月模型“ 推翻 80 年猜想”,最后到 Astra 的“2000 美元横扫十题”,八个多月的时间,AI 完成了从“ 图书馆管理员” 到“ 独立研究者” 的跃迁。

AI 数学能力进化时间线,从文献检索到独立发现,八个月完成角色跃迁

  • 多智能体协同:从“ 一人解题” 到“ 团队作战”

Astra 的核心不是参数规模更大,而是组织方式根本不同。据报道,Astra 可以让多个智能体协同工作,拆分复杂任务、分配子目标、相互校验,并在数小时甚至数天内持续推进。十个开放问题不是由一个模型一口气推导出来的,而是由一个协调者将问题拆解为子命题,分配给不同专长的子智能体并行执行,再由验证智能体筛选、合并、检查逻辑一致性。

这一流程与人类数学研究团队的组织方式高度同构。Anthropic 的 Managed Agents、OpenAI 的 Agents SDK、微软 Agent Framework 1.0、LangChain 的 supervisor-as-tool,四家主流厂商的共识是:让多个 AI 自由讨论不是最优方案,一个管理者分配任务、多个执行者交付结果才是。

  • 全球共振:不止 OpenAI 一家

Astra 并非孤例。Google DeepMind 的 AlphaProof Nexus 自主解决了 9 个 Erdős 开放问题,其中最早一题已困扰学界 56 年,单题成本最低仅 7.5 美元。北京大学 AI4Math 团队采用双智能体框架 (Rethlas+Archon) 推翻 Anderson 猜想,完成国内首次由 AI 自主解决数学开放问题并完成大规模形式化验证,生成了约 19000 行 Lean 代码。Math Inc 的 Gauss 在 5 天内完成了 8 维 (E8) 情形的球堆积定理形式化,随后再用约一周完成 24 维 (Leech 格) 情形,总计产出约 20 万行 Lean 代码 (经优化后),原人类团队估计剩余工作量需 6 个月。

此外,Anthropic、字节跳动 Seed-Prover、月之暗面 Kimina-Prover、DeepSeek-Prover-V2 等系统也在各自方向推进神经定理证明的自动化。形式化推理赛道已经形成全球性竞争格局。

如果说上述突破展示了 AI“ 能做数学” 的能力,那么下一个问题就是:我们如何信任 AI 产出的数学结果?这正是 Lean 形式化验证所要回答的。

信任锚点

如果没有 Lean,以上所有突破都缺少一个关键环节—— 可验证性。

Lean 是一种交互式定理证明器,由微软研究院开发,将数学证明写成可被计算机逐行检查的代码。不同于传统学术论文依赖同行评议的主观判断,Lean 验证是二进制的,要么编译通过,要么报错。一旦一个证明在 Lean 中“ 编译” 成功,它就不需要人类相信它,它本身就是正确的。Astra 十项成果的 GitHub 仓库中“sorry” 计数为零,意味着形式化证明中无任何步骤遗漏或未证。

大语言模型的“ 虚假推理” 问题在科研场景中是一个不可忽视的风险:同行评议精力、复现预算、沿着错误方向继续深挖的研究周期,都可能被“ 看起来对” 的 AI 生成论文无声吞噬。Lean 提供了独立于 AI 的“ 终极裁判” 系统,人类不需要逐行审阅 AI 产出的数千行推理,只需确认 Lean 编译器通过了即可。

产业界已率先为形式化验证买单。在芯片验证领域,25 岁华人创业者洪乐潼创立的 Axiom Math,据公司披露其 AxiomProver 系统在 2025 年 12 月 Putnam 数学竞赛中获得满分 12/12 的成绩,公司于 2026 年 3 月以超 16 亿美元估值完成 2 亿美元 A 轮融资。在密码学领域,形式化验证正在被用于后量子密码原语的安全性证明。在生物医药领域,形式化推理框架向“ 靶点-疾病” 因果链推演的迁移也已进入早期探索阶段。

Lean 形式化验证生态关键指标,Mathlib 已积累超 27 万条已形式化定理

据 Mines Paris PSL 官方数据,Lean 数学库 Mathlib 已积累约 210 万行代码、超 27 万条已形式化的定理。Meta 的 ATLAS 项目消耗 1830 亿 token,将 26 本数学教材翻译为 Lean 代码库。让机器自动检查“ 是不是对的” 的能力,正在从增值功能变成基础设施。

形式化验证解决了“ 可信度” 问题,但另一个更根本性的变化正在发生,科研的成本结构正在被重写。

成本崩塌:从百万美元到两百美元

2000 美元这个数字,是 Astra 故事中最具冲击力的细节,但需要明确的是,这仅指推理算力的边际成本,不包括模型训练 (数亿美元级)、基础设施投资以及人类研究者的选题与验证时间。

即便如此,边际成本的下降幅度仍然惊人。传统数学研究中,一个 Erdős 级别的开放问题可能需要一位顶尖数学家耗费数年甚至数十年,背后是终身教职的薪资、研究经费、博士生培养费用,折算成本在百万美元量级以上。Astra 以 2000 美元攻克十题,平均每题 200 美元,约相当于一个初级软件工程师一周的工资。

这是成本结构的崩塌。

成本下行趋势同样值得关注。2026 年 5 月单位距离问题,推理成本约 1000 美元。2026 年 8 月 Astra 十题合计 2000 美元,平均每题 200 美元。同期 DeepMind AlphaProof Nexus 单题成本最低仅 7.5 美元。同代模型的推理优化、专用硬件普及、多智能体架构对 token 利用效率的提升,都将在 Astra 发布后继续压缩这个数字。

AI 数学难题推理成本下降趋势,从单题 1000 美元降至 7.5 美元

当解决一个前沿数学猜想的边际成本降到 200 美元以下,“ 只有天才数学家才能做前沿数学” 这个隐含前提开始松动。

  • 密码学冲击波

成本下降最直接的连锁反应发生在密码学领域。7 月 28 日,Anthropic 披露 Claude Mythos Preview 在约 60 小时、10 万美元成本内,发现了 NIST 后量子签名候选算法 HAWK-256 的格结构对称性缺陷,将密钥恢复的理论工作量从 2 的 64 次方降至 2 的 38 次方。次日,HAWK 开发者宣布从 NIST 标准化进程中撤回该方案。

这不是量子计算机攻破 RSA,这是纯粹由 AI 推理能力驱动的密码分析,不需要量子比特,不需要超低温冷却。当多智能体系统能以 200 美元一题的边际成本求解开放数学问题时,密码学家面临的不再是“AI 能不能找到漏洞”,而是“ 低成本密码分析何时平民化”。

  • 科研预算结构重配

科研能耗正从实验密集型转向推理密集型。高校计算中心的采购清单将从“ 更多 GPU” 扩展为“ 更多能跑形式化推理管线的算力配额”。OpenAI 于 7 月 29 日推出的“ChatGPT 学术研究者计划” 向十万名科学家免费提供前沿模型访问权限,承诺到 2027 年前投入 2.5 亿美元—— 表面上是公益,本质上是在下一代科研范式中抢占用户习惯。

成本的急剧下降正在将一个问题推向台前:当 AI 能够以极低成本产出数学成果时,数学家自身的存在价值又该如何定义?

科学家从“ 证明者” 走向“ 提问者”

6 月 2 日,国际数学联盟 (IMU) 正式背书 《莱顿人工智能与数学宣言》。截至撰写时,该宣言已获超过 3000 人签署,陶哲轩称其为“ 必要框架”,多位菲尔兹奖得主也已签署。《自然》 杂志于 6 月 18 日发表社论全面支持,呼吁其他学科效仿。

宣言指出 AI 对数学的五大威胁:不可靠结果、归属缺失、依赖不平等、过度炒作、自主性丧失。OpenAI 在其 Astra 报告中回应了这些关切,承认 AI 有“ 贡献”,既不是把 AI 当成无生命的工具,也不是赋予 AI 作者身份,而是把人类放在“ 最终承担责任” 的位置。

  • AI 的边界与科学家的新定位

Astra 解决的是“ 证明一个长期猜想是否成立” 的证明型突破。而“ 提出一个全新交叉方向、需要直觉跳跃的猜想” 的概念型突破,依然是人类最稀缺的能力。不过,单位距离问题的突破也展示了 AI 超出预期的跨域联想能力,它将代数数论的 Golod-Shafarevich 理论应用于离散几何,这种跨学科联系被数学家 Arul Shankar 评价为“ 具备原创、精妙的独立思想”。AI 的跨域联想能力正在快速进步。

随着 Astra 可以 200 美元一题解决开放难题,人类数学家的工作重心将从“ 产生证明” 向上游迁移到“ 提出好问题”。莱顿宣言的务实建议是:人类研究者选择问题、设定标准、批判想法、验证结果;AI 贡献广度、速度和并行探索能力。

陶哲轩在 2026 年初的演讲中判断:“AI 将成为数学研究中值得信赖的合作者。”Tim Gowers 在 5 月 20 日当晚最初误以为 AI“ 证明” 了单位距离猜想,写道:“ 如果 AI 能想出这样的证明,数学家的好日子可能很快就要结束了。” 但次日他得知 AI 是“ 推翻” 了猜想 (而非证明),明确表示“ 如释重负”。这一细节折射出数学界对 AI 能力的复杂心态,既为其潜力震撼,又为其边界感到宽慰。

  • 验证机制的递归困境

如果 Astra 能以每天几十个问题的速度产生候选解,当前人类同行评议体系根本消化不了这个流量。Lean 形式化验证提供了部分答案,但将自然语言证明翻译为 Lean 代码本身也需要成本。AI 辅助的自动形式化正在缩小这个差距,但远未达到即插即用的水平。

于是出现一个绕不过去的困境:要规模化验证 AI 产生的数学结果,我们需要 AI 来自动化验证过程—— 但这又回到了“ 谁来验证验证 AI 的 AI” 的递归问题。当 AI 产出速度是人类验证速度的百倍以上时,最终裁决权可能退化为抽样检查权,而系统性犯错的风险窗口始终存在。

2000 美元不是奥尔特曼在国会山抛出的营销数字,它是一道分水岭。在这条线的左边,科学发现是人类智力的专属领地,昂贵、缓慢、依赖天才的偶然出现。在这条线的右边,科学发现开始变成一种可以被工程化、被规模化、被定价的服务。

当一个数学猜想的边际解决成本降到 200 美元,它就不再是“ 科研”,它变成了“ 查询”,“ 做科研” 这件事本身的成本结构也正在被重新定义。从历史经验看,重新定义成本结构往往意味着产业变革的开始。

基础科学的前沿发现,不再是一件只有人类才能做的事。但“ 什么值得发现”、“ 发现之后如何理解”、“ 谁来为发现负责”。这些问题,仍然只属于人类。(本文首发钛媒体 APP,作者 | 硅谷 Tech-news,编辑 | 焦燕)

更多精彩内容,关注钛媒体微信号 (ID:taimeiti),或者下载钛媒体 App

相关 文章

左手推Harness,右手涨价:DeepSeek为何把开发者往外推?

左手推 Harness,右手涨价:DeepSeek 为何把开发者往外推?

来自 周天财经
2026 年 8 月 18 日
0

(本文作者为 大模型之家,钛媒体经授权发...

AI为主人插队踢飞第一名,千万别让黄牛知道

AI 为主人插队踢飞第一名,千万别让黄牛知道

来自 周天财经
2026 年 8 月 18 日
0

(本文作者为 字母 AI,钛媒体经授权发布...

智谱 VS Deepseek,两条分叉的自进化树

智谱 VS Deepseek,两条分叉的自进化树

来自 周天财经
2026 年 8 月 17 日
0

(本文作者为 字母 AI,钛媒体经授权发布...

OpenAI解散风险团队,冲刺史上最大IPO:先把安全放下

OpenAI 解散风险团队,冲刺史上最大 IPO:先把安全放下

来自 周天财经
2026 年 8 月 17 日
0

这家正冲刺“ 史上最大 IPO&...

扶稳坐好,世界模型,元年已到

扶稳坐好,世界模型,元年已到

来自 周天财经
2026 年 8 月 17 日
0

(本文作者为 数字力场,钛媒体经授权发布...

加载更多
广告
  • 热门
  • 评论
  • 最新
「我们也深陷残酷价格战」,德资巨头中国区高管警告

「我们也深陷残酷价格战」,德资巨头中国区高管警告

2025 年 8 月 4 日
一周产业基金|上海市人工智能CVC基金发布;湖北百亿人形机器人母基金来了

一周产业基金|上海市人工智能 CVC 基金发布;湖北百亿人形机器人母基金来了

2025 年 8 月 4 日
「硬科技」指数携手上涨,半导体设备ETF易方达(159558)、芯片ETF易方达(516350)等产品助力布局板块龙头

基民懵了!这个火爆的板块年内涨超 37%,主力却借道 ETF 狂抛逾 400 亿元

2025 年 9 月 20 日
pt999铂金回收价格今日多少钱一克(2025年06月27日)

期货在什么情况下会被强行平仓

2025 年 8 月 4 日
Lesson 1: Basics Of Photography With Natural Lighting

The Single Most Important Thing You Need To Know About Success

4
Lesson 1: Basics Of Photography With Natural Lighting

Lesson 1: Basics Of Photography With Natural Lighting

3
Lesson 1: Basics Of Photography With Natural Lighting

5 Ways Animals Will Help You Get More Business

2
Lesson 1: Basics Of Photography With Natural Lighting

New Cryptocurrency That Will Kill Of Bitcoin

2

内控多环节失守,中泰证券湖南分公司被暂停新开证券账户 3 个月,全湘营业部同步受限

2026 年 8 月 18 日

成长 100 指数涨近 2%,成长 ETF 易方达 (159259) 连续 3 日获资金加仓

2026 年 8 月 18 日

8 月 12 日纽约期金日内短线走高 最新报 4469.00 美元/盎司

2026 年 8 月 18 日
【环球财经】卡尼号召加拿大人「购买国货」以回应美国关税威胁

【环球财经】 阿根廷放宽企业美元贷款限制

2026 年 8 月 18 日
  • 隐私政策
  • 联系我们
  • 关于周天
  • 登录
  • 注册
投诉建议:+86 13326565461

© 2025 广州小舟天传媒有限公司 by 周天财经 - 粤 ICP 备 2025452169 号-1

没有结果
查看所有结果
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金

© 2025 广州小舟天传媒有限公司 by 周天财经 - 粤 ICP 备 2025452169 号-1

欢迎回来!

在下面登录您的帐户

忘记密码? 注册

创建新帐户!

填写以下表格进行注册

所有项目需要填写。 登录

重置您的密码

请输入您的用户名或电子邮件地址以重置密码。

登录

用户登录

还没有账号?立即注册

用户注册

已有账号?立即登录