Muse Spark协助数学家完成6篇论文:5项开放问题获解,但并非AI独立证明

Meta公布了数学家与Muse Spark 1.1、1.2合作完成的六篇数学论文,其中五篇被称为回答了此前未解决的研究问题。研究人员没有搭建专用Agent系统,只在普通Meta.ai聊天界面中使用Thinking模式;模型参与了寻找反例、编写搜索程序、推导计算、构思证明和起草技术章节。不过,问题选择、研究方向、证明检查与最终修订均由数学家主导,另有一组数学家复核。部分结论已有其他团队同期独立获得,六篇论文目前也不能等同于经过期刊同行评审。其意义不在于“AI独立攻克六道数学难题”,而在于展示通用模型怎样成为研究者可以反复讨论、编程搜索和共同修改证明的协作工具。

文章作者、来源:Meta AI Research

从“有标准答案的竞赛题”走向真正的开放问题

此前的AI数学成绩大多来自奥林匹克竞赛、标准基准或已经知道答案的问题。模型即使需要构造新证明,评估者仍然知道终点在哪里。

开放研究不同:问题可能没有答案,原来的猜想可能根本不成立,一条看似合理的证明路线也可能在数周后才暴露漏洞。Meta此次让数学家通过普通Meta.ai界面使用Muse Spark 1.1和1.2,没有加入自动文献检索、多Agent调度或专用形式化验证框架。

合作持续数月。数学家负责选择问题、提供背景和判断哪些方向值得继续;Muse Spark则在对话中提出思路、展开计算、生成程序或证明草稿。Meta称,六篇论文中有五篇给出了此前开放问题的答案。

六篇论文分别做了什么

第一篇研究高维空间中的高斯椭球拟合:给定一组随机点,什么时候存在一个以指定位置为中心、恰好穿过全部点的椭球?

论文证明了一个清晰的相变阈值。点数低于阈值时,精确拟合以高概率存在;超过阈值后,它几乎肯定不存在。不过,恰好位于临界点时会发生什么仍未解决。Muse Spark参与发展和修改证明策略,Aykut Arslan主导研究,另有四名数学家检查论证。

这项结果也不是唯一同时出现的解答。2026年8月已有三个外部团队分别公布同期成果,其中一些证明了相同高斯阈值,另一些得到更广泛的普适性结论。Meta称这些工作彼此独立、方法不同。

第二篇研究一种受激光物理启发的双调和非线性薛定谔方程。问题可以粗略理解为:当聚焦效应不断压缩波形、色散又试图把它摊开时,波能否永远维持,还是必然在有限时间内“坍缩”?

论文证明,在二维及更高维度、径向对称且能量为负的特定条件下,坍缩必定在有限时间内发生。这解决了2015年留下的问题,并验证了2002年数值模拟针对这一场景作出的预测。模型帮助检查计算、尝试论证和修订证明;Leonard Dinh决定问题及关键证明思路。

第三篇处理群论中的一个2024年猜想:是否所有有限“半阿贝尔群”都是“单项群”。否定这种普遍命题只需要找到一个反例。

Muse Spark生成了GAP数学软件的搜索程序,最终找到一个含384个元素的反例;研究者随后验证结果并补完证明。值得注意的是,另一个名为Nilradical的AI Agent已于9月16日公布不同反例,Meta称自己的结果为独立完成。论文页面列出的作者为Joseph Phillip Brennan和Milana Golich。

第四篇来自二元多项式优化。复杂的离散优化问题经常会被替换成较容易求解的“松弛”版本,但松弛后的最优解不一定仍与原问题一致。

研究者和Muse Spark证明了,在所研究的三环重叠结构中,当每个只被两个集合共享的区域恰好含一个决策变量时,这种松弛是精确的;只要某一区域多于一个变量,就会产生差距。模型帮助把问题重新表述为概率问题、寻找反例并形成证明策略,人类研究者负责纠错和完善。

第五篇尝试连接数论与p进弦理论。研究团队证明,两种使用不同数学语言发展的计算实际上描述同一个量,把1980年代Yuri Manin提出的方向从Tate曲线推广到更广泛的曲线类别。

在这一项目中,Muse Spark的参与程度较深:它不仅帮助识别跨领域联系、生成候选证明,还起草了三个核心技术章节,随后由研究者检查、纠正和重写。

第六篇研究受演化生物学启发的非结合“演化代数”。Muse Spark生成了一个三维反例,推翻了用于判断某类代数是否“可解”的既有猜想;团队随后提出更准确的替代判据,从考察单个元素改为考察整个子空间。外部研究者Hu和Wen也独立报告了该猜想的反例。

模型做了很多,但“AI独立解题”并不准确

六项合作中,Muse Spark承担的角色并不相同:有时只是展开计算和尝试证明,有时编写搜索程序,有时发现反例,也有时直接起草技术章节。

但共同流程都是由数学家提出问题、提供提示、选择研究路线,并判断模型产出是否值得继续。模型给出的证明也不是直接发表:原研究者先检查和修订,随后由另一组数学家复核。

Meta还要求每篇论文标明哪些段落主要由人类起草、哪些主要由AI起草,并注明其依赖的既有数学思想。这比把模型笼统列为“工具”更透明,也为今后如何分配研究署名与贡献提供了一个可讨论的范例。

不过,官方所说的“review”是由另一组数学家检查,不应自动等同于匿名期刊同行评审。Meta论文页面没有列出正式出版机构;公开材料也没有提供完整对话记录、失败路线数量或相同设置下的重复成功率。因此,外界目前可以审阅最终论文,却难以完整复现从聊天到证明的整个过程。

真正重要的是协作方式发生了变化

这批成果没有证明数学研究可以交给一个无人监督的聊天机器人。恰恰相反,它表明现阶段较有效的模式,是让熟悉问题的数学家持续掌舵,把模型用于扩大搜索空间、快速编程、检验反例和反复改写论证。

群论案例尤其说明这种分工:模型擅长迅速写出GAP程序并搜索人类难以手工枚举的对象,研究者则负责确认程序没有偷换定义、反例确实满足全部条件,并把计算事实转化为可理解的数学证明。

同时,多项结果与外部团队同期出现,也提醒人们谨慎使用“首次解决”或“AI攻克”的表述。开放问题可能因模型普及而被多个团队同时推进;未来评价AI科研成果时,不仅要问答案是否正确,还要追踪问题是谁提出的、关键思想来自哪里、模型贡献是否可复现,以及相邻团队是否已独立得到结果。