菲尔兹奖得主Jacob Tsimerman宣布入职OpenAI 活动启幕信息明确

来源:时代一线 分类:科技
菲尔兹奖得主Jacob Tsimerman宣布入职OpenAI 活动启幕信息明确

数学圈与人工智能圈的边界,正被彻底打破。

作者丨高允毅

编辑丨马晓宁

那些原本只存在于纸笔之间的纯数学硬核成果,如今已直接嵌入大模型训练的最前线。

一位小红书博主Z9在梳理文献时注意到,近期刷屏全网的“三维挂谷猜想”,已被佛罗里达大学的研究团队引入神经网络训练流程,试图借此破解大模型长期存在的“黑盒”难题。

他们发表的论文题为《GeoLAN: Geometric Learning of Latent Explanatory Directions in Large Language Models》,核心逻辑是利用挂谷猜想证明过程中衍生的关键概念——“粘性挂谷集”,为大模型的内部语义空间建立一套严格的“摆放规范”。这一举措旨在从训练初始阶段就理顺纠缠的概念,使AI的推理路径具备真正的可追溯性。

这可谓前有车辙开道,后有后人拾遗。

01

大模型的底层顽疾:表征坍塌

先聊聊大家都有切身体会的“黑盒问题”。

当前的大模型在处理做题、写代码及分析任务时,准确率虽高,但一旦追问其思维过程,它往往语焉不详,甚至编造理由搪塞。

这一问题的根源,深植于一种被称为“表征坍塌”的底层特性之中。

不妨将大模型的语义空间视作一个拥有数千层结构的巨型仓库,理论上它能分类存放无数概念:逻辑、情感、事实、推理等,各安其位。

但在Transformer的训练机制下,模型显得颇为“偷懒”,倾向于将所有语义信息堆叠在入口的一小块区域,致使剩余90%的空间处于闲置状态。

结果便是,各类概念被迫挤入一个狭窄的高维锥形区域内,学术界将此现象称为“各向异性”。

这种拥挤局面引发了诸多弊端。

概念纠缠导致风马牛不相及的内容被强行捆绑在同一方向,致使单个神经元需同时响应“猫”与“圣经经文”等毫不相关的信号。

更棘手的是,难以厘清哪部分表征对应何种逻辑,连模型自身都无法还原真实的思考轨迹。

当相似却不同的概念混杂一处,极易产生混淆,稍加变换问法,AI便容易信口开河。

对此,论文中有一句精辟总结:少数几个“流氓维度”霸占了大部分信息方差,极大地浪费了模型的有效容量。

此弊病几乎贯穿所有主流Transformer架构,从GPT、Llama到Gemma,无一能独善其身。

面对此局,行业此前的对策多为“事后补救”,即在模型训练结束后,借助稀疏自编码器等工具,强行拆解纠缠的概念。

然而,此类方法拆出的结果仅具表面合理性,未必契合模型内部的真实逻辑,保真度始终受限。

GeoLAN则另辟蹊径:不再等待混乱发生再行整理,而是在起始阶段便确立规矩。通过在训练全程施加几何约束,让每个概念各归其位。

02

挂谷猜想何以与AI结缘?

理解GeoLAN的思路,需先明了挂谷猜想的本意。

1917年,数学家挂谷宗一提出一个看似简单,却困扰学界半个世纪的难题:若取一根1厘米长的针,在桌面上旋转一周,其扫过的最小面积是多少?

常人直觉认为,旋转必画圆,面积不会太小。但数学家证实,该面积可无限接近于零。

如何实现?

若让针边旋边滑,竟能扫出面积近乎为零的奇异图形。换言之,在二维世界,全方位几何轨迹可被压缩至极小角落。

挑战随之升级:若置于三维空间呢?当针可在上下左右及无数立体方向旋转,欲容纳所有方向的轨迹,所需空间最小多大?

依二维经验推演,三维空间中该图形的绝对体积仍可压缩至趋近于零。

但这引出新谜题:尽管图形空洞无体积,其微观结构是否也萎缩退化?数学家引入“分形维数”以衡量骨架密实度。

最终,王虹等人发现,即便体积被压榨至极度空洞,为兼顾每一方向的针,其内部交织骨架仍保持坚实的“三维饱满度”,微观维度上毫无退化。这正是王虹终结世纪难题的关键所在。

在此硬核证明过程中,“粘性挂谷集”这一关键概念应运而生。

所谓“粘性”,实为一套防挤压规则,专门规制线段与管子,禁止其过度聚集。

若一组管子遵循此规则,便会舒展铺开,占据应有的空间;反之,若违规挤入小角落,空间的“大小”便会缩水,呈现受压扁态。

至此,逻辑链条闭合:大模型的表征坍塌,恰似“语义管子不满足粘性条件,全部挤作一团”。

GeoLAN的做法,是将挂谷猜想的数学结论直接转化为工程标准:既然数学已严格证明“满足粘性则空间不坍缩”,便给大模型语义空间加上同款粘性约束,使其表征天然避免拥挤。

要将此规则植入训练过程,核心在于构建可量化的惩罚函数,即让模型能够计算并据此调整的惩罚机制。

为此,GeoLAN设计了两套可计算的惩罚规则,将挂谷猜想中的几何法则转化为训练目标。其一为KT-CW,专攻“语义扎堆”;其二为KT-Attn,专治“注意力偷懒”。

KT-CW的原理是在训练中随机抽检语义空间各方向。若发现某方向语义信息过载,便对模型扣分。此举迫使模型将知识均匀铺满高维空间各处,充分利用此前浪费的维度,从根源解决“拥挤”问题。

另一套KT-Attn则针对注意力机制的懈怠行为。大模型注意力头在训练后期常陷入严重同质化,许多头终日盯着同一词或位置打转,有效劳动力寥寥。该规则强制规定每个注意力头必须关注截然不同的语义区域,确保注意力全覆盖,彻底根治注意力头的秩坍缩现象。

这套组合拳效果立竿见影。

在Llama-3-8B上,GeoLAN成功将原本扁平的锥形表征空间重塑为圆润球形,显著降低拥挤程度,大幅提升各方向均匀性,同时维持了任务准确率。

在Gemma-3-4B上,MMLU准确率由0.59提升至0.60,增幅约0.75个百分点。TruthfulQA的语义稳定性亦获显著改善。

在更大体量的Gemma-3-12B上,偏见率指标出现统计学意义上的明显下降。

论文还揭示了一个名为“金凤花区”的现象。

过于严苛的均匀分布几何约束,对于参数量过小的模型而言竟是灾难。小模型天生依赖概念纠缠以实现极致语义压缩,强行打散只会恶化其内部几何结构。

而对于体量庞大的巨无霸模型,其庞大的预训练过程已自发构建起极其复杂的流形结构,再加此规则不仅水土不服,反会拖累整体性能。

唯有四到八十亿参数规模的中等体量模型,恰好拥有足够空间消化均匀分布带来的红利,从而获益最大。

此外,论文推导出一项精妙定理——“语义粘性定理”:当表征满足“防挤规则”时,不同语义概念会自动分解为近似相互垂直的子空间,论文形象地称之为“颗粒”。每个子空间可独立解释与调整,这意味着困扰业界多年的黑盒问题由此变得透明。

一篇ACL论文,一把将挂谷猜想从纯数学殿堂拽入AI工程现场。

03

菲尔兹奖得主,当天宣布加入OpenAI

另一引人关注的动态是,本次菲尔兹奖得主之一Jacob Tsimerman,在获奖当日即宣布,即将入职OpenAI,投身AI安全领域。

此举凸显前沿数学与AI的紧密联结。

就在一年前,他与伯克利AI安全研究者Andrew Critch合著论文《A Taxonomy of Omnicidal Futures Involving Artificial Intelligence》,以数学家的极致严谨,为AI风险路径搭建严密分类体系。

他本人更是AI的重度受益者。2025年,他有5篇数学论文上线arXiv,直言AI使科研产出效率翻倍。

更具戏剧性的是,颁奖前三天,有人借助Anthropic最新的Claude Fable 5,一夜推翻悬置87年的雅可比猜想,震动全球数学界。此人正是他的学生Levent Alpöge。

面对AI不断逼近甚至超越顶级数学家“智商”的现实,数学泰斗蒂莫西公开感叹:这是他生平首次目睹大语言模型在自己完全陌生的领域,轻松攻克家喻户晓的世纪难题。

数学与AI的关系,早已超越“密不可分”所能形容的范畴,二者正以惊人速度融为一体。

回顾过去一年AI在数学竞技场的表现:DeepMind的AlphaProof在国际奥数赛场斩获银牌;OpenAI推理模型一举推翻埃尔德什单位距离猜想这桩八十年悬案;GPT-5.6仅用一小时搞定循环双覆盖猜想;以及Claude Fable 5一夜荡平雅可比猜想。短短两个月内,AI连续创下多项世纪纪录,攻坚速度呈指数级加快。

在AMS访谈中,Jacob直言:“数学界存在大量‘自我安慰’,大家盯着AI现在不如数学家,便推断它永远不如数学家。”他用自身实践证明,虽然模型证明尚不完整、不严谨,但“通常能拉出大致正确的方法,帮你走完八成的路”。

他甚至预判,两年内,AI在数学证明方面将全面超越人类。

那么问题来了:四年后的2030年,菲尔兹奖还会有人类得主吗?

菲尔兹奖有硬性年龄限制,获奖者须未满40岁。这意味着,若AI在未来四年内系统性超越人类数学家的原创发现能力,评审委员会将面临前所未有的困境:是将奖项颁给做出最好数学工作的人,还是颁给“人类中做出最好数学工作”的人?

更耐人寻味的是数学与AI的双向加速。三维挂谷猜想刚被证明,三个月后GeoLAN便应运而生,纯数学成果直接落地为大模型训练工具。今日菲尔兹奖表彰的André-Oort猜想、希尔伯特第六问题突破,明日又将演化出何种AI能力?

过去常说,数学家在前头拓荒,AI在后面捡宝。但现在,捡宝者已开始自己开路。

参考链接:https://arxiv.org/html/2603.19460v1

上车,雷峰网带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

【站点差异】本稿将发布到 shixianpress.com。请换一种措辞、句式与段落节奏,避免与发往其他站点的版本雷同;事实与数字仍必须与原文一致。

相关推荐