科技

数学大佬在前面拓荒,AI研究员在后面捡宝,菲尔兹奖还能拿来破AI「黑盒」?

来源:丹巴新文网
数学大佬在前面拓荒,AI研究员在后面捡宝,菲尔兹奖还能拿来破AI「黑盒」?

数学界与AI界深度联手,成就斐然

作者丨高允毅

编辑丨马晓宁

纯粹数学的突破性成果,已然运用到大型模型训练之中了。小红书博主Z9在研读文献时有所发现,曾风靡网络的三维挂谷猜想,已被佛罗里达大学团队引入神经网络训练框架。数学与AI的跨界融合,正逐步攻克大型模型的“黑盒难题”。

该团队的论文题目为《GeoLAN: Geometric Learning of Latent Explanatory Directions in Large Language Models》。其核心方法运用挂谷猜想中的关键概念“粘性挂谷集”,为大型模型的内部语义空间建立规范体系。通过训练初期就梳理混乱的概念脉络,使AI的推理路径得以清晰呈现,真正实现可追溯性。

数学先驱的开拓与AI学者的创新,正好互补。

01

大模型普遍存在的困境:表征混乱

先从大众直观感受的“黑盒难题”说起。

当前的大型模型在解题、编程与分析方面表现出色,但若询问其推理步骤,模型常难以解释,或编造不实的理由。

这一问题的本质,在于模型底层存在的“表征坍塌”现象。

可将大模型的语义空间想象成一个多层级的巨大智能仓库,理论上容纳各类概念:逻辑、情感、事实、推理等。但Transformer在训练过程中存在某种“捷径”,倾向于将所有语义信息集中堆叠在仓库入口的狭窄区域,剩余90%的空间闲置。

如此一来,所有概念都挤压在有限的高维锥形空间内,形成“各向异性”现象。

概念交织会强行关联毫不相干的内容,导致一个神经元同时响应“猫”与“圣经经文”。更进一步,模型自身也无法清晰分辨各表征的真实联系。

当相近但不同的概念被压缩到一起时,容易产生混淆。稍改提问方式,AI便可能给出错误答案。

论文中有段精辟论述:“少数几个‘叛逆维度’掌控了大部分信息方差,严重浪费了模型的有效容量。”

此问题几乎在所有主流Transformer架构中都存在。包括GPT、Llama、Gemma在内,无一幸免。

过去行业普遍采用“事后处理”的补救方式,在模型训练完成后,用稀疏自编码器等工具强行分离纠缠的概念。但这种方法得到的解虽表面合理,却未必符合模型内在逻辑,保真度难以保证。

GeoLAN则开辟了新路径:与其在混乱后整理,不如训练伊始就确立规范。通过全程施加几何约束,让每个概念明确其位置。

02

挂谷猜想如何与AI关联?

要理解GeoLAN的设计理念,需先探究挂谷猜想的内容。

1917年,数学家挂谷宗一提出了一个看似简单却困扰数学界半个世纪的难题:一根1厘米长的针在桌面上旋转一圈,其扫过的最小面积是多少?

初看之下,旋转一周的针必然画出圆形,面积难以缩小。然而数学家发现,通过让针边转边滑,可以接近零面积。

这是因为在二维空间中,可以将全方位的旋转轨迹压缩至极小区域。

维数提升至三维时,挑战更为复杂。理论上,所有三维旋转方向仍可压缩成近乎零体积的图形。

但新增的疑问是:这个图形虽无体积,其微观结构是否同样退化?数学家引入“分形维数”来评估其结构密度。

王虹等人最终揭示,即便体积被压缩至极限,仍需确保每个方向都被覆盖。

相关推荐

网友评论

登录后发表评论
暂无评论,抢沙发吧~