相关阅读

快讯信息

您现在的位置是:主页 > 科技圈快讯 > 最热 >

:AI 助力科研,创意成真!论文见证历史时刻

发布时间:2024年12月19日 13:31:21 最热 人已围观

简介今年 8 月,Sakana AI 公司推出了相关成果,有人基于 AI 的 idea 写出了论文,且预印本 arXiv、博客、代码等一应俱全。...

哎呀妈呀!!AI 想出来的点子,竟然真有人写成论文了。 而且 arXiv、博客、代码啥的全都有了。 今年 8 月,Sakana AI(由 Transformer 论文 8 位作者的最后一位 Llion Jones 创立的公司)推出了史上首位“AI 科学家”,这一登场就一口气生成了十篇完整的学术论文。 而现在,受其中一篇论文的想法启发,人类研究员真的写出了相关论文,并在 arXiv 上公开了。 OpenAI 前研究团队负责人 Jeff Clune 激动地直说: 简直不敢相信!这是它产生的我最喜欢的想法之一。看到与人类达成一致真是太酷了,人类确实执行得更好。 话不多说,让我们来瞅瞅论文的具体内容。 Claude 提的 idea,被人类写成论文啦 翻开“AI 科学家”之前写的论文,我们找到了 Jeff Clune 提到的这一篇。 《Grokking Through Compression: Unveiling Sudden Generalization via Minimal Description Length》通过压缩实现 Grokking:借助最小描述长度(MDL)揭示突然泛化现象 根据描述,这篇论文的想法是由 Claude 3.5 Sonnet 在第 22 次迭代时提出的。 它主要探讨了神经网络中最小描述长度(MDL)与“grokking”现象(模型经过长时间训练后突然泛化)之间的关系,从信息论的角度研究突然泛化的机制。 其中,MDL 可以被看作是一种衡量模型复杂度和可压缩性的方法,即模型既要能很好地拟合数据,又不能太复杂(避免过拟合)。 具体来说,研究引入了一种基于权重剪枝的新型 MDL 估计技术,并将其应用于多种数据集,包括模块化算术和排列任务。相关实验揭示了 MDL 减少与泛化能力提高之间存在强烈的相关性(下图),MDL 的转变点通常在“grokking”事件发生之前或与之同时出现。 此外,研究还观察到了在“grokking”与非“grokking”情境下 MDL 演变模式的差异,前者以快速的 MDL 减少后持续泛化为特征。这些发现为理解“grokking”的信息论基础提供了见解,并表明在训练期间监控 MDL 可以预测即将发生的泛化。 Okk,了解了原论文,我们再来看人类选手最新发表的内容。 概括来说,他们研究了神经网络在“grokking”现象中的复杂性动态,即网络从记忆训练数据到实现完美泛化的过渡过程,并提出了一种基于失真压缩理论的新方法来衡量神经网络的复杂性。 首先,作者之一 Branton DeMoss 自述,他们受到了 Sean Carroll 和 Scott Aaronson 之前研究的启发。 通过观察咖啡与奶油混合的现象,Scott 等人发现复杂性随着时间的推移先上升,然后下降,这一过程与熵单调增加的趋势相似。 而 DeMoss 团队则形式化了这一直觉,并将其应用于神经网络,以跟踪这些网络学习的抽象复杂度。 展开来说,作者们同样先介绍了“grokking”现象,即神经网络在长时间过度拟合训练数据后突然能够泛化的能力。 其中 x 轴表示优化步数,y 轴表示准确率;红线代表训练集的准确率,绿线代表验证集的准确率。 可以看到,如果训练一个小型 Transformer 来进行模拟,在几百个训练步骤之后,模型已经完美地拟合了训练数据;然而,它直到大约 10^5 个训练步骤才能实现泛化。 为了解释这一现象,团队引入了一种基于失真压缩和 Kolmogorov 复杂性的新方法来衡量神经网络的复杂性,并通过这一框架追踪了“grokking”过程中网络复杂性的动态变化。 按照作者的比喻,这就像“神经网络的 JPEG”。 研究结果表明,网络在从记忆到泛化的过渡中,其复杂性首先上升,随后在泛化发生时下降。 进一步地,研究发现如果神经网络没有任何形式的正则化(一种防止过拟合的技术),它将无法从记忆阶段过渡到泛化阶段,而是会无限期地保持记忆模式。 没有正则化的反应: 有正则化的反应: 此外,作者指出传统的复杂性评判标准(如参数数量和权重范数)并不能准确描述模型的复杂性,因为它们忽略了训练过程中的变化。 对此,他们采用了最小描述长度(MDL)原则和 Kolmogorov 复杂度来定义和近似复杂性,并通过实验验证了这种方法,强调了简单模型在数据压缩中的优势。 最终,研究表明理解复杂性对预测模型泛化能力至关重要。 更多细节感兴趣的可以查阅原论文(地址文末)。 可以看出,一个最初由 AI 提出的想法,最终由人类完成了更细致的论证。 有网友分析指出,AI 写的那篇实验结果不如人类研究员: 而之前撰写“AI 科学家”总论文的共同一作 Cong Lu 也表示: 谁知道未来 AI 还会激发出哪些其他想法…… BTW,就在 Sakana AI 公布“AI 科学家独立生成 10 篇学术论文”的消息后,公司在 9 月份还获得了一笔 2 亿美元的 A 轮融资,其中还有英伟达的参与。 总之,AI 以后不仅能自己写论文,还能和人类一起干活了。 论文:https://arxiv.org/abs/2412.09810

Tags: 论文  人工智能