AI 可以不靠反向传播(Backpropagation)变聪明吗?“Dust”登场

展示简化数据流而非反向传播复杂连接链的抽象 AI 学习图示。
AI Summary

Dust 是首个使用“零阶优化(Zeroth-order optimization)”而非传统反向传播来训练 Transformer AI 的技术,展示了显著提高计算效率的潜力。

你是否曾好奇,我们日常使用的 AI 聊天机器人是如何学习语言的?迄今为止,AI 最主流的学习方法是“反向传播(Backpropagation,即通过反向传递误差进行学习的方法)”。这就好比学生考试后,从最后一道题倒推回去,找出哪里出错并进行修正。然而,这种方法存在一个顽固的问题:随着 AI 模型变得越来越庞大,所需的计算能力呈指数级增长,学习过程也变得极其复杂。

但最近,一项研究结果引起了广泛关注,该研究表明 AI 甚至可以在完全不使用反向传播的情况下进行学习。这就是一种名为“Dust”的新型训练方法。

为什么这很重要?

随着 AI 技术的发展,我们对模型的需求越来越大、越来越复杂。然而,反向传播方法在模型扩展时会撞上一堵名为“计算成本”的巨墙。虽然反向传播长期以来一直是深度学习训练的标准,但它在计算需求高、权重传输问题,以及学习停滞或偏离方向等方面存在局限性。

如果 AI 能在没有反向传播这座复杂桥梁的情况下自主学习会怎样?这意味着训练 AI 的时间和电费将大幅减少,我们能更快地向世界提供更高效的人工智能。Dust 可能不仅仅是一项新技术,更是解决 AI 学习“瓶颈”的关键。

它是如何工作的?

如果把反向传播比作“一边倒读课本一边修改错误过程的精细化辅导课”,那么 Dust 又是什么样的呢?

简单来说,它就像是一场“直观的实验”。假设你要组装一台复杂的机器,与其死板地照着说明书步骤操作,不如随机尝试更换零件,只查看“实际结果”来判断机器是否运行得更好。这在专业术语中被称为“零阶优化(Zeroth-order optimization)”。在预训练 Transformer AI 时,Dust 不使用传统的反向传播,而是通过前向评估(Forward evaluation)和随机梯度下降(SGD,一种基于数据逐渐减少误差的方法)来解决这个问题。

它选择的方法不是彻底翻转整个过程,而是通过观察结果直接进行细微修正。通过这种方式,在拥有足够计算规模的情况下,Dust 的性能可以达到甚至在某些情况下超过传统的反向传播方法。

当前现状

Dust 已经超越了单纯的理论构思,正通过实际实验证明其可能性。特别是 Dust 作为首个用于预训练 Transformer 模型的零阶优化方法,具有重大的里程碑意义。

更令人惊叹的是其效率。研究结果显示,Dust 的计算效率比现有的非反向传播学习方法 EGGROLL 高出约 1,000 到 10,000 倍。 当然,它仍处于开发初期,目前正处于通过大规模运算验证性能的阶段。

未来展望

Dust 的出现具有改变我们创建 AI 方式的潜力。像 Dust 这样的研究为绕过反向传播固有的局限性(如梯度消失和梯度爆炸问题)开辟了新途径。

如果未来 AI 能够更高效地学习,高性能 AI 模型的训练将不再是大型企业的“专利”,普通研究者也可能触及这一领域。不过,Dust 能否完全取代反向传播积累数十年的精确性,还有待更多数据和大规模实验的证实。但可以肯定的是,AI 学习的世界正在走出依赖单一反向传播的时代,向着更多样、更高效的方向进化。

AI 的一句话点评

Dust 是一项大胆的尝试,可能颠覆现有的训练范式。如果这种摆脱反向传播框架、追求极致效率的努力能够成功,人工智能发展的速度将远远超过我们的想象。虽然路还很长,但 AI 自我学习的方式正变得越来越轻量、越来越聪明,这是毋庸置疑的。

参考资料

  1. A claimed way to pretrain transformers without backpropagation
  2. dust/README.md at main · qlabs-eng/dust · GitHub
  3. Navigating beyond backpropagation: on alternative training … - Springer
  4. Pretraining with Random Noise for Fast and Robust Learning - arXiv:2405.16731
  5. Samip on X: “Backprop has been the only credit assignment …”
AD
测试你的理解
Q1. Dust 使用哪种核心方法来替代传统的反向传播?
  • 强化学习
  • 零阶优化
  • 迁移学习
Dust 使用“零阶优化(zeroth-order optimization)”方法来训练模型,而不是反向传播。
Q2. 以下哪项不是传统反向传播方法的局限性?
  • 高计算资源需求
  • 梯度消失和爆炸问题
  • 学习速度过快
反向传播不仅消耗大量计算资源,且在学习过程中还存在梯度消失等多种困难。
Q3. 与现有的其他非反向传播方法(EGGROLL)相比,Dust 的计算效率大约是多少?
  • 100~500倍
  • 1,000~10,000倍
  • 2倍
据称 Dust 的计算效率比现有方法 EGGROLL 高出 1,000 到 10,000 倍。