Dust 是首个使用“零阶优化(Zeroth-order optimization)”而非传统反向传播来训练 Transformer AI 的技术,展示了显著提高计算效率的潜力。
你是否曾好奇,我们日常使用的 AI 聊天机器人是如何学习语言的?迄今为止,AI 最主流的学习方法是“反向传播(Backpropagation,即通过反向传递误差进行学习的方法)”。这就好比学生考试后,从最后一道题倒推回去,找出哪里出错并进行修正。然而,这种方法存在一个顽固的问题:随着 AI 模型变得越来越庞大,所需的计算能力呈指数级增长,学习过程也变得极其复杂。
但最近,一项研究结果引起了广泛关注,该研究表明 AI 甚至可以在完全不使用反向传播的情况下进行学习。这就是一种名为“Dust”的新型训练方法。
为什么这很重要?
随着 AI 技术的发展,我们对模型的需求越来越大、越来越复杂。然而,反向传播方法在模型扩展时会撞上一堵名为“计算成本”的巨墙。虽然反向传播长期以来一直是深度学习训练的标准,但它在计算需求高、权重传输问题,以及学习停滞或偏离方向等方面存在局限性。
如果 AI 能在没有反向传播这座复杂桥梁的情况下自主学习会怎样?这意味着训练 AI 的时间和电费将大幅减少,我们能更快地向世界提供更高效的人工智能。Dust 可能不仅仅是一项新技术,更是解决 AI 学习“瓶颈”的关键。
它是如何工作的?
如果把反向传播比作“一边倒读课本一边修改错误过程的精细化辅导课”,那么 Dust 又是什么样的呢?
简单来说,它就像是一场“直观的实验”。假设你要组装一台复杂的机器,与其死板地照着说明书步骤操作,不如随机尝试更换零件,只查看“实际结果”来判断机器是否运行得更好。这在专业术语中被称为“零阶优化(Zeroth-order optimization)”。在预训练 Transformer AI 时,Dust 不使用传统的反向传播,而是通过前向评估(Forward evaluation)和随机梯度下降(SGD,一种基于数据逐渐减少误差的方法)来解决这个问题。
它选择的方法不是彻底翻转整个过程,而是通过观察结果直接进行细微修正。通过这种方式,在拥有足够计算规模的情况下,Dust 的性能可以达到甚至在某些情况下超过传统的反向传播方法。
当前现状
Dust 已经超越了单纯的理论构思,正通过实际实验证明其可能性。特别是 Dust 作为首个用于预训练 Transformer 模型的零阶优化方法,具有重大的里程碑意义。
更令人惊叹的是其效率。研究结果显示,Dust 的计算效率比现有的非反向传播学习方法 EGGROLL 高出约 1,000 到 10,000 倍。 当然,它仍处于开发初期,目前正处于通过大规模运算验证性能的阶段。
未来展望
Dust 的出现具有改变我们创建 AI 方式的潜力。像 Dust 这样的研究为绕过反向传播固有的局限性(如梯度消失和梯度爆炸问题)开辟了新途径。
如果未来 AI 能够更高效地学习,高性能 AI 模型的训练将不再是大型企业的“专利”,普通研究者也可能触及这一领域。不过,Dust 能否完全取代反向传播积累数十年的精确性,还有待更多数据和大规模实验的证实。但可以肯定的是,AI 学习的世界正在走出依赖单一反向传播的时代,向着更多样、更高效的方向进化。
AI 的一句话点评
Dust 是一项大胆的尝试,可能颠覆现有的训练范式。如果这种摆脱反向传播框架、追求极致效率的努力能够成功,人工智能发展的速度将远远超过我们的想象。虽然路还很长,但 AI 自我学习的方式正变得越来越轻量、越来越聪明,这是毋庸置疑的。
参考资料
- A claimed way to pretrain transformers without backpropagation
- dust/README.md at main · qlabs-eng/dust · GitHub
- Navigating beyond backpropagation: on alternative training … - Springer
- Pretraining with Random Noise for Fast and Robust Learning - arXiv:2405.16731
- Samip on X: “Backprop has been the only credit assignment …”
- 强化学习
- 零阶优化
- 迁移学习
- 高计算资源需求
- 梯度消失和爆炸问题
- 学习速度过快
- 100~500倍
- 1,000~10,000倍
- 2倍