「Dust」是首項使用「零階最佳化(Zeroth-order optimization)」而非傳統反向傳播來訓練 Transformer AI 的技術,展現了大幅提升運算效率的潛力。
你是否曾好奇,我們每天使用的 AI 聊天機器人是如何學會說話的?到目前為止,AI 最主流的學習方法是「反向傳播(Backpropagation,一種將錯誤訊息反向傳遞進行學習的方式)」。這過程就像學生考試後,從最後一題回頭檢查每一題哪裡寫錯並進行修正。然而,這種方法存在一個長期問題:隨著 AI 模型變得愈來愈巨大,它需要驚人的計算能力,且學習過程十分繁瑣。
然而,最近一項研究引起了廣泛關注,該研究顯示即便完全不使用反向傳播,也能訓練 AI。這就是名為「Dust」的嶄新學習方法。
為什麼這很重要?
隨著 AI 技術進步,我們追求的模型愈來愈龐大且複雜。但反向傳播方法在模型擴張時,會撞上一堵名為「運算成本」的高牆。雖然反向傳播長期以來是深度學習的標準,但其高昂的運算需求、權重傳輸問題,以及學習停滯或朝錯誤方向發展等問題,一直被視為其侷限性。
如果 AI 能在沒有反向傳播這座複雜橋樑的情況下進行自我學習會怎樣呢?這將減少訓練 AI 所需的時間與電力成本,並讓我們更快地將更高效的人工智慧推向世界。Dust 不僅僅是一項新技術,它或許還能成為解決 AI 學習「瓶頸」的關鍵。
這是什麼樣的方法?
如果將反向傳播比喻為「從課本最後往前讀並修正錯誤過程的精密補習班」,那麼 Dust 是什麼樣的方法呢?
簡單來說,它就像「直覺性的實驗」。組裝複雜機器時,不依循說明書的順序,而是隨機更換零件,僅確認「實際成品」是否運作得更好。專業術語稱之為「零階最佳化(Zeroth-order optimization)」。Dust 在預訓練 Transformer AI 時,不使用傳統反向傳播,而是透過前向評估(Forward evaluation)與隨機梯度下降(SGD,一種基於數據逐漸減少誤差的方法)來解決此問題。
與其翻轉整個流程,它選擇了觀察結果後直接進行小幅度修正的方法。透過這種方式,只要具備足夠的計算規模,Dust 的效能與傳統反向傳播方法相當,有時甚至更出色。
現況
Dust 不僅僅是一個概念,目前已透過實際實驗證明其可能性。特別是 Dust 作為首個用於預訓練 Transformer 模型的零階最佳化方法,具有重大意義。
更驚人的是效率。研究結果顯示,Dust 的運算效率比既有的非反向傳播訓練方法 EGGROLL 高出約 1,000 到 10,000 倍。 當然,目前仍處於開發初期階段,正在透過龐大的運算量來驗證其效能。
未來發展?
Dust 的出現具有改變我們創造 AI 方式的潛力。像 Dust 這樣的研究為避開反向傳播先天侷限——如梯度消失(學習訊號愈往後愈微弱的現象)或爆炸問題——提供了全新路徑。
若未來 AI 能更高效地學習,過去僅由大企業掌握的高效能 AI 模型訓練,可能也會變得更親近一般研究者。不過,Dust 是否能完全取代反向傳播數十年累積的精確度,仍需透過更多數據與大規模實驗來確認。顯而易見的是,AI 學習的世界已經超越了僅依賴反向傳播的時代,正朝向更多樣化、更高效的方式演進。
AI 的見解
Dust 是一項足以撼動現有學習典範的大膽嘗試。如果努力擺脫反向傳播的巨大框架並極大化效率的嘗試獲得成功,人工智慧發展的速度將會遠超我們所想像。雖然前路仍長,但 AI 自我學習的方式正變得愈來愈輕盈與聰明,這點是毋庸置疑的。
參考資料
- A claimed way to pretrain transformers without backpropagation
- dust/README.md at main · qlabs-eng/dust · GitHub
- Navigating beyond backpropagation: on alternative training … - Springer
- Pretraining with Random Noise for Fast and Robust Learning - arXiv:2405.16731
- Samip on X: “Backprop has been the only credit assignment …”
- 強化學習
- 零階最佳化
- 遷移學習
- 高運算資源需求
- 梯度消失及爆炸問題
- 學習速度過快
- 100~500 倍
- 1,000~10,000 倍
- 2 倍