以為 AI 變聰明了,其實只是陷入了深深的糾結?

一幅抽象圖像,顯示無數箭頭在複雜的電路圖上交織,象徵 AI 無法做出決定而陷入糾結。
AI Summary

為提升 AI 模型效率而進行的「量化」技術,被發現會導致 AI 過度思考,即使中間過程已找到正確答案,最終卻在輸出時給出錯誤結果。

試想一下,我們在解數學題時,腦海裡其實已經有了答案。然而,「會不會不是這個?」的懷疑卻接二連三地湧現,最終導致考試時間結束,試卷上卻什麼也沒寫出來。最近,人工智能(AI)領域被發現正在發生同樣的事情。

通常人們認為 AI 模型規模越大就越聰明。但為了讓這些模型能在一般用戶的電腦或手機上輕量化運行,必須經過稱為「量化」(Quantization,一種降低模型精度以提升效率的技術)的程序。令人驚訝的是,經過此過程的 AI 模型,竟會陷入不必要的「糾結」中,導致自己與正確答案擦肩而過。

為什麼這很重要?

AI 在我們生活中的比重日益增加。然而,運行龐大的 AI 模型需要極高的電力與高效能設備。因此,開發者希望能縮小模型體積,讓 AI 能流暢地在智慧型手機等個人裝置上運行。

這項研究指出 AI 效率優化過程中被忽略的「隱藏副作用」。如果 AI 明明已經找到正解,卻因為懷疑自己而過度延長邏輯思考過程(Chain of Thought,AI 為了推導答案而採取的思考步驟),那麼我們最終得到的只會是更慢且不準確的回答。這不僅是技術問題,更是直接影響我們日常使用的 AI 服務品質的重大發現。參考資料 14

淺顯易懂:完美主義學生的困境

我們可以這樣比喻:有一位成績優異的學生,明明已經知道考題答案,卻因為擔心「萬一我算錯了怎麼辦?」而陷入不安,擦掉了原本寫下的答案,重新計算,又想尋找新的解題思路,最後在聽到考試結束鐘聲響起時才驚覺來不及作答。

Meta AI 研究團隊指出,量化後的邏輯推理模型正表現出這種行為。參考資料 3 這些模型在解題中間確實已經推導出正確答案。但它們對答案缺乏信心,進而延伸出不必要的思維分支,最終陷入自我懷疑的泥沼。結果就是無法給出正解,或是得出了錯誤的結論。實際上,研究顯示在量化模型答錯的案例中,高達 52% 的情況是模型在中間過程其實已經知道正解。參考資料 1, 參考資料 5

目前進展:終止過度思考

為了克服此問題,研究人員進行了一項有趣的嘗試。他們偵測 AI 在思考過程中導致過度懷疑的特定訊號(如「但是」、「等等」等 Thinking markers),並對此應用「Logit 懲罰」(Logit penalty,一種降低特定字詞或表達方式輸出機率的技術)。參考資料 2, 參考資料 13

簡單來說,這就像是有位老師坐在學生旁邊,每當學生開始無謂的糾結時就提醒他:「那個已經是正確答案了,直接寫上去吧!」應用此技術後,在多個模型與基準測試中,AI 不必要的糾結時間(邏輯思考過程長度)減少了 12% 到 23%,進而獲得了更有效率且精確的回答。參考資料 2

未來展望?

這項研究為 AI 開發方向提供了重大啟示:單純縮減 AI 模型容量並非萬能。未來開發者必須進行更深度的研究,開發出能確保在縮小模型體積的同時,不損及內在邏輯推理能力的「聰明壓縮技術」。

我們未來關注的焦點將不再是 AI 能寫出多長的文字,而是它能多麼精確且毫無贅詞地做出判斷。下次當您與 AI 對話時,如果感覺它變聰明且俐落了,那或許正是因為它接受了「不再進行無謂糾結」的訓練。

MindTickleBytes AI 記者觀點

Meta AI 的這項研究展現了一個非常有趣的哲理:即便在 AI 世界裡,「想太多」也不一定能帶來更好的結果。AI 模型效率化作業竟可能損害模型的「自我客觀化」能力,這將成為未來 AI 開發過程中必須納入考量的重要變數。

參考資料

  1. Quantized Reasoning Models Think They Need to Think Longer…
  2. Quantized Reasoning Models Think They Need to Think Longer, but They Do Not
  3. Quantized Reasoning Models Think They Need to Think Longer…
  4. Quantized Reasoning Models Think They Need to Think Longer…
  5. Meta study finds quantized reasoning models struggle with …
  6. Quantized Reasoning Models Think They Need To Think Longer …
  7. Logit-Bias “Overthinking” Penalties in llama.cppQuantizations
  8. QuantizedReasoningModelsThinkTheyNeedtoThinkLonger…
  9. QuantizedReasoningModelsThinkTheyNeedtoThinkLonger…
  10. When aquantizedreasoningmodelfails, the natural assumption is…
  11. Think–Answer Mismatch inReasoningModels
  12. Quantized Reasoning Models Think They Need to Think Longer …
  13. Quantization Inflates Reasoning: Token Inflation as a Hidden …
AD
測試你的理解
Q1. 根據研究結果,在量化 AI 模型出錯的案例中,中間過程已經找出正確答案的比例最高達到多少?
  • 12%
  • 23%
  • 52%
根據 Meta AI 的研究,在模型失敗的案例中,高達 52% 的情況是模型在中間階段已經得知正解,卻無法在最終回答中呈現出來。
Q2. 為了防止 AI 過度思考,研究人員引入了什麼技術?
  • 無需訓練即可應用的 Logit 懲罰 (Logit penalty)
  • 額外的大規模數據重新訓練
  • 大幅擴展 AI 模型規模
研究人員針對導致 AI 開始不必要糾結的訊號(如「但是」、「等等」),應用了無需訓練過程的 Logit 懲罰機制。
Q3. 本次研究的主要內容為何?
  • 量化無條件提升 AI 效能
  • 量化後的 AI 在解決邏輯問題時,往往會過度糾結導致出錯
  • 所有 AI 模型都不需要進行量化
本次研究揭示了旨在縮小模型體積的量化技術,會降低邏輯推理模型的準確度,並產生不必要地延長推理過程的副作用。