為提升 AI 模型效率而進行的「量化」技術,被發現會導致 AI 過度思考,即使中間過程已找到正確答案,最終卻在輸出時給出錯誤結果。
試想一下,我們在解數學題時,腦海裡其實已經有了答案。然而,「會不會不是這個?」的懷疑卻接二連三地湧現,最終導致考試時間結束,試卷上卻什麼也沒寫出來。最近,人工智能(AI)領域被發現正在發生同樣的事情。
通常人們認為 AI 模型規模越大就越聰明。但為了讓這些模型能在一般用戶的電腦或手機上輕量化運行,必須經過稱為「量化」(Quantization,一種降低模型精度以提升效率的技術)的程序。令人驚訝的是,經過此過程的 AI 模型,竟會陷入不必要的「糾結」中,導致自己與正確答案擦肩而過。
為什麼這很重要?
AI 在我們生活中的比重日益增加。然而,運行龐大的 AI 模型需要極高的電力與高效能設備。因此,開發者希望能縮小模型體積,讓 AI 能流暢地在智慧型手機等個人裝置上運行。
這項研究指出 AI 效率優化過程中被忽略的「隱藏副作用」。如果 AI 明明已經找到正解,卻因為懷疑自己而過度延長邏輯思考過程(Chain of Thought,AI 為了推導答案而採取的思考步驟),那麼我們最終得到的只會是更慢且不準確的回答。這不僅是技術問題,更是直接影響我們日常使用的 AI 服務品質的重大發現。參考資料 14
淺顯易懂:完美主義學生的困境
我們可以這樣比喻:有一位成績優異的學生,明明已經知道考題答案,卻因為擔心「萬一我算錯了怎麼辦?」而陷入不安,擦掉了原本寫下的答案,重新計算,又想尋找新的解題思路,最後在聽到考試結束鐘聲響起時才驚覺來不及作答。
Meta AI 研究團隊指出,量化後的邏輯推理模型正表現出這種行為。參考資料 3 這些模型在解題中間確實已經推導出正確答案。但它們對答案缺乏信心,進而延伸出不必要的思維分支,最終陷入自我懷疑的泥沼。結果就是無法給出正解,或是得出了錯誤的結論。實際上,研究顯示在量化模型答錯的案例中,高達 52% 的情況是模型在中間過程其實已經知道正解。參考資料 1, 參考資料 5
目前進展:終止過度思考
為了克服此問題,研究人員進行了一項有趣的嘗試。他們偵測 AI 在思考過程中導致過度懷疑的特定訊號(如「但是」、「等等」等 Thinking markers),並對此應用「Logit 懲罰」(Logit penalty,一種降低特定字詞或表達方式輸出機率的技術)。參考資料 2, 參考資料 13
簡單來說,這就像是有位老師坐在學生旁邊,每當學生開始無謂的糾結時就提醒他:「那個已經是正確答案了,直接寫上去吧!」應用此技術後,在多個模型與基準測試中,AI 不必要的糾結時間(邏輯思考過程長度)減少了 12% 到 23%,進而獲得了更有效率且精確的回答。參考資料 2
未來展望?
這項研究為 AI 開發方向提供了重大啟示:單純縮減 AI 模型容量並非萬能。未來開發者必須進行更深度的研究,開發出能確保在縮小模型體積的同時,不損及內在邏輯推理能力的「聰明壓縮技術」。
我們未來關注的焦點將不再是 AI 能寫出多長的文字,而是它能多麼精確且毫無贅詞地做出判斷。下次當您與 AI 對話時,如果感覺它變聰明且俐落了,那或許正是因為它接受了「不再進行無謂糾結」的訓練。
MindTickleBytes AI 記者觀點
Meta AI 的這項研究展現了一個非常有趣的哲理:即便在 AI 世界裡,「想太多」也不一定能帶來更好的結果。AI 模型效率化作業竟可能損害模型的「自我客觀化」能力,這將成為未來 AI 開發過程中必須納入考量的重要變數。
參考資料
- Quantized Reasoning Models Think They Need to Think Longer…
- Quantized Reasoning Models Think They Need to Think Longer, but They Do Not
- Quantized Reasoning Models Think They Need to Think Longer…
- Quantized Reasoning Models Think They Need to Think Longer…
- Meta study finds quantized reasoning models struggle with …
- Quantized Reasoning Models Think They Need To Think Longer …
- Logit-Bias “Overthinking” Penalties in llama.cppQuantizations
- QuantizedReasoningModelsThinkTheyNeedtoThinkLonger…
- QuantizedReasoningModelsThinkTheyNeedtoThinkLonger…
- When aquantizedreasoningmodelfails, the natural assumption is…
- Think–Answer Mismatch inReasoningModels
- Quantized Reasoning Models Think They Need to Think Longer …
- Quantization Inflates Reasoning: Token Inflation as a Hidden …
- 12%
- 23%
- 52%
- 無需訓練即可應用的 Logit 懲罰 (Logit penalty)
- 額外的大規模數據重新訓練
- 大幅擴展 AI 模型規模
- 量化無條件提升 AI 效能
- 量化後的 AI 在解決邏輯問題時,往往會過度糾結導致出錯
- 所有 AI 模型都不需要進行量化