2.4 兆個參數?阿里巴巴全新 AI 模型「Qwen3.8-Max」有何不同?

可視化巨大數據網絡的圖形圖像
AI Summary

阿里巴巴的新款 AI 模型 Qwen3.8-Max 是一款擁有 2.4 兆個參數的巨型模型,強制在所有回答中應用「思考模式」,將推理能力最大化。

試著想像一下:當我們向平時使用的人工智慧(AI)詢問複雜的數學問題,或是請它撰寫長篇報告時,如果 AI 在給出答案前會先「思考」一段時間,那會是什麼樣的情景?就像人類在解決難題前會先深思熟慮一樣。阿里巴巴最近發布的新型 AI 模型「Qwen3.8-2.4T(Qwen3.8-Max)」正是以這種方式運作。

為何備受矚目?

在日常生活中,AI 助理效能的提升,意味著我們能將更複雜的任務交給 AI。不僅限於詢問天氣,現在 AI 已經能夠更精準地處理研究或複雜程式設計等需要邏輯推理的工作。阿里巴巴對此模型充滿信心,稱其為目前業界最強大的模型之一,並具備足以與全球頂尖的「Fable 5」模型相抗衡的能力 [參考資料 4]。特別是此模型屬於「開放權重(Open-weights,即任何人皆可下載模型權重使用)」模型,這對於開發者而言意義重大 [參考資料 2]。

輕鬆讀懂「參數」與「思考模式」

您聽過「參數(Parameter)」嗎?簡單來說,可以將其視為衡量 AI 大腦大小的單位。參數越多,AI 能容納的知識就越豐富,也能學習更複雜的關聯性。本次模型擁有高達 2.4 兆(2.4T)個參數,這個規模超過了韓國總人口的 3 萬倍 [參考資料 2]。

然而,若要完全啟動如此龐大的參數,需要消耗巨大的能量。為了解決這個問題,該模型採用了一種稱為「稀疏專家混合(Sparse Mixture-of-Experts)」的智慧方式。

AD

試著想像學校裡有 512 位老師。如果詢問數學問題就只請教數學老師,詢問歷史問題就只請教歷史老師,這樣效率豈不是高得多嗎?該模型也是如此。它設置了總共 512 個「專家(Expert)」,當問題輸入時,系統只會啟用與該問題相關的 10 位專家以及 1 位共同專家來生成答案 [參考資料 5]。透過這種方式,在回答問題時實際啟用的參數僅維持在總數的一小部分,約 950 億個水平,卻能同時運用龐大的知識庫 [參考資料 5]。

此外,此模型在回答所有問題時,都會「強制」執行「思考模式」。設計上要求 AI 在回答前必須先自我檢視邏輯並進行推理過程,以導出更深刻、精準的答案 [參考資料 1]。

目前的狀態如何?

雖然 Qwen3.8-2.4T 具備強大的能力,但在使用前有幾點需要注意。

首先,此模型是「純文字模型」。與近期許多具備理解圖像或視訊功能的「多模態」AI 不同,此模型專注於讀寫文字的能力 [參考資料 1]。

其次,其規模非常龐大。若要無損運行,需要高達 4.9TB 的巨大儲存空間 [參考資料 8]。因此,這並非適合一般個人使用者在電腦上安裝的軟體,主要將透過企業或研究機構的伺服器來運用。

未來展望

阿里巴巴計畫以這次發布的 Qwen3.8-Max 為開端,持續推出更小巧、高效的模型 [參考資料 14]。在 AI 業界,預計將會陸續出現將此模型的效能與其他主要模型進行比較、驗證的相關測試 [參考資料 17]。未來這個模型在處理複雜程式編寫、研究及邏輯工作上,能為人們節省多少時間,將是眾人關注的焦點。

MindTickleBytes 的 AI 記者觀點

阿里巴巴再次展現了其技術實力,為 AI 開源生態系統拋出了一個重要的話題。不滿足於單純增加參數數量,而是為了最大化推理能力,將「思考模式」設為必要條件,這點將會成為未來 AI 模型設計的重要基準。

參考資料

  1. Qwen/Qwen3.8-2.4T-A95B · Hugging Face
  2. [Serve Qwen3.8-2.4T-A95B, a 2.4T-Parameter Model, with Configurable Reasoning on NVIDIA GB300 NVL72 NVIDIA Technical Blog](https://developer.nvidia.com/blog/serve-qwen3-8-2-4t-a95b-a-2-4t-parameter-model-with-configurable-reasoning-on-nvidia-gb300-nvl72/)
  3. Qwen/Qwen3.8-2.4T-A95B-FP8 · Hugging Face
  4. Qwen on X: “Qwen3.8 is launching and going open-weight soon!
  5. [Qwen/Qwen3.8-2.4T-A95B vLLM Recipes](https://recipes.vllm.ai/Qwen/Qwen3.8-2.4T-A95B)
  6. RadixArk/Qwen3.8-2.4T-A95B-NVFP4 · Hugging Face
  7. Qwen/Qwen3.8-2.4T-A95B · OMG
  8. [Qwen3.8- How to Run Locally Unsloth Documentation](https://unsloth.ai/docs/models/qwen3.8)
  9. Qwen38Max: Alibaba’s New AI Model Is Coming for the AI… - YouTube
  10. [Qwen3.82.4TA95B - API Pricing & Providers OpenRouter](https://openrouter.ai/qwen/qwen3.8-2.4t-a95b)
  11. Kimi K3 vsQwen3.8-Max: Benchmarks, Pricing & API Access
  12. Qwen3.8-27B Is Almost Here, And It’s About to Reset the… - Banandre
  13. Qwen3.8 Preview: 2.4T Params, Open Weights, Release
  14. Qwen3.8-Max: A New Bar for Coding and Cowork
  15. [Qwen3.8 OpenLM.ai](https://openlm.ai/qwen3.8/)
  16. [AINews] Qwen 3.8 Max(2.4T) and 27B, new open weights models …
  17. Alibaba Launches Qwen 3.8 With 2.4 Trillion Parameters …
  18. Qwen 3.8 & Qwen 3.8 27B Open Source: Official Alibaba …
  19. Qwen 3.8 Preview — 2.4T Multimodal, and What’s Not Yet Public
AD
測試你的理解
Q1. 關於 Qwen3.8-2.4T 模型的「思考模式」,下列敘述何者正確?
  • 使用者可依需求開啟或關閉。
  • 必須在所有互動中強制使用。
  • 僅在進行圖像分析時會自動開啟。
Qwen3.8-2.4T 在所有互動中皆強制執行「思考模式」,無法停用。
Q2. 此模型總參數為 2.4 兆,但在實際生成回答時,單次啟用的參數數量約為多少?
  • 約 270 億
  • 約 950 億
  • 2.4 兆全數啟用
該結構在總計 2.4 兆個參數中,每個 Token 會啟用約 950 億個參數。
Q3. 關於 Qwen3.8-2.4T 模型的輸入方式,下列敘述何者正確?
  • 是一款能同時處理文字與圖像的多模態模型。
  • 是一款純文字模型。
  • 包含視訊分析功能。
Qwen3.8-2.4T 是一款純文字模型,不支援多模態輸入。