為什麼 2005 年沒有像 GPT-2 這樣的 AI?當時硬體其實已經足夠了

2005 年當時樸實的電腦環境與最新 AI 技術的對比圖片
AI Summary

儘管 2005 年的技術條件已足以訓練出 GPT-2 水準的 AI,但由於演算法技術的匱乏、投資優先順序的限制,以及當時社會對此類技術的關注度低落,導致實際應用直到 2019 年才得以實現。

試著想像一下:如果我們現在每天使用的智慧 AI 助理,早在 20 年前的 2005 年就已經存在,那會是什麼樣子?這將是一個早上醒來打開電腦,就能對 AI 說「請幫我總結昨天的新聞」,而 AI 也能順暢應答的世界。

令人驚訝的是,從技術角度計算,2005 年的運算能力其實已經足夠訓練 OpenAI 的語言模型 GPT-2。 參考資料 8, 參考資料 13。那麼,為什麼直到 2019 年我們才得以見到這個模型呢?如果硬體不是問題,那到底缺少了什麼?

這為什麼重要?

這個問題不僅僅是回顧過去。我們常會質疑:「AI 的發展為何如此緩慢?」或者「未來為什麼發展得這麼快?」了解 GPT-2 為何沒有在 2005 年出現,能讓我們意識到技術發展不僅取決於機器效能(硬體),只有當適當的演算法與投資相互結合時,技術才會真正落實。

簡單來說:食材與食譜的關係

我們可以這樣比喻:製作美味料理不僅需要巨大的廚房(硬體),更需要精湛的「食譜(演算法)」。2005 年的超級電腦「BlueGene/L」,就好比擁有了全世界最寬敞豪華的廚房。如果真的利用這個廚房,完成 GPT-2 這道料理大約只需 41 天的時間。 參考資料 8。

然而,當時的廚師們缺乏最關鍵的「Transformer(一種辨識句子中單字間關係的 AI 結構)」這個食譜。 參考資料 8。此外,能有效訓練模型的「Adam 最佳化(Adam optimization,一種提升 AI 學習速度的技術)」等技巧也尚未問世。這就好比在擁有頂級廚房與最新型烤箱的情況下,卻不知該放入什麼食材、如何烹飪而感到困惑。

現狀:為何直到現在才受到關注?

GPT-2 直到 2019 年才由 OpenAI 正式公開。 參考資料 12。雖然當時這個學習了 800 萬個網頁資料的模型震驚了世界,但事實上,初期許多人仍將其視為「有趣但不太實用的玩具」。 參考資料 11。

當時的 AI 研究不像今天受到巨額投資,反而有時被視為接近「偽科學」。 參考資料 7。投資者當時將運算資源傾注於其他領域,例如當時深陷監管問題的產業或核武相關研究,而非 AI。 參考資料 7。也就是說,不只是技術基礎,當時社會的關注與資本流向對於 AI 這朵花綻放而言,仍處於寒冬。

未來會如何?

今天,我們身處於參數(參數,即 AI 處理資料時所調節的數值)超過 1.5 兆個的模型時代。現在的 AI 模型進行學習時,會執行約 1.9 × 10²⁰ 到 2.5 × 10²¹ FLOPs(電腦運算次數單位)的天文數字級運算。 參考資料 6, 參考資料 9。

未來,比起單純製造更大的電腦,如何以較少的資源達到更聰明的效果,將成為研究的重點。每當新模型出現時,我們都必須密切關注其「效能價格比」的變化,並思考如何據此改變我們的日常生活。 參考資料 10。

MindTickleBytes 的 AI 記者觀點

我們之所以要等到 2019 年才能實現 2005 年的技術條件就能做到的事,再次提醒我們:技術並非僅由機器創造,而是人類的好奇心與支持這份好奇心的社會土壤共同孕育的結果。我們現在所見證的技術發展,比起當下的硬體能力,更取決於我們未來朝哪個方向引燃研究的火苗。

參考資料

  1. GPTImage2(ChatGPT Images2.0): Free Online, No Sign-up
  2. He Asked ChatGPTOne Question and ItGetsDisturbingly… - YouTube
  3. ChatGPT Images2.5 — бесплатный ИИ-генератор и редактор фото
  4. FreeGPTImage2Online |AI Image Generator… - Img Creator AI
  5. ChatGPT Images2.0: Try AI Image Generation
  6. Why didn’t we get GPT-2 in 2005? - hn.today
  7. Why didn’t we get GPT-2 in 2005? : r/mlscaling - Reddit
  8. [Why didn’t we get GPT-2 in 2005? Hasty Briefs](https://hb.int2inf.com/en/s/item/T4BcbcDVfviZ83kREhv9Xp-why-no-gpt2-in-2005)
  9. Why didn’t we get GPT-2 in 2005? - Substack
  10. Why didn’t we get GPT-2 in 2005? - hoton.ai
  11. Why didn’t we get GPT-2 in 2005? : r/slatestarcodex - Reddit
  12. GPT-2 - Wikipedia
  13. [Why didn’t we get GPT-2 in 2005? Itai Katz - LinkedIn](https://www.linkedin.com/posts/itaijkatz_why-didnt-we-get-gpt-2-in-2005-activity-7266848522186932224-deGR)
AD
測試你的理解
Q1. 以 2005 年當時效能最強的超級電腦訓練 GPT-2,預估需要多少時間?
  • 約 41 天
  • 約 1 年
  • 約 10 年
據估計,若利用當時最強大的超級電腦 BlueGene/L,約 41 天即可完成訓練。
Q2. 2005 年當時缺乏哪項核心技術,導致無法進行此類 AI 模型訓練?
  • 網際網路
  • Transformer 與 Adam 最佳化
  • 資料儲存裝置
2005 年時,Transformer 結構與 Adam 最佳化等關鍵演算法技術尚未被發明出來。
Q3. GPT-2 問世時,當時大眾普遍的評價為何?
  • 人人都認為這是場革命
  • 被視為玩具般的消遣
  • 被認為是最重要的 AI 模型
當 GPT-2 問世時,許多人並不將其視為極具價值的工具,而是當作一個有趣但效能稍顯不足的玩具。