AI 太過聰明而拒絕公開?2019 年「GPT-2」震撼登場的往事

合成圖:過去 OpenAI 的標誌與 2019 年當時關於 AI 技術的各種新聞標題重疊
AI Summary

OpenAI 在 2019 年開發的語言模型 GPT-2,因其生成的文字極具說服力,當時曾擔心被濫用而保留了完整模型的公開。

試想一下,某天早上,當你對人工智慧說:「請根據昨天發生的事情寫一篇具有說服力的新聞報導」,一篇比人類寫得還像樣的文章隨即誕生。這對今日的我們來說已是司空見慣的風景,但在 2019 年,這種能力同時帶來了驚奇與恐懼。這正是人工智慧史上極其重要的事件——OpenAI「GPT-2」問世當時的故事。

為什麼這很重要?

2019 年,非營利人工智慧研究機構 OpenAI 發表的語言模型 GPT-2 撼動了全球科技界。它不僅僅達到文法正確的寫作水平,更能產出極其精準且具說服力的文本。當時,OpenAI 嚴重擔憂這項技術可能被用於大量生成假新聞,或是進行欺騙大眾的惡意用途[出處: OpenAI built a text generator so good, it’s considered too dangerous TechCrunch](https://techcrunch.com/2019/02/17/openai-text-generator-dangerous/)。

這是一起非常罕見的案例:技術研發企業主動宣稱「我們的技術太強大,可能有危險」,進而拒絕公開完整模型。從企業開始親自省思技術對社會可能造成的負面影響這一點來看,這成了今日我們所討論的「AI 安全性」議題的重要轉折點出處: OpenAI built a text generator so good, it’s considered too dangerous - Know the Technology News

輕鬆理解:預測下一個單詞的達人

那麼,GPT-2 究竟是如何寫出那樣的文章的呢?簡單來說,GPT-2 是「玩填空遊戲」的達人。

比喻來說:還記得小時候和朋友玩「接龍」的記憶嗎?GPT-2 閱讀了世界上所有的書籍與網路文章,學習到在某個單詞之後,接著下一個單詞出現的機率。GPT-2 研究了高達 40GB 的龐大文字數據,對於把握文脈並選出下一個最自然的單詞,其能力呈現飛躍性的提升出處: Meet OpenAI’s Text Generator That’s Considered Too Dangerous To Release - AfroTech

這就像有一位非常能幹的秘書,讀過數萬本書籍,只要你丟給他第一句話,他就能完美地撰寫出後續內容。人們因為這種「預測下一個單詞的能力」太過精確,以至於感覺 AI 好像如人類般會自我思考並寫作。

現況如何

當時 OpenAI 的研究團隊表示:「由於對惡意使用的擔憂,我們決定不公開完整的訓練模型。」出處: Meet OpenAI’s Text Generator That’s Considered Too Dangerous To Release - AfroTech。打破慣例,決定隱藏完整的訓練程式碼與數據[出處: New AI fake text generator may be too dangerous to release, say creators AI (artificial intelligence) The Guardian](https://www.theguardian.com/technology/2019/feb/14/elon-musk-backed-ai-writes-convincing-news-fiction)。

取而代之的是,OpenAI 選擇公開規模遠小於原始模型的版本出處: OpenAI says its text-generating algorithm GPT-2 is too dangerous to release.。這一決定成為引爆社會對於 AI 技術發展潛在威脅,以及如何安全運用這些技術進行正式討論的契機。

未來會如何發展?

2019 年的事件僅僅是個開端。當年的憂慮,如今已成為更加現實的課題。檢驗人工智慧生成的文章究竟有多符合事實(factuality),並建立阻擋惡意濫用 AI 的技術與社會防護網,依然是極為重要的任務出處: Why OpenAI’s fake news warnings are a bit overblown - TechTalks。現在,技術發展的重心已從「如何做到高性能」,轉變為「如何安全地使用」。


MindTickleBytes 的 AI 記者視角

GPT-2 給世界帶來的震撼不只是單純的技術炫耀。這是一份紀錄,寫下了企業自身承認技術具有改變社會的力量,並選擇暫時停下腳步的過程。我們必須記得,現在所享受的便利 AI 服務,皆是在當時那份審慎的思慮上成長而來的。

參考資料

  1. [OpenAI built a text generator so good, it’s considered too dangerous TechCrunch](https://techcrunch.com/2019/02/17/openai-text-generator-dangerous/)
  2. [New AI fake text generator may be too dangerous to release, say creators AI (artificial intelligence) The Guardian](https://www.theguardian.com/technology/2019/feb/14/elon-musk-backed-ai-writes-convincing-news-fiction)
  3. OpenAI says its text-generating algorithm GPT-2 is too dangerous to release.
  4. OpenAI built a text generator so good, it’s considered too dangerous to release - Know the Technology News
  5. [The AI Text Generator That’s Too Dangerous to Make Public WIRED](https://www.wired.com/story/ai-text-generator-too-dangerous-to-make-public/)
  6. Meet OpenAI’s Text Generator That’s Considered Too Dangerous To Release - AfroTech
  7. Why OpenAI’s fake news warnings are a bit overblown - TechTalks
AD
測試你的理解
Q1. 2019 年 OpenAI 對於公開 GPT-2 完整模型感到猶豫的主要原因為何?
  • 技術錯誤太多
  • 擔心濫用可能性及假新聞自動化生成
  • 開發成本過高
OpenAI 認為 GPT-2 寫作過於精準,有被用於惡意目的或自動產生假新聞的風險。
Q2. GPT-2 的設計運作方式為何?
  • 分析圖像並轉化為文字
  • 學習文字樣本後預測下一個單詞
  • 透過與人類即時對話進行學習
GPT-2 是基於 40GB 的文字數據,設計用於預測接下來出現的單詞。
Q3. 當時 OpenAI 是如何公開 GPT-2 的?
  • 完全公開整個數據集與程式碼
  • 僅公開部分資訊並暫緩完整模型的釋出
  • 不對一般大眾公開,僅販售給研究機構
出於對濫用風險的擔憂,OpenAI 並未公開完整模型與訓練程式碼,僅釋出了規模小得多的版本。