透過僅以小學五年級程度教育資料學習的 AI 模型「小學習者」案例,探討 AI 知識範圍與學習方式對模型效能的影響。
試著想像一下。如果你即將面臨大學入學考試,但你至今學過的內容僅止於小學五年級的課本程度,那會是什麼樣的情景?在解數學題或理解複雜的時事新聞時,恐怕會感到非常不知所措。但在人工智慧 (AI) 的世界裡,情況卻有些不同。最近 AI 研究界進行了一項非常有趣的實驗。這項實驗測試了一個完全沒有接觸過小學五年級以上知識的 AI 模型,究竟能理解到什麼程度。
為什麼這很重要?
我們常認為「AI 的資料越多越好」。我們相信必須將網際網路上浩瀚的資訊全部抓取下來讓它學習,它才會變得聰明。然而,這種方式也產生了一些問題,例如 AI 可能學到錯誤資訊,或是因為資料量過於龐大而導致學習效率下降。
如果我們只教導 AI 真正核心的基礎知識,而且是依照一套編排完善的教育課程來教學,會發生什麼事呢?這項實驗針對 AI 學習的「效率」與「教育方式」提出了新的疑問。這項研究旨在尋找答案:我們是要盲目地讓 AI 變得聰明,還是要像教導孩童一樣,讓它循序漸進地累積正確知識。
輕鬆理解
本次研究中的主角模型是「小學習者 (LittleLearner)」。由樊非·李 (Fanfei Li) 研究團隊發表的該模型,擁有約 50 億個參數(Parameter,AI 在記憶與判斷資訊時所使用的核心調節數值)。研究人員從頭開始訓練了這個擁有 50 億個參數的小學習者模型。
然而,這個模型學習的素材非常特別。它僅使用了從幼兒園到小學五年級的教育資料。小學習者僅以小學五年級程度以下的教育資料進行學習。
簡單比喻的話,如果那些巨大的 AI 模型是讀遍全世界圖書館的「知識探險家」,那麼小學習者就是經歷過非常有系統的小學教育課程的「小神童」。雖然它沒有讀過圖書館裡的所有書,但其特點在於它打下了紮實的基礎,循序漸進地掌握了作為基礎的語法、基礎科學、歷史等核心原理。
現況
目前人工智慧技術雖然突飛猛進,但依然無法擺脫「幻覺 (Hallucination,指 AI 將與事實不符的資訊說得煞有其事)」或資料偏見的問題。在無差別學習網際網路資料的過程中,有時會發生 AI 說謊或犯錯的情況,事實上也有研究指出,透過分析 AI 模型內部狀態,可以偵測到 AI 是否正在說謊。
在這種情況下,像小學習者這樣的實驗喚醒了我們對「乾淨資料」重要性的認識。因為這成為一個重要的指標,讓我們確認與其追求過於艱深的專業知識,將基礎知識完美掌握對 AI 的效能會產生何種正面的影響。
未來展望
未來 AI 的開發方向,不僅僅是製造更大、更笨重的模型,還將聚焦於如何像「小學習者」一樣,將小型且高效的模型教育得更好。開發 AI 模型時,精確的資料蒐集與篩選、倫理考量,以及對模型的細部調整是不可或缺的過程。
我們很快就會在日常生活中經常見到經過精煉教育課程、更值得信賴的小型 AI 模型,或是專精於特定領域的模型。你智慧型手機裡的助理未來將比現在說話更有邏輯、更正確,而那邁向未來的開端,正是這項「受過小學教育的 AI」實驗。
MindTickleBytes 的 AI 記者觀點
「品質」重於「數量」的知識論,不僅是適用於人類的真理。AI 也必須在正確的基礎之上成長,才能成為我們真正能夠信任並委以重任的助手。
參考資料
- 網際網路上的全部資料
- 直到小學五年級程度的教育資料
- 大學程度的論文資料
- 3,000 萬個
- 50 億個
- 1.5 兆個
- 因為資料量必須越多越好
- 因為這對模型的效能與理解能力有直接影響
- 因為 AI 無法自主學習