「口袋規模基準測試 (Pocket-Scale Benchmarking)」已經展開,旨在測量並非在大型數據中心、而是直接在智慧型手機上運行的 AI 模型效能,目前 iPhone 17 Pro 展現了現存最高效能。
想像一下。即使是在完全沒有網路連線的偏遠地區,你智慧型手機裡的 AI 助理也能順暢地修飾照片、摘要長篇文章,甚至即時進行複雜的外語口譯。至今,AI 常被認為只能在「雲端之上」,也就是巨型數據中心的超級電腦中運行。但現在,AI 正試圖走進我們手中的小手機裡。這在專業術語中被稱為 「口袋規模推論 (Pocket-Scale Inference,指直接在裝置內執行 AI 模型以導出結果的過程)」。
到底搭載在你手機裡的 AI,與雲端上的 AI 相比有多聰明呢?為此確認而設下的新標準已經出爐。
為什麼這很重要?
目前我們使用的像是 ChatGPT 這類 AI,大多依賴強大的伺服器。這是透過你輸入的問題傳輸到遠方的伺服器,在那裡生成答案後再傳送回手機的方式。相反地,口袋規模 AI 則在你的手機內完成所有運算。
這之所以重要,主要有兩個原因。第一是 「隱私」。你私人的對話或敏感的照片數據不會傳輸到外部伺服器,因此安全得多。第二是 「速度」。無論網路狀態如何,都能做出即時反應。但問題在於,智慧型手機比伺服器用的超級電腦小得多,效能也有限。我們所感受到的 AI 效能,取決於智慧型手機執行這項「微型 AI」的效率有多高。
簡單來說
打個比方,如果伺服器用 AI 是「聚集了頂尖廚師的大型飯店廚房」,那麼口袋規模 AI 就是「單身家庭的迷你廚房」。大型廚房可以一次處理數百人的料理,但迷你廚房能做的菜色有限。
近期,人工智慧效能分析企業 Artificial Analysis 公布了一項基準測試(效能測量標準),旨在測量 AI 在智慧型手機這種狹窄廚房中,生成結果的速度與準確度。 出處:Artificial Analysis
然而,這項測量比想像中棘手。與數據中心的伺服器不同,智慧型手機的執行環境(執行 AI 的軟體環境)在技術上尚不成熟。 出處:Artificial Analysis 就像廚師們拿著各異的工具在做菜,AI 生成答案的速度與品質會根據設定的不同而產生巨大差異。因此,要測量真正的實力難度更高。
目前進度為何
在這場「口袋規模 AI」競賽中,目前領先的裝置是什麼呢?根據近期的分析結果,iPhone 17 Pro 在智慧(模型的判斷力)與速度(回應時間)兩方面皆創下最優異的效能,登上排行榜首位。 出處:Zeli
Artificial Analysis 正與 Liquid AI 合作,收集 AI 在實際裝置上運作程度的實測數據。 出處:Artificial Analysis 他們並非僅依據理論數值,而是以我們在日常生活中使用 App 時感受到的實際「回答速度」與「脈絡理解能力」作為基準。 出處:GIGAZINE
當然,仍有待解決的課題。由於智慧型手機記憶體容量較小,記憶資訊量的「上下文限制 (Context limits,AI 一次能記憶的對話範圍)」以及生成答案所需的時間,與數據中心等級的 AI 相比仍有很大差距。 出處:Zeli
未來展望
未來,智慧型手機效能的核心將會從「能拍出多高解析度的影片」快速轉移至「能在裝置內運行多聰明的 AI」。目前在開源領域,已經出現了能分析使用者手機晶片組環境,並自動套用最佳 AI 設定的技術。 出處:PocketTune GitHub
我們即將迎來一個時代,不再需要向伺服器租借「聰明的 AI 助理」,而是將其妥善地安置在自己的智慧型手機中,隨時隨地都能提問。未來在購買智慧型手機時,確認「紀錄了哪些 AI 基準測試分數」或許會成為基本常識。
參考資料
-
[Intelligence at pocket scale: Benchmarking small models and mobile phones Artificial Analysis](https://artificialanalysis.ai/articles/mobile-phone-intelligence-inference) -
[Benchmarking Pocket-Scale Inference Hacker News](https://news.ycombinator.com/item?id=49469786) - Benchmarking Pocket-Scale Databases
-
[Vue HN 2.0 Intelligence at pocket scale: Benchmarking small models and mobile phones](https://vue-hackernews-ssr-5cavbdjcta-ew.a.run.app/item/49420960) -
[Artificial Analysis (@ArtificialAnlys) Vanlett](https://vanlett.net/ArtificialAnlys) - Artificial Analysis has published the results of its… - GIGAZINE
-
[Consumer Inference Systems Artificial Analysis](https://artificialanalysis.ai/hardware-inference-stack/mobile-phones) - iPhone 17 Pro tops pocket-scale AI benchmark
-
[Open-Source Agentic Inference Benchmark InferenceX](https://inferencex.semianalysis.com/) - GitHub - ayanbag/PocketTune: On-device tuning of local-LLM
- Google 學術搜尋
- DBpia - 提供國內論文、學術期刊、雜誌的學術 AI 平台
- NVIDIA Blackwell Sets New Standard for Gen AI in MLPerf Inference…
-
[Benchmark MLPerf Inference: Datacenter MLCommons V3.1](https://mlcommons.org/benchmarks/inference-datacenter/)
- 為了測量智慧型手機的電池壽命
- 為了確認在非數據中心的實際使用環境下的真實 AI 效能
- 為了提高手機遊戲的幀率
- Galaxy S26
- iPhone 17 Pro
- Google Pixel 11
- 因為比數據中心的通訊速度快太多
- 因為行動執行環境比數據中心更不成熟,結果會隨設定大幅改變
- 因為智慧型手機沒有搭載 AI 晶片