手中的 AI,到底有多聰明?智慧型手機 AI 效能評測的秘密

複雜的 AI 數據運算在智慧型手機螢幕上方以圖形視覺化呈現的模樣
AI Summary

「口袋規模基準測試 (Pocket-Scale Benchmarking)」已經展開,旨在測量並非在大型數據中心、而是直接在智慧型手機上運行的 AI 模型效能,目前 iPhone 17 Pro 展現了現存最高效能。

想像一下。即使是在完全沒有網路連線的偏遠地區,你智慧型手機裡的 AI 助理也能順暢地修飾照片、摘要長篇文章,甚至即時進行複雜的外語口譯。至今,AI 常被認為只能在「雲端之上」,也就是巨型數據中心的超級電腦中運行。但現在,AI 正試圖走進我們手中的小手機裡。這在專業術語中被稱為 「口袋規模推論 (Pocket-Scale Inference,指直接在裝置內執行 AI 模型以導出結果的過程)」

到底搭載在你手機裡的 AI,與雲端上的 AI 相比有多聰明呢?為此確認而設下的新標準已經出爐。

為什麼這很重要?

目前我們使用的像是 ChatGPT 這類 AI,大多依賴強大的伺服器。這是透過你輸入的問題傳輸到遠方的伺服器,在那裡生成答案後再傳送回手機的方式。相反地,口袋規模 AI 則在你的手機內完成所有運算。

這之所以重要,主要有兩個原因。第一是 「隱私」。你私人的對話或敏感的照片數據不會傳輸到外部伺服器,因此安全得多。第二是 「速度」。無論網路狀態如何,都能做出即時反應。但問題在於,智慧型手機比伺服器用的超級電腦小得多,效能也有限。我們所感受到的 AI 效能,取決於智慧型手機執行這項「微型 AI」的效率有多高。

簡單來說

打個比方,如果伺服器用 AI 是「聚集了頂尖廚師的大型飯店廚房」,那麼口袋規模 AI 就是「單身家庭的迷你廚房」。大型廚房可以一次處理數百人的料理,但迷你廚房能做的菜色有限。

近期,人工智慧效能分析企業 Artificial Analysis 公布了一項基準測試(效能測量標準),旨在測量 AI 在智慧型手機這種狹窄廚房中,生成結果的速度與準確度。 出處:Artificial Analysis

然而,這項測量比想像中棘手。與數據中心的伺服器不同,智慧型手機的執行環境(執行 AI 的軟體環境)在技術上尚不成熟。 出處:Artificial Analysis 就像廚師們拿著各異的工具在做菜,AI 生成答案的速度與品質會根據設定的不同而產生巨大差異。因此,要測量真正的實力難度更高。

目前進度為何

在這場「口袋規模 AI」競賽中,目前領先的裝置是什麼呢?根據近期的分析結果,iPhone 17 Pro 在智慧(模型的判斷力)與速度(回應時間)兩方面皆創下最優異的效能,登上排行榜首位。 出處:Zeli

Artificial Analysis 正與 Liquid AI 合作,收集 AI 在實際裝置上運作程度的實測數據。 出處:Artificial Analysis 他們並非僅依據理論數值,而是以我們在日常生活中使用 App 時感受到的實際「回答速度」與「脈絡理解能力」作為基準。 出處:GIGAZINE

當然,仍有待解決的課題。由於智慧型手機記憶體容量較小,記憶資訊量的「上下文限制 (Context limits,AI 一次能記憶的對話範圍)」以及生成答案所需的時間,與數據中心等級的 AI 相比仍有很大差距。 出處:Zeli

未來展望

未來,智慧型手機效能的核心將會從「能拍出多高解析度的影片」快速轉移至「能在裝置內運行多聰明的 AI」。目前在開源領域,已經出現了能分析使用者手機晶片組環境,並自動套用最佳 AI 設定的技術。 出處:PocketTune GitHub

我們即將迎來一個時代,不再需要向伺服器租借「聰明的 AI 助理」,而是將其妥善地安置在自己的智慧型手機中,隨時隨地都能提問。未來在購買智慧型手機時,確認「紀錄了哪些 AI 基準測試分數」或許會成為基本常識。

參考資料

  1. [Intelligence at pocket scale: Benchmarking small models and mobile phones Artificial Analysis](https://artificialanalysis.ai/articles/mobile-phone-intelligence-inference)
  2. [Benchmarking Pocket-Scale Inference Hacker News](https://news.ycombinator.com/item?id=49469786)
  3. Benchmarking Pocket-Scale Databases
  4. [Vue HN 2.0 Intelligence at pocket scale: Benchmarking small models and mobile phones](https://vue-hackernews-ssr-5cavbdjcta-ew.a.run.app/item/49420960)
  5. [Artificial Analysis (@ArtificialAnlys) Vanlett](https://vanlett.net/ArtificialAnlys)
  6. Artificial Analysis has published the results of its… - GIGAZINE
  7. [Consumer Inference Systems Artificial Analysis](https://artificialanalysis.ai/hardware-inference-stack/mobile-phones)
  8. iPhone 17 Pro tops pocket-scale AI benchmark
  9. [Open-Source Agentic Inference Benchmark InferenceX](https://inferencex.semianalysis.com/)
  10. GitHub - ayanbag/PocketTune: On-device tuning of local-LLM
  11. Google 學術搜尋
  12. DBpia - 提供國內論文、學術期刊、雜誌的學術 AI 平台
  13. NVIDIA Blackwell Sets New Standard for Gen AI in MLPerf Inference…
  14. [Benchmark MLPerf Inference: Datacenter MLCommons V3.1](https://mlcommons.org/benchmarks/inference-datacenter/)
AD
測試你的理解
Q1. 為什麼要測量在智慧型手機上執行 AI 模型時產生的「口袋規模推論」效能?
  • 為了測量智慧型手機的電池壽命
  • 為了確認在非數據中心的實際使用環境下的真實 AI 效能
  • 為了提高手機遊戲的幀率
口袋規模推論基準測試旨在測量使用者實際使用的裝置上,AI 回答問題時有多聰明、速度有多快,亦即在真實環境下的效能。
Q2. 目前在口袋規模 AI 基準測試中,哪款裝置在智慧與速度方面表現最優異?
  • Galaxy S26
  • iPhone 17 Pro
  • Google Pixel 11
根據近期人工智慧效能分析企業 Artificial Analysis 的分析,iPhone 17 Pro 在智慧與速度方面皆處於領先地位。
Q3. 為什麼在行動裝置上進行 AI 基準測試很困難?
  • 因為比數據中心的通訊速度快太多
  • 因為行動執行環境比數據中心更不成熟,結果會隨設定大幅改變
  • 因為智慧型手機沒有搭載 AI 晶片
行動裝置的執行環境(執行軟體的環境)技術相較於數據中心尚未成熟,因此測試結果會根據設定值敏感地產生差異。