衡量AI模型在智能手机(而非巨型数据中心)上直接运行性能的“口袋规模基准测试”已经开启,iPhone 17 Pro目前展现了现有的最高性能。
想象一下。即使在没有任何互联网连接的偏远地区,你智能手机里的AI助手也能顺畅地为你修图、总结长篇文档,甚至即时进行复杂的语言翻译。迄今为止,AI一直被认为只能在“云端”,即巨型数据中心的超级计算机中运行。但现在,AI正准备走进我们手中的小巧智能手机里。这在专业领域被称为“口袋规模推理”(Pocket-Scale Inference,指在设备内部直接运行AI模型以得出结果的过程)。
那么,手机内置的AI与云端AI相比,到底有多聪明呢?为了确认这一点,业界已经设立了新的标准。
为什么这很重要?
到目前为止,我们使用的诸如ChatGPT之类的AI,大多数都依赖于强大的服务器。你输入的提问通过互联网传输到遥远的服务器,在那里生成答案后再发送回手机。相比之下,口袋规模AI则在手机内部完成所有计算。
这之所以重要,主要有两个原因。第一是“隐私”。你的私人对话或敏感照片数据不会外流到外部服务器,因此更加安全。第二是“速度”。无论网络状态如何,都能做出即时响应。但问题在于,智能手机比服务器级的超级计算机小得多,性能也受到限制。我们所感知的AI性能,取决于智能手机如何高效地驱动这些“小AI”。
简单来说
打个比方,服务器级AI就像是“汇聚了顶级厨师的大型酒店厨房”,而口袋规模AI则是“单身公寓的迷你厨房”。大型厨房一次可以做几百人的饭菜,但迷你厨房一次能做的菜量是有限的。
近期,人工智能性能分析公司Artificial Analysis发布了一项基准测试(性能测量标准),用于衡量AI在智能手机这个狭窄的厨房里能以多快、多准确的速度完成产出。出处: Artificial Analysis
然而,这项测量比想象中更棘手。与数据中心的服务器不同,智能手机的运行时(运行AI的软件环境)技术尚未完全成熟。出处: Artificial Analysis 就好比厨师们拿着各自不同的工具做菜,根据设置的不同,AI给出的答案速度和质量会有很大差异。因此,想要测出真正的实力要困难得多。
目前进展如何
目前在这场“口袋规模AI”竞赛中,哪款设备处于领先地位呢?根据最新的分析结果,iPhone 17 Pro在智能(模型的判断力)和速度(响应时间)两方面均表现最为优异,登上了排行榜榜首。出处: Zeli
Artificial Analysis正与Liquid AI合作,收集AI在实际设备上的真实运行数据。出处: Artificial Analysis 他们以我们在日常使用APP时感受到的实际“回答速度”和“语境理解能力”等作为基准,而不仅仅是理论数值。出处: GIGAZINE
当然,仍有课题需要解决。由于智能手机的内存容量较小,能够记住的信息量(即“上下文限制”,Context limits,AI一次能记住的对话范围)以及给出回答所需的时间,与数据中心级AI相比仍有很大差距。出处: Zeli
未来展望
未来,智能手机性能的核心将从“拍摄多高分辨率的视频”迅速转变为“能在手机内驱动多聪明的AI”。目前在开源界,已经出现了能够分析用户智能手机芯片环境并自动应用最佳AI设置的技术。出处: PocketTune GitHub
我们即将迎来一个不再是从服务器租用“聪明AI助手”,而是将其贴身带在智能手机里,随时随地都能提问的时代。也许在未来,购买智能手机时确认“记录了怎样的AI基准测试分数”将成为必备常识。
参考资料
-
[Intelligence at pocket scale: Benchmarking small models and mobile phones Artificial Analysis](https://artificialanalysis.ai/articles/mobile-phone-intelligence-inference) -
[Benchmarking Pocket-Scale Inference Hacker News](https://news.ycombinator.com/item?id=49469786) - Benchmarking Pocket-Scale Databases
-
[Vue HN 2.0 Intelligence at pocket scale: Benchmarking small models and mobile phones](https://vue-hackernews-ssr-5cavbdjcta-ew.a.run.app/item/49420960) -
[Artificial Analysis (@ArtificialAnlys) Vanlett](https://vanlett.net/ArtificialAnlys) - Artificial Analysis has published the results of its… - GIGAZINE
-
[Consumer Inference Systems Artificial Analysis](https://artificialanalysis.ai/hardware-inference-stack/mobile-phones) - iPhone 17 Pro tops pocket-scale AI benchmark
-
[Open-Source Agentic Inference Benchmark InferenceX](https://inferencex.semianalysis.com/) - GitHub - ayanbag/PocketTune: On-device tuning of local-LLM
- Google 学术搜索
- DBpia - 提供国内论文、学术期刊、杂志的学术AI平台
- NVIDIA Blackwell Sets New Standard for Gen AI in MLPerf Inference…
-
[Benchmark MLPerf Inference: Datacenter MLCommons V3.1](https://mlcommons.org/benchmarks/inference-datacenter/)
- 为了测量智能手机的电池寿命
- 为了确认在非数据中心的实际使用环境下的AI真实性能
- 为了提高手机游戏的帧率
- Galaxy S26
- iPhone 17 Pro
- Google Pixel 11
- 通信速度比数据中心快得多
- 移动运行时环境不如数据中心成熟,结果会因设置而产生巨大差异
- 智能手机中没有搭载AI芯片