当Tim Cook宣布”Apple Intelligence”时,卖点很简单:隐私。 与想把你的数据吸进庞大服务器农场的OpenAI或Google不同,Apple希望AI活在你的手机上。他们想让”大脑”待在你的口袋里。
这听起来很高尚。听起来很安全。但其他人还没有这么做是有原因的。 这与代码质量无关。这完全关乎热力学和内存带宽。
Apple不是在与Google战斗;他们是在与物理学战斗。
引子:“token”问题
要理解为什么Siri在2025年仍然很笨,需要看内存带宽。 一个LLM只是一个巨大的权重(数字)文件。一个70亿参数的模型(int4量化)大约是4GB大小。
要生成一个单词(token),处理器必须把那整个4GB文件从RAM芯片读入计算单元。 要生成一个20个词的句子?它必须把那个4GB文件读20次。
深入探讨:内存墙
这就是”内存带宽瓶颈”。
- 问题: 你手机的CPU很快(3 GHz)。但你手机的内存(LPDDR5X)是一根慢吸管。
- 数学: iPhone 16 Pro的内存带宽大约是50 GB/s。
- 现实: 如果你必须每秒移动一个4GB模型20次(才能达到人类阅读速度),你仅为AI就需要80 GB/s的带宽。
这给手机的其余部分留下了零带宽。 这导致了”UI卡顿”。如果AI在说话,你的滚动就会结巴。手机感觉像是坏了。
热包络:5瓦对500瓦
数据中心里的一块Nvidia H100 GPU功耗为700瓦。它有庞大的液冷系统防止其熔化。 一部iPhone的总热预算大约是5瓦。如果超过这个数字,电池会在45分钟内耗尽,机身会烫得拿不住。
Apple的工程师正试图将一个700瓦的算法塞进5瓦的包络中。 他们通过极端量化(让模型变笨来让它变小)和”推测解码”(提前猜测3个词)来做到这一点。
但热量不会说谎。iOS 19的早期测试显示,重度AI使用会在3分钟后调暗屏幕亮度。那是热节流在保护电池。
历史背景:RAM吝啬的反噬
多年来,Apple在RAM上一直很吝啬。iPhone只有6GB,而Samsung Galaxy有12GB。 Apple辩称:“操作系统很高效!它不需要更多RAM。” 对于应用程序,他们是对的。 对于AI,他们错了。
因为AI模型必须保持”热”状态(加载在RAM中)才能保证响应速度,那个4GB的模型吃掉了手机50%的内存。
- 结果: 当你问Siri一个问题时,手机必须”杀死”Instagram和Safari来为Siri的大脑腾出空间。
- 用户体验: 你回到Safari,页面重新加载。
这就是为什么有传言称iPhone 18将跃升到12GB或16GB的RAM。这不是为了游戏。这是为了让AI大脑保持存活,而不用杀死你的其他应用。
前瞻性分析:“私有云”妥协
Apple知道端侧正在输掉质量战争。手机上的3B参数模型永远不会像云端的1TB参数模型(GPT-4)那样聪明。
这就是他们构建**Private Cloud Compute (PCC)**的原因。 这是对物理学失败的承认。 当你的请求对手机来说太难时(热量/内存限制),它会把请求射向一个Apple Silicon服务器农场。 Apple发誓数据会被立即删除。用户只能相信他们。
但未来不是纯粹的”端侧”。而是混合的。
- 小脑(手机): 处理”开灯”、“读这条短信”、“设一个计时器”。
- 大脑(云端): 处理”给老板写一封邮件”、“总结这份PDF”、“生成一张图片”。
底线
新Siri举步维艰,不是因为Apple的工程师忘了怎么写代码。而是因为”计算”的定义一夜之间从”突发”(打开一个应用)变成了”持续”(生成token)。 在电池化学或内存物理发生改变之前,口袋里装着一个超级智能、完全私密的AI的梦想将仍然只是:一个梦。
资料来源 (3)
- semiconductor.samsung.com Samsung Semiconductor: On-Device AI
- semianalysis.com The Memory Wall
- developer.apple.com Apple Platform Architecture
🦋 Bluesky 讨论
在 Bluesky 上讨论