链接已复制!

新Siri即将问世:为什么苹果仍在努力追赶

苹果希望在你的iPhone上本地运行GPT-4级别的模型。物理学表明,如果不掏空你的口袋,这可能是不可能的。

🌐
机器翻译

本文由英文原文自动翻译而成。 阅读英文原文

运行本地LLM的iPhone处理器的热可视化图。

当Tim Cook宣布”Apple Intelligence”时,卖点很简单:隐私。 与想把你的数据吸进庞大服务器农场的OpenAI或Google不同,Apple希望AI活在你的手机上。他们想让”大脑”待在你的口袋里。

这听起来很高尚。听起来很安全。但其他人还没有这么做是有原因的。 这与代码质量无关。这完全关乎热力学内存带宽

Apple不是在与Google战斗;他们是在与物理学战斗。

引子:“token”问题

要理解为什么Siri在2025年仍然很笨,需要看内存带宽。 一个LLM只是一个巨大的权重(数字)文件。一个70亿参数的模型(int4量化)大约是4GB大小。

要生成一个单词(token),处理器必须把那整个4GB文件从RAM芯片读入计算单元。 要生成一个20个词的句子?它必须把那个4GB文件读20次

深入探讨:内存墙

这就是”内存带宽瓶颈”。

  • 问题: 你手机的CPU很快(3 GHz)。但你手机的内存(LPDDR5X)是一根慢吸管。
  • 数学: iPhone 16 Pro的内存带宽大约是50 GB/s
  • 现实: 如果你必须每秒移动一个4GB模型20次(才能达到人类阅读速度),你仅为AI就需要80 GB/s的带宽。

这给手机的其余部分留下了带宽。 这导致了”UI卡顿”。如果AI在说话,你的滚动就会结巴。手机感觉像是坏了。

热包络:5瓦对500瓦

数据中心里的一块Nvidia H100 GPU功耗为700瓦。它有庞大的液冷系统防止其熔化。 一部iPhone的总热预算大约是5瓦。如果超过这个数字,电池会在45分钟内耗尽,机身会烫得拿不住。

Apple的工程师正试图将一个700瓦的算法塞进5瓦的包络中。 他们通过极端量化(让模型变笨来让它变小)和”推测解码”(提前猜测3个词)来做到这一点。

但热量不会说谎。iOS 19的早期测试显示,重度AI使用会在3分钟后调暗屏幕亮度。那是热节流在保护电池。

历史背景:RAM吝啬的反噬

多年来,Apple在RAM上一直很吝啬。iPhone只有6GB,而Samsung Galaxy有12GB。 Apple辩称:“操作系统很高效!它不需要更多RAM。” 对于应用程序,他们是对的。 对于AI,他们错了。

因为AI模型必须保持”热”状态(加载在RAM中)才能保证响应速度,那个4GB的模型吃掉了手机50%的内存。

  • 结果: 当你问Siri一个问题时,手机必须”杀死”Instagram和Safari来为Siri的大脑腾出空间。
  • 用户体验: 你回到Safari,页面重新加载。

这就是为什么有传言称iPhone 18将跃升到12GB16GB的RAM。这不是为了游戏。这是为了让AI大脑保持存活,而不用杀死你的其他应用。

前瞻性分析:“私有云”妥协

Apple知道端侧正在输掉质量战争。手机上的3B参数模型永远不会像云端的1TB参数模型(GPT-4)那样聪明。

这就是他们构建**Private Cloud Compute (PCC)**的原因。 这是对物理学失败的承认。 当你的请求对手机来说太难时(热量/内存限制),它会把请求射向一个Apple Silicon服务器农场。 Apple发誓数据会被立即删除。用户只能相信他们。

但未来不是纯粹的”端侧”。而是混合的。

  • 小脑(手机): 处理”开灯”、“读这条短信”、“设一个计时器”。
  • 大脑(云端): 处理”给老板写一封邮件”、“总结这份PDF”、“生成一张图片”。

底线

新Siri举步维艰,不是因为Apple的工程师忘了怎么写代码。而是因为”计算”的定义一夜之间从”突发”(打开一个应用)变成了”持续”(生成token)。 在电池化学或内存物理发生改变之前,口袋里装着一个超级智能、完全私密的AI的梦想将仍然只是:一个梦。

资料来源 (3)

Advertisement

🦋 Bluesky 讨论

在 Bluesky 上讨论

正在搜索帖子...