十多年来,8GB RAM 一直是“足够好”的标准。这是学生、上班族、甚至轻度创意人士的安全基线。从 2012 年到 2023 年,苹果将其作为 MacBook 的默认配置出售。Windows 笔记本电脑可以轻松地使用 8GB 区域来浏览和处理电子表格。
那个时代已经结束了。它并没有因为网页变大而结束(尽管确实如此)。它结束是因为我们使用计算机的基本方式正在从“检索”数据转向“生成”数据。
“AI PC”和本地大型语言模型(LLM)的兴起为硬件引入了新的硬地板。 Microsoft 的 Copilot+ 标准要求 16GB RAM。 Apple 的 M4 Mac 终于从 16GB 起步。这不仅仅是追加销售营销——这是一个物理问题。如果您尝试在 8GB 机器上运行现代本地 AI,它不仅运行缓慢,而且运行速度也很慢。它有效地打破了。
以下是您的 8GB 笔记本电脑变砖的技术现实。
“砖块”的数学
要了解 8GB 为何已死,我们必须了解大型语言模型 (LLM) 如何使用内存。与不使用时可以延迟写入 SSD(交换文件)的浏览器选项卡不同,LLM 需要其“权重”(定义其智能的参数)驻留在活动的高速 RAM 中才能发挥作用。
让我们看一下标准“小型”本地模型的数字,例如 Llama 3 8B 或 Microsoft 的 Phi-3,以可用的 4 位量化运行。
看起来不错,对吧?你有8GB。您验证了数学:$8 - 4 = 4$。您还剩 4GB。
错了。
你忘记了操作系统。 Windows 11 在闲置一些后台服务时,很容易消耗 4GB 到 5GB 的 RAM。
在您打开 Web 浏览器之前,您现在的内存使用率已达到 112%。
交换死亡螺旋
当您所需的内存超过物理 RAM 时,操作系统会将数据移动到 SSD 上的“交换”或“页面文件”。
在现代 NVMe SSD 上,读取速度很快,可能为 5GB/s 或 7GB/s。但 RAM 的速度要快一个数量级,通常超过 60GB/s 至 100GB/s。更重要的是,延迟(查找数据的时间)是杀手。
当法学硕士生成文本时,它会重复扫描其权重以查找生成的“每个标记”。如果这些权重位于交换文件中,您的 CPU/NPU 必须暂停并等待 SSD 获取数据。
- RAM 访问:纳秒。
- SSD 访问:微秒(慢 1000 倍)。
结果就是“交换颠簸”。系统在 RAM 和 SSD 之间移动数据所花费的时间比实际计算的时间要多。您的每秒令牌数从对话式的 20 T/s 下降到令人痛苦的 0.2 T/s。你的光标冻结了。音频断断续续。机器会“变砖”,直到您终止该进程。
历史背景:8GB 的漫长日落
8GB 标准具有非常强的弹性。
- 2012:MacBook Pro Retina 推出,以 8GB 为高端基准。对于大多数人来说这太过分了。
- 2016-2020:8GB 成为标准。 Chrome 变得更加饥饿,Electron 应用程序(Slack、Discord)激增,但 8GB 仍能保证一般生产力。
- 2023:Apple 发布配备 8GB RAM 的 M3 MacBook Pro,售价 1,599 美元。评论家和专业人士表示反对,称其“不可接受”,但苹果公司为其辩护,声称“Mac 上的 8GB 就像 Windows 上的 16GB”。
尽管由于统一的内存效率,这种说法对于视频编辑来说是有争议的,但对于人工智能来说却站不住脚。 80 亿参数模型并不关心它是在 macOS 还是 Windows 上;它需要数学上固定的空间。 8GB就是8GB。
2024 年,故事发生了迅速转变。微软宣布了“Copilot+ PC”规范,这是下一代Windows笔记本电脑的硬件标准。要求很严格:
- NPU:40+ TOPS(每秒万亿次操作)。
- RAM:最低 16GB。
没有配备 8GB RAM 的 Copilot+ PC。它不存在。通过将 16GB 纳入规格,以及 256GB 存储和 40 TOPS NPU,微软划清了界限,向整个行业发出信号:8GB 不再能够提供预期的体验。
NPU 瓶颈
还有另一层:统一内存。
在现代“AI PC”(Snapdragon X Elite、Apple Silicon、Intel Core Ultra)中,NPU(神经处理单元)与 CPU 和 GPU 共享内存。 AI芯片没有专用的VRAM。
这意味着,如果您想使用闪亮的新型 NPU 来模糊 4K 背景、生成图像或运行实时翻译代理,该内存将直接来自您的系统 RAM。
正是出于这个原因,显卡 (GPU) 几十年来一直拥有专用 VRAM。游戏 PC 可能具有 16GB 系统 RAM 加上8GB 视频 RAM。现代笔记本电脑总共有 16GB。如果 AI 占用 4GB,GPU 占用 2GB 用于显示缓冲区和 UI,那么 CPU 就会陷入碎片争夺战。
在具有共享显卡和 NPU 的 8GB 计算机上,应用程序的“可用”内存可能低至 3GB 或 4GB。这几乎不足以运行打开五个选项卡的现代网络浏览器,更不用说生产力工作流程了。
前瞻分析:32GB是新逻辑
如果 16GB 是当今广泛接受的“运行”人工智能的最低配置,那么您应该购买什么来保证自己的未来发展?
答案是越来越32GB。
随着本地模型变得越来越聪明,它们也变得越来越大。我们已经看到“量化感知训练”和“专家混合”(MoE)模型试图提高效率,但对智能的需求是无限的。用户将希望运行:
- 文本摘要代理(后台)。
- 编码助手(In-IDE)。
- 语音转录服务(会议)。
与操作系统和浏览器同时运行多个模型将消耗 16GB 的空间。
我们正在进入类似于 2000 年代初的硬件过时周期,三年前的计算机无法运行最新的软件。在过去十年中,同比增长微乎其微。 2018 年的笔记本电脑今天仍然可以很好地浏览网页。
但 2018 年的笔记本电脑,甚至是 2023 年配备 8GB RAM 的笔记本电脑,无法参与本地人工智能革命。它在功能上与下一个操作系统更新的定义功能无关。
结论:如果您今天要购买笔记本电脑,请不要购买 8GB。不要让朋友买8GB的。这不是一个预算选择;这是一个死胡同。十年来第一次,购买基本型号不仅是节俭,而且是一个错误。
资料来源 (4)
- microsoft.com Microsoft Copilot+ PC Requirements
- engadget.com Microsoft's AI PC Plan
- developer.nvidia.com NVIDIA: Optimizing LLMs for Performance
- microcenter.com Quantization Explained
🦋 Bluesky 讨论
在 Bluesky 上讨论