本地大模型跑不动,几乎从来不是算力不够,而是撞了两堵墙——容量墙和带宽墙。这是一篇讲清楚「统一内存为什么决定生死」「CUDA 凭什么是护城河」的工程笔记。
英伟达 GTC Taipei 2026 把传说中的 GB10(DGX Spark 同款芯片)下放到消费级 RTX Spark。但真正决定本地大模型体验的四个数字,藏在这里——其中一个会颠覆你对「英伟达=最快」的直觉。
先记住一个反直觉的数字:同一块 GPU,读自己的显存有 1TB/s,但去读隔壁 CPU 的系统内存,只剩 ~32GB/s——慢了整整 30 倍。本地大模型所有的"卡",几乎都从这道 30 倍的落差里来。
过去三十年,一台 Windows PC 的算力是分裂的。CPU 有自己的系统内存(RAM),比如 64GB;GPU 有自己的显存(VRAM),比如 RTX 4090 的 24GB。两块内存物理上分开,由两家不同的厂商(Intel/AMD 做 CPU,NVIDIA 做 GPU)各自做主,中间靠一条叫 PCIe 的总线来回搬数据。
这套架构服务图形渲染和游戏几十年都没问题——因为游戏的数据量是"一次性灌进显存就开跑"。但大模型不一样:它需要 GPU 持续、高频地访问几十 GB 的权重,一旦这些权重塞不进显存、得放到系统内存里,那条 32GB/s 的 PCIe 就成了致命的瓶颈。
统一内存(把 CPU/GPU 的内存合成一个共享池)本身不是新概念——游戏主机、集成显卡早就在用。真正的难点是:在消费级单机上,把它做成既大(能装下大模型)又快(带宽够喂饱 GPU)、还有完整 AI 生态。Apple 用 M 系列芯片第一个在消费级把"大 + 快"铺开,英伟达则在 2026 年用 GB10 把"统一内存 + CUDA"第一次捏到了一起。
"统一内存"不等于"内存变快了"。它解决的首先是容量问题——让 GPU 能直接寻址一大池内存、不必走 PCIe 搬运。带宽是另一个独立维度,后面 ACT III 会看到,GB10 的统一内存带宽其实是这一代的短板。
回到 Q1:你有一张 4090,FP16 算力 80+ TFLOPS,游戏里画面拉满毫无压力。可你想在本地跑一个量化到 4-bit 的 70B 模型,它就是跑不动。算力明明过剩,问题出在哪?
算给你看。一个 70B 模型,4-bit 量化后约 40GB。你的 4090 只有 24GB 显存——装不下。于是框架只能把一部分权重 offload 到 64GB 系统内存里。GPU 每生成一个 token,都要读一遍全部权重;放在系统内存里的那部分,每次都得走 PCIe 那条 ~32GB/s 的龟速通道去拿。于是 GPU 大部分时间在干等数据,算力空转。
大模型的解码(生成 token)本质是内存带宽受限的:理论速度 ≈ 内存带宽 ÷ 每次要读的权重量。所以决定快慢的从来不是 TFLOPS,而是"权重能不能被高速喂进 GPU"。这就是内存墙。
| 机器配置 | 能装下 40GB 模型? | 有效带宽 | 解码体验(理论上限 ≈ 带宽/40GB) |
|---|---|---|---|
| RTX 4090 · 24GB 显存 + 64GB RAM | 装不下 | ~32 GB/s(PCIe 卡死) | 权重溢出走 PCIe,<1 tok/s,基本不可用 |
| Mac Studio · M3 Ultra 128GB 统一内存 | 装得下 | 819 GB/s | ~20 tok/s 理论上限,流畅可用 |
| RTX Spark · GB10 128GB 统一内存 | 装得下 | 273 GB/s | ~6–7 tok/s 理论上限,能跑但不快 |
看出张力了吗?在"装不装得下"这个生死问题上,两台统一内存机器对 4090 是降维打击;但在"装下之后跑多快"上,Mac 的 819GB/s 反而把 GB10 的 273GB/s 甩在身后。这正是 Q3、Q5 的核心矛盾,留到 ACT III、IV 解。
"GPU 不是不够快,
是被一条 32GB/s 的水管活活渴死。"
统一内存的原理一句话:把 CPU 和 GPU 的内存合并成同一个物理池,谁都能直接寻址,权重不再需要在两块内存之间通过 PCIe 来回搬。容量墙和带宽墙——两堵墙一次拆掉一大半。但"拆得多干净",Apple 和英伟达走了两条参数完全不同的路。
128GB(GB10)和最高 512GB(M3 Ultra)的统一内存,意味着 70B、120B 甚至更大的模型可以整个装进去,彻底绕开 PCIe。这一维度上,统一内存对传统"小显存独显"是结构性碾压。
GB10 的统一内存是 256-bit、LPDDR5X-8533,实测带宽 273GB/s。Apple 靠 UltraFusion 把两颗 M3 Max 拼成 M3 Ultra,做到 819GB/s,是 GB10 的 3 倍。所以纯比"装下同一个 dense 模型后谁吐字快",Mac Ultra 反而领先。
很多人默认"英伟达 = 最快",但 GB10 这一代的统一内存带宽(273GB/s)是它明显的短板——既低于 Mac Ultra(819),更远低于独显显存(1TB/s+)。如果你的需求是纯推理、追求 token 吞吐,GB10 不是最快的那一个。它的价值得换个维度去看——也就是 ACT IV 的 CUDA。
卡兹克说 GB10「轻松跑 120B」并不夸张——因为热门的 120B 级模型多是 MoE(专家混合),每个 token 只激活约 5B 参数。带宽压力落在"激活的那一小部分"而非全部权重上,所以 120B MoE 在 273GB/s 上反而可能比 70B dense 更跟手。容量装得下 + 只读激活专家 = 统一内存的甜区。
既然 Mac 的统一内存又大又快,为什么开发者还在等 RTX Spark?答案是 Q4、Q5 的核心:CUDA。它不是显卡驱动,也不只是"GPU 加速",而是一整套打磨了 20 年的生态,分三层。
| 层级 | CUDA 里有什么 | 作用 |
|---|---|---|
| 底层 | 把 GPU 当通用计算器编程 | 除了渲染,还能做任意数学计算 |
| 中层 | cuBLAS · cuDNN · TensorRT · NCCL · FlashAttention | 20 年打磨的数学/深度学习/推理/多卡通信库,新优化优先适配 NVIDIA |
| 上层 | PyTorch · TensorFlow · JAX 的默认且首选 GPU 后端 | 几乎所有深度学习框架,开箱即用的就是 CUDA |
| 新增 | CUDA-X:cuLitho · cuOpt · cuDSS · Parabricks… | 横跨科学计算/仿真/基因组学的加速库,这次还开放给 Agent 直接调用 |
真正的杀伤力不在库本身,而在惯性:你今天去看学术论文放出的开源代码,绝大多数是在 CUDA 上写和测的;你遇到任何深度学习问题去搜,搜出来的答案默认假设你在用 CUDA。整个 AI 工程界的"母语"就是 CUDA——这是 20 年、上万个仓库累积出来的,钱砸不出来。
Mac 的统一内存确实牛,但它的 GPU 用的是 Metal,机器学习框架是 MLX。社区里绝大部分开源模型、训练代码、微调工具,都是先在 CUDA 上做好,然后才慢慢有人移植到 MLX。结果就是:
| 维度 | CUDA(NVIDIA) | Metal / MLX(Apple) |
|---|---|---|
| 框架默认后端 | PyTorch/TF/JAX 首选 | 需 MLX 或移植分支 |
| 推理 | 成熟 | 可用(llama.cpp/MLX 已不错) |
| 微调 / 训练 | 生态完整 | 薄弱,工具链滞后 |
| 开源代码即跑性 | 复制即用 | 常需等移植/改写 |
| 新优化(如 FlashAttention 新版) | 优先支持 | 滞后数月起 |
"推理还好说,但训练和微调在 Apple 上的生态,到今天还是非常薄弱。社区代码都是先在 CUDA 上做好的,再慢慢移植到 MLX。" — 数字生命卡兹克《英伟达发布全新 RTX Spark》
所以 Q5 的答案清楚了:RTX Spark 的杀手锏不是带宽,是 CUDA。在它之前,"想要 CUDA"和"想要统一内存的大容量与能效"在 PC 上不可兼得——Apple 给你统一内存却没 CUDA,NVIDIA 给你 CUDA 却被显存大小锁死。RTX Spark 第一次把这两件原本打架的东西捏到一起。
把前面四幕的结论落到决策:不存在"谁全面更好",只存在"你的工作负载更吃哪一项"。容量、带宽、生态——你最缺哪一项,就选补哪一项的机器。
要在本地微调、训练、跑前沿开源代码。
主要做推理、内容创作,要安静低功耗。
只跑能塞进显存的小模型,还要打游戏。
把 CUDA 生态 + 大容量统一内存第一次捏到一台 PC 上。Grace ARM CPU + Blackwell GPU + 128GB LPDDR5X。
统一内存的开创者,带宽与容量这代领先(819GB/s、最高 512GB),生态成熟、能效与静音一流。
显存带宽天花板(1TB/s+),游戏与小模型推理之王,但被显存容量死死锁住。
要微调/训练 + 跑最新代码 → RTX Spark(为 CUDA 买单)。只做推理与创作、要省心 → Mac(为带宽和能效买单)。只跑小模型 + 重度游戏 → 独显 PC(为显存速度买单)。三者不是"好坏"之分,是"你撞的是哪堵墙"之分。
本地大模型这场仗,第一性原理始终是两堵墙:容量墙(装不装得下)和带宽墙(喂不喂得饱)。统一内存是这两堵墙的共同解,Apple 与英伟达都已跨过门槛。真正分出胜负的,是墙后面那层 20 年攒出来的生态——CUDA。
RTX Spark 的历史意义不在"参数最强"(它的 273GB/s 甚至输给 Mac 的 819GB/s),而在它第一次让 PC 用户不必在「CUDA」和「统一内存能效」之间二选一。这是以前任何单一平台都给不了的组合。
Q1 答案:不是算力不够,是 24GB 显存装不下 40GB 的 70B-Q4,溢出部分走 32GB/s 的 PCIe 把 GPU 渴死。
Q2 答案:它把 CPU/GPU 内存合成一池,GPU 直接寻址、不走 PCIe,先拆容量墙、再缓解带宽墙——这是"能不能跑"的生死差别。
Q3 答案:纯推理可以买 Mac,它带宽更高更省心;但训练/微调、跑最新开源代码,Mac 的 Metal/MLX 生态会让你处处等移植。
Q4 答案:CUDA 是 20 年累积的三层生态(通用计算→数学库→框架默认后端),是 AI 工程界的母语;Metal/MLX 是小众方言,推理够用、训练微调薄弱。
Q5 答案:不是带宽,是 CUDA + 大容量统一内存的"组合"——以前在 PC 上不可兼得,RTX Spark 第一次同时给齐。
Q6 答案:推理两家都行(Mac 吞吐更高);微调 RTX Spark 明显占优;训练严肃任务首选 CUDA,Mac 基本出局。
你要 LoRA 微调、跑别人刚开源的训练脚本、复现论文。这些代码 99% 默认 CUDA,Mac 上常要等移植或自己改 MLX。
建议:RTX Spark 是顺路最少的那条。先确认你常用的框架/工具链对 GB10(ARM + Blackwell)的预编译支持是否就位,再下单。
你主要做本地推理、剪辑、生图,不碰训练,看重安静和能效。dense 模型的吐字速度直接吃内存带宽。
建议:Mac(M3 Ultra/M4 Max)依然香——819GB/s 带宽 + 成熟工具链 + 静音低功耗。等 RTX Spark 整机实测带宽与噪音数据出来再横向比。
你预算有限,只想先跑得动中小模型、顺便打游戏,不急着碰 70B 以上。
建议:一张二手/中端独显 PC 仍是性价比之选——把模型控制在显存能装下的范围(如 7B–14B),显存 1TB/s 带宽反而最快。等真要碰大模型再升级到统一内存平台。
| # | 信号 | 触发判断 / 动作 |
|---|---|---|
| 1 | RTX Spark 整机实测内存带宽 | 若实测显著高于 273GB/s(如新一代 GB10 提升),推理结论需上修 |
| 2 | RTX Spark 定价 vs 同容量 Mac | 价差决定"为 CUDA 多付多少"是否值 |
| 3 | Windows for Agent / OpenShell 落地 | 从 PPT 到可用的时间,决定"Windows 生态有救"是不是真的 |
| 4 | PyTorch/框架对 GB10(ARM+Blackwell)预编译轮子 | 没有现成 wheel,"CUDA 即插即用"会打折 |
| 5 | Apple MLX 训练/微调生态进展 | 若 MLX 训练补齐,Mac 的最大短板被填,格局变 |
| 6 | llama.cpp / vLLM 对 GB10 的优化成熟度 | 社区适配速度直接影响开箱体验 |
| 7 | 120B 级 MoE 模型在 GB10 的实测 tok/s | 验证"统一内存甜区"是否成立 |
| 8 | 联想/HP 等整机的散热与噪音 | 笔记本形态下能否持续跑 AI 负载不降频 |
| 9 | Adobe 等对 RTX Spark 的实际优化兑现 | "2x 速度 + 原生 Agent 调用"是否如发布会所说 |
| 10 | 下一代 PCIe 6.0 / CXL 普及 | 若总线带宽追上来,传统独显的"容量墙"或被缓解 |
"硬件给你拆了墙,
真正住进去的,是那 20 年的生态。"
· 数字生命卡兹克《英伟达发布全新 RTX Spark — 个人 PC 的新时代》 · mp.weixin.qq.com
· NVIDIA DGX Spark 官方 / Hardware Overview(128GB · 273GB/s LPDDR5X) · docs.nvidia.com
· LMSYS《DGX Spark In-Depth Review:本地 AI 推理》 · lmsys.org
· Tom's Hardware《NVIDIA DGX Spark Review · GB10 Superchip》 · tomshardware.com
· Apple Mac Studio 技术规格(M3 Ultra 819GB/s · 最高 512GB) · apple.com
· chiplog《Analysis of NVIDIA DGX Spark's GB10 SoC》 · chiplog.io