KOS TECH BRIEF · Vol.1 No.4 2026.06.01
本地 AI · 硬件架构
技术科普 · 本地大模型的硬件第一性原理

RTX Spark
vs Mac,两堵墙的战争

本地大模型跑不动,几乎从来不是算力不够,而是撞了两堵墙——容量墙和带宽墙。这是一篇讲清楚「统一内存为什么决定生死」「CUDA 凭什么是护城河」的工程笔记。

系列 / 本地 AI 硬件第一性 受众 / 想在本地跑大模型的开发者 · 创作者 关键词 / 统一内存 · CUDA · 内存带宽墙
在 RTX Spark 之前,「CUDA 生态」和「统一内存的能效」这两件事,在一台 PC 上不可兼得。

英伟达 GTC Taipei 2026 把传说中的 GB10(DGX Spark 同款芯片)下放到消费级 RTX Spark。但真正决定本地大模型体验的四个数字,藏在这里——其中一个会颠覆你对「英伟达=最快」的直觉。

统一内存容量
128 GB
vs 独显 24GB · 拆掉容量墙
GB10 内存带宽
273 GB/s
vs M3 Ultra 819 · 反而更低
PCIe 带宽墙
~32 GB/s
vs 显存 1TB/s · 慢 30 倍
CUDA 生态年龄
20 年
2006→2026 · AI 工程母语
Q1我有 RTX 4090、24GB 显存,为什么连一个量化后的 70B 模型都跑不动?
Q2统一内存到底解决了什么?为什么说它对本地大模型是「生死」级别的差别?
Q3Mac 也有 128GB 统一内存,带宽(819)还比 GB10(273)高,那我直接买 Mac 不行吗?
Q4CUDA 到底是什么,凭什么是护城河?Apple 的 Metal / MLX 差在哪?
Q5既然 RTX Spark 的带宽比 Mac 还低,那它真正的杀手锏到底是什么?
Q6推理、微调、训练这三件事,在 RTX Spark 和 Mac 上分别是什么体验?
ACT I · 起源 Two Pools of Memory

01两块各过各的内存

先记住一个反直觉的数字:同一块 GPU,读自己的显存有 1TB/s,但去读隔壁 CPU 的系统内存,只剩 ~32GB/s——慢了整整 30 倍。本地大模型所有的"卡",几乎都从这道 30 倍的落差里来。

过去三十年,一台 Windows PC 的算力是分裂的。CPU 有自己的系统内存(RAM),比如 64GB;GPU 有自己的显存(VRAM),比如 RTX 4090 的 24GB。两块内存物理上分开,由两家不同的厂商(Intel/AMD 做 CPU,NVIDIA 做 GPU)各自做主,中间靠一条叫 PCIe 的总线来回搬数据。

这套架构服务图形渲染和游戏几十年都没问题——因为游戏的数据量是"一次性灌进显存就开跑"。但大模型不一样:它需要 GPU 持续、高频地访问几十 GB 的权重,一旦这些权重塞不进显存、得放到系统内存里,那条 32GB/s 的 PCIe 就成了致命的瓶颈。

为什么是英伟达第一个把这事捅破

统一内存(把 CPU/GPU 的内存合成一个共享池)本身不是新概念——游戏主机、集成显卡早就在用。真正的难点是:在消费级单机上,把它做成既大(能装下大模型)又快(带宽够喂饱 GPU)、还有完整 AI 生态。Apple 用 M 系列芯片第一个在消费级把"大 + 快"铺开,英伟达则在 2026 年用 GB10 把"统一内存 + CUDA"第一次捏到了一起。

1990s–2010s
Wintel 分裂内存时代CPU + RAM、独显 + VRAM 各自为政,PCIe 当桥。为图形和游戏优化,从没为"GPU 高频访问几十 GB 权重"设计过。
2020
Apple M1 统一内存登场CPU/GPU/NPU 共享一个高带宽内存池,消费级第一次把统一内存做成主流默认。后来 M3 Ultra 做到 819GB/s、最高 512GB。
2025
NVIDIA DGX Spark(开发者版)GB10 超级芯片:Grace(ARM)CPU + Blackwell GPU + 128GB LPDDR5X 统一内存,跑 Linux 系 DGX OS,面向开发者。
2026 · GTC Taipei
RTX Spark 下放消费级据卡兹克报道,同款 GB10 升级成消费产品线,微软联手重构 Windows for Agent,联想 / HP / ARM 接力出机。
先厘清一个常见误解

"统一内存"不等于"内存变快了"。它解决的首先是容量问题——让 GPU 能直接寻址一大池内存、不必走 PCIe 搬运。带宽是另一个独立维度,后面 ACT III 会看到,GB10 的统一内存带宽其实是这一代的短板。

ACT II · 冲突 The Wall That Kills Local LLMs

02内存墙才是生死线

回到 Q1:你有一张 4090,FP16 算力 80+ TFLOPS,游戏里画面拉满毫无压力。可你想在本地跑一个量化到 4-bit 的 70B 模型,它就是跑不动。算力明明过剩,问题出在哪?

算给你看。一个 70B 模型,4-bit 量化后约 40GB。你的 4090 只有 24GB 显存——装不下。于是框架只能把一部分权重 offload 到 64GB 系统内存里。GPU 每生成一个 token,都要读一遍全部权重;放在系统内存里的那部分,每次都得走 PCIe 那条 ~32GB/s 的龟速通道去拿。于是 GPU 大部分时间在干等数据,算力空转

大模型的解码(生成 token)本质是内存带宽受限的:理论速度 ≈ 内存带宽 ÷ 每次要读的权重量。所以决定快慢的从来不是 TFLOPS,而是"权重能不能被高速喂进 GPU"。这就是内存墙。

同一个 70B-Q4,三种机器三种命运

机器配置能装下 40GB 模型?有效带宽解码体验(理论上限 ≈ 带宽/40GB)
RTX 4090 · 24GB 显存 + 64GB RAM装不下~32 GB/s(PCIe 卡死)权重溢出走 PCIe,<1 tok/s,基本不可用
Mac Studio · M3 Ultra 128GB 统一内存装得下819 GB/s~20 tok/s 理论上限,流畅可用
RTX Spark · GB10 128GB 统一内存装得下273 GB/s~6–7 tok/s 理论上限,能跑但不快

看出张力了吗?在"装不装得下"这个生死问题上,两台统一内存机器对 4090 是降维打击;但在"装下之后跑多快"上,Mac 的 819GB/s 反而把 GB10 的 273GB/s 甩在身后。这正是 Q3、Q5 的核心矛盾,留到 ACT III、IV 解。

"GPU 不是不够快,
是被一条 32GB/s 的水管活活渴死。"

ACT III · 现状 Capacity vs Bandwidth

03拆墙的两种工程解

统一内存的原理一句话:把 CPU 和 GPU 的内存合并成同一个物理池,谁都能直接寻址,权重不再需要在两块内存之间通过 PCIe 来回搬。容量墙和带宽墙——两堵墙一次拆掉一大半。但"拆得多干净",Apple 和英伟达走了两条参数完全不同的路。

内存带宽对决 · 谁喂 GPU 喂得最快(GB/s,条宽按带宽比例)

RTX 4090 显存
1008
M3 Ultra
819
GB10
273
PCIe5
~64
独显显存:最快,但容量只有 24GB,装不下大模型 Mac M3 Ultra:又大又快,但没有 CUDA GB10:容量够、带宽中等,胜在 CUDA PCIe:传统 PC 的咽喉,慢得离谱

维度一:容量——两家都赢了独显

128GB(GB10)和最高 512GB(M3 Ultra)的统一内存,意味着 70B、120B 甚至更大的模型可以整个装进去,彻底绕开 PCIe。这一维度上,统一内存对传统"小显存独显"是结构性碾压。

维度二:带宽——Apple 这代反而更猛

GB10 的统一内存是 256-bit、LPDDR5X-8533,实测带宽 273GB/s。Apple 靠 UltraFusion 把两颗 M3 Max 拼成 M3 Ultra,做到 819GB/s,是 GB10 的 3 倍。所以纯比"装下同一个 dense 模型后谁吐字快",Mac Ultra 反而领先。

别被"统一内存"四个字骗了

很多人默认"英伟达 = 最快",但 GB10 这一代的统一内存带宽(273GB/s)是它明显的短板——既低于 Mac Ultra(819),更远低于独显显存(1TB/s+)。如果你的需求是纯推理、追求 token 吞吐,GB10 不是最快的那一个。它的价值得换个维度去看——也就是 ACT IV 的 CUDA。

一个加分的细节:MoE 模型改写了带宽账

卡兹克说 GB10「轻松跑 120B」并不夸张——因为热门的 120B 级模型多是 MoE(专家混合),每个 token 只激活约 5B 参数。带宽压力落在"激活的那一小部分"而非全部权重上,所以 120B MoE 在 273GB/s 上反而可能比 70B dense 更跟手。容量装得下 + 只读激活专家 = 统一内存的甜区。

ACT IV · 生态 Twenty Years of CUDA

04CUDA 的二十年护城河

既然 Mac 的统一内存又大又快,为什么开发者还在等 RTX Spark?答案是 Q4、Q5 的核心:CUDA。它不是显卡驱动,也不只是"GPU 加速",而是一整套打磨了 20 年的生态,分三层。

层级CUDA 里有什么作用
底层把 GPU 当通用计算器编程除了渲染,还能做任意数学计算
中层cuBLAS · cuDNN · TensorRT · NCCL · FlashAttention20 年打磨的数学/深度学习/推理/多卡通信库,新优化优先适配 NVIDIA
上层PyTorch · TensorFlow · JAX 的默认且首选 GPU 后端几乎所有深度学习框架,开箱即用的就是 CUDA
新增CUDA-X:cuLitho · cuOpt · cuDSS · Parabricks…横跨科学计算/仿真/基因组学的加速库,这次还开放给 Agent 直接调用

真正的杀伤力不在库本身,而在惯性:你今天去看学术论文放出的开源代码,绝大多数是在 CUDA 上写和测的;你遇到任何深度学习问题去搜,搜出来的答案默认假设你在用 CUDA。整个 AI 工程界的"母语"就是 CUDA——这是 20 年、上万个仓库累积出来的,钱砸不出来。

Apple 的痛点:硬件够强,方言太小众

Mac 的统一内存确实牛,但它的 GPU 用的是 Metal,机器学习框架是 MLX。社区里绝大部分开源模型、训练代码、微调工具,都是先在 CUDA 上做好,然后才慢慢有人移植到 MLX。结果就是:

维度CUDA(NVIDIA)Metal / MLX(Apple)
框架默认后端PyTorch/TF/JAX 首选需 MLX 或移植分支
推理成熟可用(llama.cpp/MLX 已不错)
微调 / 训练生态完整薄弱,工具链滞后
开源代码即跑性复制即用常需等移植/改写
新优化(如 FlashAttention 新版)优先支持滞后数月起
"推理还好说,但训练和微调在 Apple 上的生态,到今天还是非常薄弱。社区代码都是先在 CUDA 上做好的,再慢慢移植到 MLX。" — 数字生命卡兹克《英伟达发布全新 RTX Spark》

所以 Q5 的答案清楚了:RTX Spark 的杀手锏不是带宽,是 CUDA。在它之前,"想要 CUDA"和"想要统一内存的大容量与能效"在 PC 上不可兼得——Apple 给你统一内存却没 CUDA,NVIDIA 给你 CUDA 却被显存大小锁死。RTX Spark 第一次把这两件原本打架的东西捏到一起。

ACT V · 选型 Which One Is Yours

05三类需求,三种最优解

把前面四幕的结论落到决策:不存在"谁全面更好",只存在"你的工作负载更吃哪一项"。容量、带宽、生态——你最缺哪一项,就选补哪一项的机器。

需求 A · 微调/训练
RTX Spark
CUDA 决定

要在本地微调、训练、跑前沿开源代码。

  • 开源代码默认 CUDA,复制即跑
  • 128GB 统一内存装得下大模型
  • 带宽中等,但训练/微调更吃生态
需求 B · 推理+创作
Mac
带宽+省心

主要做推理、内容创作,要安静低功耗。

  • 819GB/s 带宽,dense 模型吐字更快
  • 最高 512GB,超大模型也装得下
  • 训练/微调生态弱,纯推理无碍
需求 C · 小模型+游戏
独显 PC
显存最快

只跑能塞进显存的小模型,还要打游戏。

  • 显存 1TB/s+,小模型推理最快
  • 游戏性能无可替代
  • 大模型一旦溢出显存就崩

三台机器,各自的甜区和死穴

① RTX Spark(GB10)

把 CUDA 生态 + 大容量统一内存第一次捏到一台 PC 上。Grace ARM CPU + Blackwell GPU + 128GB LPDDR5X。

甜区:本地微调/训练、跑最新开源代码、还想顺便打游戏
死穴:273GB/s 带宽不是最高;Windows for Agent 生态待落地验证
CUDA + 容量,唯它兼得

② Mac(M3 Ultra / M4 Max)

统一内存的开创者,带宽与容量这代领先(819GB/s、最高 512GB),生态成熟、能效与静音一流。

甜区:纯推理吞吐、创作、长时间安静运行
死穴:Metal/MLX 训练微调薄弱,开源代码常要等移植
又大又快,但缺 CUDA

③ 传统独显 PC(如 4090/5090)

显存带宽天花板(1TB/s+),游戏与小模型推理之王,但被显存容量死死锁住。

甜区:游戏 + 能塞进 24/32GB 显存的中小模型
死穴:模型一溢出显存,PCIe 32GB/s 直接判死刑
最快,但装不下大的
一句话决策树

微调/训练 + 跑最新代码 → RTX Spark(为 CUDA 买单)。只做推理与创作、要省心 → Mac(为带宽和能效买单)。只跑小模型 + 重度游戏 → 独显 PC(为显存速度买单)。三者不是"好坏"之分,是"你撞的是哪堵墙"之分。

底色判断 — 战争打的是内存墙,胜负手是生态

本地大模型这场仗,第一性原理始终是两堵墙:容量墙(装不装得下)和带宽墙(喂不喂得饱)。统一内存是这两堵墙的共同解,Apple 与英伟达都已跨过门槛。真正分出胜负的,是墙后面那层 20 年攒出来的生态——CUDA。

RTX Spark 的历史意义不在"参数最强"(它的 273GB/s 甚至输给 Mac 的 819GB/s),而在它第一次让 PC 用户不必在「CUDA」和「统一内存能效」之间二选一。这是以前任何单一平台都给不了的组合。

"决定本地大模型生死的,从来不是 GPU 多快,而是内存能不能喂饱它、生态认不认它。"

Q1 答案:不是算力不够,是 24GB 显存装不下 40GB 的 70B-Q4,溢出部分走 32GB/s 的 PCIe 把 GPU 渴死。

Q2 答案:它把 CPU/GPU 内存合成一池,GPU 直接寻址、不走 PCIe,先拆容量墙、再缓解带宽墙——这是"能不能跑"的生死差别。

Q3 答案:纯推理可以买 Mac,它带宽更高更省心;但训练/微调、跑最新开源代码,Mac 的 Metal/MLX 生态会让你处处等移植。

Q4 答案:CUDA 是 20 年累积的三层生态(通用计算→数学库→框架默认后端),是 AI 工程界的母语;Metal/MLX 是小众方言,推理够用、训练微调薄弱。

Q5 答案:不是带宽,是 CUDA + 大容量统一内存的"组合"——以前在 PC 上不可兼得,RTX Spark 第一次同时给齐。

Q6 答案:推理两家都行(Mac 吞吐更高);微调 RTX Spark 明显占优;训练严肃任务首选 CUDA,Mac 基本出局。

06三类读者的对照建议

① AI 应用开发者 / 微调玩家

你要 LoRA 微调、跑别人刚开源的训练脚本、复现论文。这些代码 99% 默认 CUDA,Mac 上常要等移植或自己改 MLX。

建议:RTX Spark 是顺路最少的那条。先确认你常用的框架/工具链对 GB10(ARM + Blackwell)的预编译支持是否就位,再下单。

② 内容创作者 / 重推理用户

你主要做本地推理、剪辑、生图,不碰训练,看重安静和能效。dense 模型的吐字速度直接吃内存带宽。

建议:Mac(M3 Ultra/M4 Max)依然香——819GB/s 带宽 + 成熟工具链 + 静音低功耗。等 RTX Spark 整机实测带宽与噪音数据出来再横向比。

③ 学生 / 预算有限的入门者

你预算有限,只想先跑得动中小模型、顺便打游戏,不急着碰 70B 以上。

建议:一张二手/中端独显 PC 仍是性价比之选——把模型控制在显存能装下的范围(如 7B–14B),显存 1TB/s 带宽反而最快。等真要碰大模型再升级到统一内存平台。

0710 个该盯住的信号

#信号触发判断 / 动作
1RTX Spark 整机实测内存带宽若实测显著高于 273GB/s(如新一代 GB10 提升),推理结论需上修
2RTX Spark 定价 vs 同容量 Mac价差决定"为 CUDA 多付多少"是否值
3Windows for Agent / OpenShell 落地从 PPT 到可用的时间,决定"Windows 生态有救"是不是真的
4PyTorch/框架对 GB10(ARM+Blackwell)预编译轮子没有现成 wheel,"CUDA 即插即用"会打折
5Apple MLX 训练/微调生态进展若 MLX 训练补齐,Mac 的最大短板被填,格局变
6llama.cpp / vLLM 对 GB10 的优化成熟度社区适配速度直接影响开箱体验
7120B 级 MoE 模型在 GB10 的实测 tok/s验证"统一内存甜区"是否成立
8联想/HP 等整机的散热与噪音笔记本形态下能否持续跑 AI 负载不降频
9Adobe 等对 RTX Spark 的实际优化兑现"2x 速度 + 原生 Agent 调用"是否如发布会所说
10下一代 PCIe 6.0 / CXL 普及若总线带宽追上来,传统独显的"容量墙"或被缓解

"硬件给你拆了墙,
真正住进去的,是那 20 年的生态。"

主要数据来源 / Data Sources

· 数字生命卡兹克《英伟达发布全新 RTX Spark — 个人 PC 的新时代》 · mp.weixin.qq.com

· NVIDIA DGX Spark 官方 / Hardware Overview(128GB · 273GB/s LPDDR5X) · docs.nvidia.com

· LMSYS《DGX Spark In-Depth Review:本地 AI 推理》 · lmsys.org

· Tom's Hardware《NVIDIA DGX Spark Review · GB10 Superchip》 · tomshardware.com

· Apple Mac Studio 技术规格(M3 Ultra 819GB/s · 最高 512GB) · apple.com

· chiplog《Analysis of NVIDIA DGX Spark's GB10 SoC》 · chiplog.io

KOS Tech Brief · Vol.1 No.4 · 2026.06.01
数字是结论,叙事是支撑 · 容量、带宽、生态,先搞清你撞的是哪堵墙