英伟达于 2026 年 10 月 2 日正式推出 DGX Spark 64GB 桌面 AI 超算,起售价 4,999 美元(约合人民币 3.5 万元),比原版 128GB 便宜近 2,000 美元,宏碁、华硕、戴尔、技嘉、微星、H3C 等 OEM 厂商将于 10 月 23 日同步发售。这是英伟达首次将 GB10 Grace-Blackwell 超算芯片下放到消费级桌面产品线,标志着桌面端 AI 计算正式进入「超算芯片时代」。
两款 DGX Spark 配置对比
DGX Spark 家族现共有两款配置,覆盖不同规模需求:
| 配置项 | DGX Spark 64GB(新品) | DGX Spark 128GB(原版) |
|---|---|---|
| 统一内存 | 64GB(系统预留约 8GB,可用 56GB) | 128GB(可用约 120GB) |
| 起售价 | $4,999 | $6,950 |
| 单机能跑最大模型 | 100B 参数 | 200B 参数 |
| 芯片 | GB10 Grace-Blackwell | GB10 Grace-Blackwell |
| ConnectX-7 | 200 GbE(内置) | 200 GbE(内置) |
| 双机集群内存 | 128GB(拼两台) | 256GB |
| 集群性能提升 | 最高 +70%(双 64GB vs 单 128GB) | — |
| 量化格式 | NVFP4 | NVFP4 |
| 预装推理框架 | llama.cpp / Ollama / vLLM / LM Studio | 同上 |
核心架构:统一内存打破 CPU/GPU 边界
DGX Spark 基于英伟达 GB10 Grace-Blackwell 超算芯片,与传统 x86 工作站最大的架构差异是统一内存架构——CPU 和 GPU 共享同一块物理内存,模型权重和 KV 缓存都在同一空间内,无需通过 PCIe 在 CPU 内存和 GPU 显存之间搬运数据。这消除了传统异构计算中的内存拷贝瓶颈,对大模型推理至关重要。
64GB 版本实际可用于模型推理的约 56GB,支持 NVFP4 量化格式,可在精度损失较小的情况下进一步扩大有效容量。根据官方测试,64GB DGX Spark 可流畅本地部署以下主流开源模型:Gemma4 26B、Qwen3.8-27B、Meta Muse Glimmer、Nemotron3.5 Lightning。加载完成后仍有充足内存余量用于 KV 缓存,支撑长上下文推理任务。
双机集群:拼成 128GB,性能提升 70%
DGX Spark 64GB 最大的产品亮点是原生多机集群扩展能力。每台设备均内置 ConnectX-7 高速网卡,搭配全新 NVIDIA Sync 工具套件,普通开发者无需深厚网络运维知识,即可搭建多节点集群。Sync 套件内置 Cluster Assistant 集群助手,自动完成网络配置、设备校验、SSH 环境部署,最多支持 4 台 DGX Spark 组网。
两台 64GB DGX Spark 通过 QSFP 线直连(200 GbE fabric),即可组成 128GB 统一内存集群。英伟达实测:两台 64GB 集群运行 Qwen3.8-27B 模型,相比单台 128GB 设备性能最高提升 70%。这一结果看似反直觉(双 64GB 总内存比单 128GB 还少),但背后的逻辑是:双机集群的内存带宽是单台的两倍,而 Qwen3.8-27B 属于内存带宽敏感型任务,带宽翻倍带来的收益超过了内存总量减少的损失。
开发者还可以从普通 PC 远程接入 DGX Spark 集群,对接 VS Code、Cursor 等主流 IDE,远程监控整机状态,一键启动 vLLM 推理容器,大幅降低分布式 AI 开发门槛。
软件生态:CUDA 加速,预配主流推理框架
DGX Spark 完整搭载英伟达 CUDA 加速 AI 软件栈,深度适配 vLLM、llama.cpp、Ollama、LM Studio 等主流推理框架,针对本地智能体工作流做专项优化,官方宣称运行本地智能体推理最高可实现 1.9 倍速度提升。Build.nvidia.com 上已上线多个现成的 Agent Playbook,包括 NeMoClaw、OpenClaw、OpenShell 等开源框架,开发者下载后可直接在 DGX Spark 上部署运行。
10 月底还将上线 Sync Model Launcher,支持一键部署 Qwen3.8-27B 模型到单台或集群,并自动配置 OpenCode 远程编程环境,让开发者直接在浏览器里写代码、调试分布式 AI 应用。
目标用户与竞品对比
英伟达将 DGX Spark 定位于「个人 AI 超算」,目标用户包括:独立 AI 研究者、小团队机器学习工程师、想在本地跑大模型的开发者、以及对数据隐私有严格要求不能上云的企业用户。
竞品层面,苹果 Mac Studio M4 Ultra(192GB 统一内存)在内存容量上有优势,但 GPU 算力受限于移动芯片架构,在大规模推理任务中不如专用超算芯片;x86 迷你工作站(如英特尔 NUC 12 Extreme)则在 AI 推理优化和软件生态上远不如英伟达完整。DGX Spark 的护城河在于 GB10 芯片加 CUDA 软件栈加英伟达 AI 生态的完整绑定,这套组合在桌面 AI 计算领域暂无直接竞争对手。
Windows RTX Spark 也在路上
除 DGX Spark 外,英伟达还预告搭载 RTX Spark 显卡的 Windows PC 将于本月上市,来自宏碁、华硕、戴尔、惠普、联想、微软和微星。RTX Spark 是英伟达面向消费级 PC 的本地 AI 加速品牌,主要面向需要在 Windows 桌面端运行本地 AI 应用的开发者,与 DGX Spark 形成从专业桌面到消费桌面的全覆盖。
FAQ
4999 美元的 DGX Spark 64GB 和 6950 美元的 128GB 版怎么选?
如果主要跑 100B 以下模型,选 64GB 更划算——便宜近 2,000 美元,双机集群还能获得 70% 性能提升。如果需要单机能跑 200B 超大模型(如 GPT-4 级别),才需要选 128GB。另一个考虑因素是扩展路径:64GB 的扩展成本更低,两台 64GB 总价 9,998 美元,仍比单台 128GB 便宜约 1,000 美元,且性能更强。
两台 64GB 集群比单台 128GB 强在哪里?
双 64GB 集群的内存带宽是单台的两倍,英伟达实测 Qwen3.8-27B 吞吐量提升 70%,超过了单 128GB 的性能。但两台设备意味着两倍功耗、两倍散热空间,实际部署需考虑硬件环境是否有足够空间和电力。
普通开发者需要 DGX Spark 吗?
如果你的工作流需要本地跑 10B-100B 参数模型、构建和测试 AI Agent、或对数据隐私有严格要求不能上云,DGX Spark 是目前桌面端体验最完整的英伟达 AI 计算平台。但如果只是跑跑 7B 以内的小模型,MacBook Pro 或配备 RTX 4090 的游戏主机也能满足需求,不必花这笔预算。
小结
DGX Spark 64GB 的发布,是英伟达将企业级 AI 算力下放到桌面端的关键一步。4999 美元的起售价虽然不便宜,但相比持续购买云端 A100/H100 实例的长期费用,本地部署对于高频 AI 开发者来说经济性更优。双机集群的创新设计(用两台便宜机器超越一台贵机器)显示了英伟达在产品定义上的务实。对于需要本地跑 Agent、调试开源大模型、或构建私有 AI 流水线的团队,DGX Spark 64GB 是目前最值得考虑的桌面 AI 超算,10 月 23 日起可通过主流 OEM 厂商购买。
相关阅读:英伟达 Open Agent 安全平台:BlueField 配 OpenShell,百家厂商站队
延伸阅读
- 英伟达Open Agent安全平台:BlueField配OpenShell,百家厂商站队20 小时前
- 英伟达发布 OpenShell 安全工具:阻止 AI 智能体绕过限制4 天前
- OpenClaw Enterprise:OpenAI、红帽、英伟达联手做AI智能体控制层2 天前
- Anthropic 与 SpaceX 签 845 亿美元算力协议3 天前
