跳到正文

我們打包的硬件——可選

NVIDIA DGX Spark,放在辦公室

Sophia Gate 是私有 AI 平台。NVIDIA DGX Spark 是我們打包的 SKU,不是強制:達到下限的 128 GB Apple 芯片 Mac、128 GB Linux 工作站,或帶合適 NVIDIA 顯存的 Windows(Qwen3.8-27B 約 24 GB 顯存;Flash 3-bit 要留在卡上約 96 GB 顯存),也能在本地跑這兩個模型。指定 Spark,是因為你要 128 GB 一致性統一記憶體、CUDA、DGX OS、以及雙機集群路徑,放在辦公室。本頁是規格與對照,不是宣稱 Spark 在每一項測試都最快。

00不必買 Spark

DGX Spark 是核心+硬件方案裡打包的 SKU。不含硬件的核心服務(HK$28,800)跑在你已有的機器上——Apple 芯片 Mac、Linux,或帶合適 NVIDIA 顯存的 Windows——只要達到下面的下限。下限是為了讓 DeepSeek V4 Flash(3-bit)與 Qwen3.8-27B 能在本地跑。這是已公布檔案大小對記憶體,不是每秒 token 承諾。

本地跑這兩個模型的下限

卡邊的是 DeepSeek V4 Flash 3-bit(權重約 103 GB;建議約 110 GB 記憶體,才能放得下檔案、作業系統、運行時和有界 KV)。Qwen3.8-27B 4-bit 約 17 GB,記憶體夠了就寬裕。Mac/Linux/Windows 上,128 GB 統一記憶體或系統記憶體是各自能在本地跑的下限。Windows 上,顯存夠大也可以把模型放在卡上。兩個模型同時常駐再加長上下文,在 128 GB 上會緊——卸下一個,或加記憶體/顯存。

記憶體128 GB 統一記憶體(Mac/Spark 這一檔)或 128 GB 系統記憶體(Linux 或 Windows)。這是 Flash 3-bit 的下限,除非顯卡本身約 96 GB 顯存。64 GB 記憶體裝不下那份 3-bit 檔。
系統Apple 芯片上的 macOS、Linux(x86_64 或 Arm),或帶 NVIDIA 顯卡的 Windows 10/11。只要達到記憶體/顯存下限,三條都是正路。
儲存至少 500 GB 可用 NVMe(Flash 約 103 GB + Qwen 約 17 GB + 系統 + AI 資料庫)。1 TB 才寬裕。
GPU/顯存128 GB 統一記憶體的 Mac 或 Spark 不必另加獨顯。Windows 或 Linux 配獨立 NVIDIA 顯卡:顯存要裝得下你真正在卡上跑的模型。Qwen3.8-27B(4-bit 約 17 GB)要約 24 GB 顯存。DeepSeek V4 Flash 3-bit(約 103 GB)要約 96 GB 以上顯存才能留在卡上(RTX PRO 6000 這一檔)。24–32 GB GeForce 適合跑 Qwen;跑 Flash 3-bit 還要約 128 GB 系統記憶體做卸載,比一池統一記憶體慢。
網絡產品是本地的。不必雲端 token。辦公室 1 GbE 就夠坐在機器旁邊用。

這個下限是為誰設的

  1. DeepSeek V4 Flash — 3-bit

    Unsloth UD-IQ3_XXS 約 103 GB,建議 ≥110 GB 記憶體,才能讓檔案、作業系統、運行時和有界 KV 共存。所以我們寫 128 GB,不是 64 GB。

  2. Qwen3.8-27B

    稠密約 270 億,常見 4-bit 約 17 GB。同一台 128 GB 機器上寬裕。不是定下限的那個模型。

低於下限

  • 64 GB 或 96 GB 統一記憶體的 Mac——Qwen3.8-27B 能跑;Flash 3-bit 放不進可用上下文。
  • 24–32 GB GeForce、系統記憶體不到 128 GB 的 PC——顯存適合跑 Qwen;不夠把 Flash 3-bit 留在卡上。
  • 只連雲的筆電——權重和 AI 資料庫應留在現場。

我們怎麼建議

  1. 01已有 128 GB 的 Mac Studio/MacBook Pro(M4 Max 或 M3 Ultra 這一檔)或 128 GB Linux 工作站:用它。買不含硬件的核心服務。
  2. 02已有帶合適 NVIDIA 顯卡的 Windows PC:Qwen3.8-27B 要約 24 GB 顯存;Flash 3-bit 要留在卡上要約 96 GB 顯存。24–32 GB 卡加 128 GB 記憶體仍可用卸載跑 Flash 3-bit。買不含硬件的核心服務。
  3. 03達不到這些下限,或你要 CUDA、DGX OS、以及以後雙 Spark 集群:選全包 Spark(核心+硬件)。
  4. 04需要 Flash 與 Qwen 同時常駐、再加長上下文:傾向 192 GB 或以上(Mac Ultra 256/512,或第二台 Spark),或約 96 GB 顯存再加夠用的主機記憶體。128 GB 是各自能在本地跑的公布下限,不是保證兩個模型同時躺在記憶體裡。

大小是已公布的 GGUF/量化檔與廠商記憶體,不是我們的每秒 token。權重放得進,不是速度或質量承諾。

查看收費方案

01為什麼業務端指定這台機器

產品是交鑰匙的私有 AI,跑在客戶自己的機器上。指定 Spark,是因為它同時具備 128 GB 一致性記憶體池、軟件實際運行的 CUDA 棧、有文檔的雙機集群路徑,以及 240 W 可放辦公室的體積。數據留在本機。

  1. 01

    本地模型,本地數據

    權重、對話紀錄與 AI 資料庫都留在這台機器。不設常駐遠端控制通道。更新為拉取式、客戶端發起、加密簽名、可回滾。

  2. 02

    128 GB 一致性統一記憶體

    CPU 與 GPU 共用一池 128 GB LPDDR5x(NVIDIA:256-bit、273 GB/s)。約 100 GB 的 3-bit 混合專家模型,不必拆到 24–32 GB 顯卡再經 PCIe 回灌系統記憶體。

  3. 03

    產品實際跑的 CUDA 棧

    DGX OS、CUDA、NVIDIA NIM、vLLM、Ollama、TensorRT-LLM。智能體工作流與推理服務對準這條棧。Mac 在 Metal/MLX 推理上強,但不是這條軟件路徑。

  4. 04

    桌面體積、可常開

    150 × 150 × 50.5 mm、1.2 kg、240 W 電源、140 W GB10 TDP(NVIDIA)。NVIDIA 公布運行聲功率 35 dB LWA,m。定位是桌面智能體電腦,不是要機房的機架。

  5. 05

    一台不夠時可以集群

    ConnectX-7、200 Gbps、兩個 QSFP。NVIDIA 公布兩台 Spark 可連,用於最高約 4050 億參數的模型。同一套軟件路徑放大,不必換另一家的網絡結構。

02公布硬件(NVIDIA)

本表數字是 NVIDIA 公布規格,不是我們在你文件上跑出來的量測。

超級芯片NVIDIA GB10 Grace Blackwell
CPU20 核 Arm(10× Cortex-X925 + 10× Cortex-A725)
GPUBlackwell、第 5 代 Tensor Cores、第 4 代 RT Cores、6,144 CUDA 核心
記憶體128 GB LPDDR5x 一致性統一記憶體,256-bit,273 GB/s
AI 算力(NVIDIA)最高 1 PFLOP FP4(含稀疏);推理最高 1,000 TOPS
推理(NVIDIA)單機模型最高約 2000 億參數
微調(NVIDIA)模型最高約 700 億參數
集群(NVIDIA)兩台 Spark 經 ConnectX-7:模型最高約 4050 億參數
網絡ConnectX-7 200 Gbps(2× QSFP)、10 GbE RJ-45、Wi-Fi 7、藍牙 5.4
儲存1 TB 或 4 TB 自加密 NVMe
I/O4× USB-C、HDMI 2.1a;CPU–GPU 之間 NVLink-C2C
功耗/體積240 W 電源、140 W GB10 TDP、150 × 150 × 50.5 mm、1.2 kg
系統/棧NVIDIA DGX OS、CUDA、NVIDIA NIM、PyTorch、TensorRT-LLM
03128 GB 裡實際放得進什麼

這裡的「放得進」指已公布的權重檔大小相對 128 GB 統一記憶體,再留作業系統、運行時和有界 KV 快取。不是每秒 token 量測,也不是質量排名。

  1. 大型本地模型

    DeepSeek V4 Flash — 3-bit

    DeepSeek-V4-Flash-0731 是大型混合專家(MoE)檢查點。Unsloth 公布的 3-bit GGUF UD-IQ3_XXS 約 103 GB,建議至少約 110 GB 記憶體,才能讓檔案、作業系統、運行時和有界上下文共存於 128 GB 機器。這才是我們說的 3-bit 適配。其他 3-bit 檔有 114–128 GB,幾乎沒有餘量——那是另一份檔,不是這項說法。長 Think-Max 上下文仍要額外記憶體。權重放得進,不是速度承諾。

  2. 日常主力

    Qwen3.8-27B

    阿里巴巴 Qwen3.8-27B 是約 270–280 億參數的稠密多模態模型(文本、圖像、長上下文)。常見 4-bit 約 17 GB。在 128 GB 統一記憶體上,長上下文、視覺、並發智能體工作流和 AI 資料庫都有餘量。這是寬裕檔,不是卡邊檔。

NVIDIA 自己給的單機範圍:推理最高約 2000 億參數、微調最高約 700 億。兩台 Spark:最高約 4050 億。這些是廠商數字,不是我們的基準。

04擴展集群

Spark 被指定為一台可以長大的機器。集群在背板,不是事後加卡的工程。

  1. 01ConnectX-7 SmartNIC、200 Gbps、兩個 QSFP——NVIDIA 公布這是連接兩台 Spark 的路徑。
  2. 02雙 Spark 配置:NVIDIA 數字是最高約 4050 億參數,同一套 DGX OS、同一套 CUDA,記憶體池更大。
  3. 03先在辦公室放一台。模型更大或並發智能體更多時再加第二台。軟件路徑不變。
  4. 04NVIDIA 自己的敘述是:在 Spark 上原型,再把同一套棧遷到 DGX 雲或數據中心。這是路徑,不是強制。
05業務現場還看重的其他優點
  1. 01

    CPU–GPU 一致性記憶體

    權重不必在小顯存卡和大記憶體條之間經 PCIe 來回搬。128 GB 是同一地址空間。

  2. 02

    FP4 Tensor Cores

    第 5 代 Tensor Cores、FP4(NVIDIA:最高 1 PFLOP,含稀疏)。長提示和帶工具的智能體偏算力,不只受解碼帶寬限制。

  3. 03

    自加密 NVMe

    1 TB 或 4 TB,自加密。放權重和 AI 資料庫的盤是加密裝置。

  4. 04

    辦公室功耗

    240 W 牆插。一台想用 96 GB 專業卡加大記憶體來對齊這項本地模型工作的 Windows 工作站,通常是 850–1600 W 塔機。

  5. 05

    一家廠商、一份系統鏡像

    DGX OS、CUDA、NIM。不是要實習生養活的改裝遊戲機。

  6. 06

    智能體軟件

    NVIDIA 把 Spark 定位為桌面智能體電腦。Sophia Gate 帶閘門的智能體工作流就跑在這一類機器上。

06Spark vs Mac Studio vs 同級 Windows PC

同一項工作:跑本地模型(含 DeepSeek V4 Flash 3-bit 與 Qwen3.8-27B)、數據留在現場、以後還能長大。Windows 列是這一工作量級的工作站——約 128 GB 系統記憶體加一塊獨立 NVIDIA 顯卡(GeForce 約 32 GB 或 RTX PRO 約 96 GB)——不是 8 卡數據中心節點,也不是便宜辦公 PC。

NVIDIA DGX Spark

GB10 · 128 GB 統一記憶體 · CUDA

Mac Studio(128 GB 檔)

M4 Max 最高 128 GB;M3 Ultra 最高 512 GB

同級 Windows PC

128 GB 記憶體 + 獨立 NVIDIA 顯卡

記憶體結構128 GB LPDDR5x 一致性統一記憶體(CPU + GPU 一池)。不可加條。統一記憶體。M4 Max 最高 128 GB;M3 Ultra 最高 512 GB(Apple 2025 Studio)。拆開:系統記憶體 + 獨立顯存。32 GB 卡裝不下 103 GB 的 3-bit 檔;剩下的權重經 PCIe 卸載。
記憶體帶寬273 GB/s(NVIDIA)。約 546 GB/s(M4 Max)/約 819 GB/s(M3 Ultra)。模型已經放得進時,更高帶寬往往解碼更快。卡上 GDDR 很快;CPU↔GPU 是 PCIe。卸載 100 GB 模型是慢路徑。
CUDA/推理棧原生 CUDA、DGX OS、NVIDIA NIM、TensorRT-LLM、vLLM、Ollama。無 CUDA。MLX 與 llama.cpp Metal。推理強;不是 NVIDIA 訓練/服務路徑。顯卡是 NVIDIA 就有 CUDA。Windows 或 WSL。棧要自己組,不是 DGX OS 鏡像。
集群擴展ConnectX-7 200 Gbps;NVIDIA 雙 Spark 路徑最高約 4050 億參數。Thunderbolt/乙太網。沒有 NVIDIA 織物,沒有公布的雙機 4050 億 SKU。自己加網卡和顯卡。電源、驅動、散熱變成項目。
DeepSeek V4 Flash 3-bit(約 103 GB IQ3)已公布的 3-bit UD-IQ3_XXS 約 103 GB,可在 128 GB 統一記憶體裡與有界 KV 共存。餘量緊;這是放得進,不是寬裕。同一 128 GB 檔可加載同一檔(Metal/MLX)。M3 Ultra 512 GB 的 KV/上下文餘量更大。帶寬更高,解碼可能更快。無 CUDA。32 GB GeForce 裝不下。常見路徑是記憶體卸載,或 96 GB 專業卡再加剩餘記憶體。比一池統一記憶體更慢、更吵。
Qwen3.8-27B(4-bit 約 17 GB)寬裕。長上下文、視覺、並發智能體工作流和 AI 資料庫都有餘量。128 GB 寬裕,更小的 Mac 也能跑。帶寬有助於解碼。24–32 GB 顯存就寬裕。不是那台 128 GB 機器吃力的模型。
微調NVIDIA:單 Spark 最高約 700 億。CUDA/PyTorch 路徑。MLX LoRA 是真實的;不是我們對照交付的 CUDA 微調棧。顯存夠就有 CUDA 微調。700 億全量通常超過一張消費卡。
功耗、體積、噪音240 W、1.2 kg、15 cm 立方。NVIDIA 公布運行約 35 dB。Studio 機箱,滿載大約 180 W 檔。安靜。體積大於 Spark。對等的本地 LLM 塔機常常 850–1600 W,又大又吵。
我們打包什麼核心 + 硬件方案裡的硬件 SKU(HK$58,800)。不是打包 SKU。若你已經以 Mac 為標準,仍是可用的推理箱。不是打包 SKU。若你已經以 Windows 工作站為標準、並接受顯存上限,仍可用。

怎麼讀這張對照表

我們指定 Spark,是因為它把 128 GB 一致性統一記憶體、產品實際跑的 CUDA 棧、有文檔的雙節點集群路徑,和 240 W 辦公室體積放在一起。Mac Studio(尤其 M3 Ultra)在已經放得進的模型上,往往解碼更快,也可以超過 128 GB。同級 Windows PC 有 CUDA,但記憶體拆在顯存和系統記憶體,3-bit Flash 檔是別扭的那一檔。要一台能長大的 NVIDIA 盒子,選 Spark;已經活在 Apple 芯片、只要推理,選 Mac;更在意現有 PC 上的 CUDA、多於 128 GB 統一池,選 Windows 工作站。以上都不是每秒 token、質量或可用性保證。

07限制(請讀)
  1. 01記憶體固定 128 GB。沒有記憶體插槽。
  2. 02273 GB/s 低於現時 Mac Studio 芯片。已經放得進模型時,解碼聊天在 Mac 上可以更快。
  3. 03CPU 是 Arm,不是 x86。部分僅 Windows 的工具跑不了。
  4. 04NVIDIA 的 2000 億/700 億/4050 億/1 PFLOP 是廠商規格(petaFLOP 數字含 FP4 稀疏),不是我們在你文件上跑的量測。
  5. 053-bit Flash 仍需要有界上下文。128 GB 的權重檔不等於 128 GB 的部署。

硬件:NVIDIA DGX Spark 產品頁與 Hardware Overview(GB10、128 GB LPDDR5x、273 GB/s、ConnectX-7 200 Gbps、240 W/140 W TDP、150 × 150 × 50.5 mm、1.2 kg、最高 1 PFLOP FP4 含稀疏、單機推理最高 2000 億、雙 Spark 4050 億、微調最高 700 億)。模型:Unsloth DeepSeek-V4-Flash-0731 GGUF(UD-IQ3_XXS 約 103 GB,約 110 GB 記憶體下限);Qwen3.8-27B 開放權重(約 270 億稠密,Q4_K_M 約 17 GB)。Mac Studio:Apple 2025 Studio 規格(M4 Max 最高 128 GB;M3 Ultra 最高 512 GB)。Apple 帶寬常見引用約 546 GB/s(M4 Max)與約 819 GB/s(M3 Ultra)——不是我們的基準。Windows 列是工作量級對照,不是某一型號。