我們打包的硬件——可選
NVIDIA DGX Spark,放在辦公室
Sophia Gate 是私有 AI 平台。NVIDIA DGX Spark 是我們打包的 SKU,不是強制:達到下限的 128 GB Apple 芯片 Mac、128 GB Linux 工作站,或帶合適 NVIDIA 顯存的 Windows(Qwen3.8-27B 約 24 GB 顯存;Flash 3-bit 要留在卡上約 96 GB 顯存),也能在本地跑這兩個模型。指定 Spark,是因為你要 128 GB 一致性統一記憶體、CUDA、DGX OS、以及雙機集群路徑,放在辦公室。本頁是規格與對照,不是宣稱 Spark 在每一項測試都最快。
DGX Spark 是核心+硬件方案裡打包的 SKU。不含硬件的核心服務(HK$28,800)跑在你已有的機器上——Apple 芯片 Mac、Linux,或帶合適 NVIDIA 顯存的 Windows——只要達到下面的下限。下限是為了讓 DeepSeek V4 Flash(3-bit)與 Qwen3.8-27B 能在本地跑。這是已公布檔案大小對記憶體,不是每秒 token 承諾。
本地跑這兩個模型的下限
卡邊的是 DeepSeek V4 Flash 3-bit(權重約 103 GB;建議約 110 GB 記憶體,才能放得下檔案、作業系統、運行時和有界 KV)。Qwen3.8-27B 4-bit 約 17 GB,記憶體夠了就寬裕。Mac/Linux/Windows 上,128 GB 統一記憶體或系統記憶體是各自能在本地跑的下限。Windows 上,顯存夠大也可以把模型放在卡上。兩個模型同時常駐再加長上下文,在 128 GB 上會緊——卸下一個,或加記憶體/顯存。
| 記憶體 | 128 GB 統一記憶體(Mac/Spark 這一檔)或 128 GB 系統記憶體(Linux 或 Windows)。這是 Flash 3-bit 的下限,除非顯卡本身約 96 GB 顯存。64 GB 記憶體裝不下那份 3-bit 檔。 |
|---|---|
| 系統 | Apple 芯片上的 macOS、Linux(x86_64 或 Arm),或帶 NVIDIA 顯卡的 Windows 10/11。只要達到記憶體/顯存下限,三條都是正路。 |
| 儲存 | 至少 500 GB 可用 NVMe(Flash 約 103 GB + Qwen 約 17 GB + 系統 + AI 資料庫)。1 TB 才寬裕。 |
| GPU/顯存 | 128 GB 統一記憶體的 Mac 或 Spark 不必另加獨顯。Windows 或 Linux 配獨立 NVIDIA 顯卡:顯存要裝得下你真正在卡上跑的模型。Qwen3.8-27B(4-bit 約 17 GB)要約 24 GB 顯存。DeepSeek V4 Flash 3-bit(約 103 GB)要約 96 GB 以上顯存才能留在卡上(RTX PRO 6000 這一檔)。24–32 GB GeForce 適合跑 Qwen;跑 Flash 3-bit 還要約 128 GB 系統記憶體做卸載,比一池統一記憶體慢。 |
| 網絡 | 產品是本地的。不必雲端 token。辦公室 1 GbE 就夠坐在機器旁邊用。 |
DeepSeek V4 Flash — 3-bit
Unsloth UD-IQ3_XXS 約 103 GB,建議 ≥110 GB 記憶體,才能讓檔案、作業系統、運行時和有界 KV 共存。所以我們寫 128 GB,不是 64 GB。
Qwen3.8-27B
稠密約 270 億,常見 4-bit 約 17 GB。同一台 128 GB 機器上寬裕。不是定下限的那個模型。
低於下限
- 64 GB 或 96 GB 統一記憶體的 Mac——Qwen3.8-27B 能跑;Flash 3-bit 放不進可用上下文。
- 24–32 GB GeForce、系統記憶體不到 128 GB 的 PC——顯存適合跑 Qwen;不夠把 Flash 3-bit 留在卡上。
- 只連雲的筆電——權重和 AI 資料庫應留在現場。
我們怎麼建議
- 01已有 128 GB 的 Mac Studio/MacBook Pro(M4 Max 或 M3 Ultra 這一檔)或 128 GB Linux 工作站:用它。買不含硬件的核心服務。
- 02已有帶合適 NVIDIA 顯卡的 Windows PC:Qwen3.8-27B 要約 24 GB 顯存;Flash 3-bit 要留在卡上要約 96 GB 顯存。24–32 GB 卡加 128 GB 記憶體仍可用卸載跑 Flash 3-bit。買不含硬件的核心服務。
- 03達不到這些下限,或你要 CUDA、DGX OS、以及以後雙 Spark 集群:選全包 Spark(核心+硬件)。
- 04需要 Flash 與 Qwen 同時常駐、再加長上下文:傾向 192 GB 或以上(Mac Ultra 256/512,或第二台 Spark),或約 96 GB 顯存再加夠用的主機記憶體。128 GB 是各自能在本地跑的公布下限,不是保證兩個模型同時躺在記憶體裡。
大小是已公布的 GGUF/量化檔與廠商記憶體,不是我們的每秒 token。權重放得進,不是速度或質量承諾。
產品是交鑰匙的私有 AI,跑在客戶自己的機器上。指定 Spark,是因為它同時具備 128 GB 一致性記憶體池、軟件實際運行的 CUDA 棧、有文檔的雙機集群路徑,以及 240 W 可放辦公室的體積。數據留在本機。
- 01
本地模型,本地數據
權重、對話紀錄與 AI 資料庫都留在這台機器。不設常駐遠端控制通道。更新為拉取式、客戶端發起、加密簽名、可回滾。
- 02
128 GB 一致性統一記憶體
CPU 與 GPU 共用一池 128 GB LPDDR5x(NVIDIA:256-bit、273 GB/s)。約 100 GB 的 3-bit 混合專家模型,不必拆到 24–32 GB 顯卡再經 PCIe 回灌系統記憶體。
- 03
產品實際跑的 CUDA 棧
DGX OS、CUDA、NVIDIA NIM、vLLM、Ollama、TensorRT-LLM。智能體工作流與推理服務對準這條棧。Mac 在 Metal/MLX 推理上強,但不是這條軟件路徑。
- 04
桌面體積、可常開
150 × 150 × 50.5 mm、1.2 kg、240 W 電源、140 W GB10 TDP(NVIDIA)。NVIDIA 公布運行聲功率 35 dB LWA,m。定位是桌面智能體電腦,不是要機房的機架。
- 05
一台不夠時可以集群
ConnectX-7、200 Gbps、兩個 QSFP。NVIDIA 公布兩台 Spark 可連,用於最高約 4050 億參數的模型。同一套軟件路徑放大,不必換另一家的網絡結構。
本表數字是 NVIDIA 公布規格,不是我們在你文件上跑出來的量測。
| 超級芯片 | NVIDIA GB10 Grace Blackwell |
|---|---|
| CPU | 20 核 Arm(10× Cortex-X925 + 10× Cortex-A725) |
| GPU | Blackwell、第 5 代 Tensor Cores、第 4 代 RT Cores、6,144 CUDA 核心 |
| 記憶體 | 128 GB LPDDR5x 一致性統一記憶體,256-bit,273 GB/s |
| AI 算力(NVIDIA) | 最高 1 PFLOP FP4(含稀疏);推理最高 1,000 TOPS |
| 推理(NVIDIA) | 單機模型最高約 2000 億參數 |
| 微調(NVIDIA) | 模型最高約 700 億參數 |
| 集群(NVIDIA) | 兩台 Spark 經 ConnectX-7:模型最高約 4050 億參數 |
| 網絡 | ConnectX-7 200 Gbps(2× QSFP)、10 GbE RJ-45、Wi-Fi 7、藍牙 5.4 |
| 儲存 | 1 TB 或 4 TB 自加密 NVMe |
| I/O | 4× USB-C、HDMI 2.1a;CPU–GPU 之間 NVLink-C2C |
| 功耗/體積 | 240 W 電源、140 W GB10 TDP、150 × 150 × 50.5 mm、1.2 kg |
| 系統/棧 | NVIDIA DGX OS、CUDA、NVIDIA NIM、PyTorch、TensorRT-LLM |
這裡的「放得進」指已公布的權重檔大小相對 128 GB 統一記憶體,再留作業系統、運行時和有界 KV 快取。不是每秒 token 量測,也不是質量排名。
大型本地模型
DeepSeek V4 Flash — 3-bit
DeepSeek-V4-Flash-0731 是大型混合專家(MoE)檢查點。Unsloth 公布的 3-bit GGUF UD-IQ3_XXS 約 103 GB,建議至少約 110 GB 記憶體,才能讓檔案、作業系統、運行時和有界上下文共存於 128 GB 機器。這才是我們說的 3-bit 適配。其他 3-bit 檔有 114–128 GB,幾乎沒有餘量——那是另一份檔,不是這項說法。長 Think-Max 上下文仍要額外記憶體。權重放得進,不是速度承諾。
日常主力
Qwen3.8-27B
阿里巴巴 Qwen3.8-27B 是約 270–280 億參數的稠密多模態模型(文本、圖像、長上下文)。常見 4-bit 約 17 GB。在 128 GB 統一記憶體上,長上下文、視覺、並發智能體工作流和 AI 資料庫都有餘量。這是寬裕檔,不是卡邊檔。
NVIDIA 自己給的單機範圍:推理最高約 2000 億參數、微調最高約 700 億。兩台 Spark:最高約 4050 億。這些是廠商數字,不是我們的基準。
Spark 被指定為一台可以長大的機器。集群在背板,不是事後加卡的工程。
- 01ConnectX-7 SmartNIC、200 Gbps、兩個 QSFP——NVIDIA 公布這是連接兩台 Spark 的路徑。
- 02雙 Spark 配置:NVIDIA 數字是最高約 4050 億參數,同一套 DGX OS、同一套 CUDA,記憶體池更大。
- 03先在辦公室放一台。模型更大或並發智能體更多時再加第二台。軟件路徑不變。
- 04NVIDIA 自己的敘述是:在 Spark 上原型,再把同一套棧遷到 DGX 雲或數據中心。這是路徑,不是強制。
- 01
CPU–GPU 一致性記憶體
權重不必在小顯存卡和大記憶體條之間經 PCIe 來回搬。128 GB 是同一地址空間。
- 02
FP4 Tensor Cores
第 5 代 Tensor Cores、FP4(NVIDIA:最高 1 PFLOP,含稀疏)。長提示和帶工具的智能體偏算力,不只受解碼帶寬限制。
- 03
自加密 NVMe
1 TB 或 4 TB,自加密。放權重和 AI 資料庫的盤是加密裝置。
- 04
辦公室功耗
240 W 牆插。一台想用 96 GB 專業卡加大記憶體來對齊這項本地模型工作的 Windows 工作站,通常是 850–1600 W 塔機。
- 05
一家廠商、一份系統鏡像
DGX OS、CUDA、NIM。不是要實習生養活的改裝遊戲機。
- 06
智能體軟件
NVIDIA 把 Spark 定位為桌面智能體電腦。Sophia Gate 帶閘門的智能體工作流就跑在這一類機器上。
同一項工作:跑本地模型(含 DeepSeek V4 Flash 3-bit 與 Qwen3.8-27B)、數據留在現場、以後還能長大。Windows 列是這一工作量級的工作站——約 128 GB 系統記憶體加一塊獨立 NVIDIA 顯卡(GeForce 約 32 GB 或 RTX PRO 約 96 GB)——不是 8 卡數據中心節點,也不是便宜辦公 PC。
NVIDIA DGX Spark GB10 · 128 GB 統一記憶體 · CUDA | Mac Studio(128 GB 檔) M4 Max 最高 128 GB;M3 Ultra 最高 512 GB | 同級 Windows PC 128 GB 記憶體 + 獨立 NVIDIA 顯卡 | |
|---|---|---|---|
| 記憶體結構 | 128 GB LPDDR5x 一致性統一記憶體(CPU + GPU 一池)。不可加條。 | 統一記憶體。M4 Max 最高 128 GB;M3 Ultra 最高 512 GB(Apple 2025 Studio)。 | 拆開:系統記憶體 + 獨立顯存。32 GB 卡裝不下 103 GB 的 3-bit 檔;剩下的權重經 PCIe 卸載。 |
| 記憶體帶寬 | 273 GB/s(NVIDIA)。 | 約 546 GB/s(M4 Max)/約 819 GB/s(M3 Ultra)。模型已經放得進時,更高帶寬往往解碼更快。 | 卡上 GDDR 很快;CPU↔GPU 是 PCIe。卸載 100 GB 模型是慢路徑。 |
| CUDA/推理棧 | 原生 CUDA、DGX OS、NVIDIA NIM、TensorRT-LLM、vLLM、Ollama。 | 無 CUDA。MLX 與 llama.cpp Metal。推理強;不是 NVIDIA 訓練/服務路徑。 | 顯卡是 NVIDIA 就有 CUDA。Windows 或 WSL。棧要自己組,不是 DGX OS 鏡像。 |
| 集群擴展 | ConnectX-7 200 Gbps;NVIDIA 雙 Spark 路徑最高約 4050 億參數。 | Thunderbolt/乙太網。沒有 NVIDIA 織物,沒有公布的雙機 4050 億 SKU。 | 自己加網卡和顯卡。電源、驅動、散熱變成項目。 |
| DeepSeek V4 Flash 3-bit(約 103 GB IQ3) | 已公布的 3-bit UD-IQ3_XXS 約 103 GB,可在 128 GB 統一記憶體裡與有界 KV 共存。餘量緊;這是放得進,不是寬裕。 | 同一 128 GB 檔可加載同一檔(Metal/MLX)。M3 Ultra 512 GB 的 KV/上下文餘量更大。帶寬更高,解碼可能更快。無 CUDA。 | 32 GB GeForce 裝不下。常見路徑是記憶體卸載,或 96 GB 專業卡再加剩餘記憶體。比一池統一記憶體更慢、更吵。 |
| Qwen3.8-27B(4-bit 約 17 GB) | 寬裕。長上下文、視覺、並發智能體工作流和 AI 資料庫都有餘量。 | 128 GB 寬裕,更小的 Mac 也能跑。帶寬有助於解碼。 | 24–32 GB 顯存就寬裕。不是那台 128 GB 機器吃力的模型。 |
| 微調 | NVIDIA:單 Spark 最高約 700 億。CUDA/PyTorch 路徑。 | MLX LoRA 是真實的;不是我們對照交付的 CUDA 微調棧。 | 顯存夠就有 CUDA 微調。700 億全量通常超過一張消費卡。 |
| 功耗、體積、噪音 | 240 W、1.2 kg、15 cm 立方。NVIDIA 公布運行約 35 dB。 | Studio 機箱,滿載大約 180 W 檔。安靜。體積大於 Spark。 | 對等的本地 LLM 塔機常常 850–1600 W,又大又吵。 |
| 我們打包什麼 | 核心 + 硬件方案裡的硬件 SKU(HK$58,800)。 | 不是打包 SKU。若你已經以 Mac 為標準,仍是可用的推理箱。 | 不是打包 SKU。若你已經以 Windows 工作站為標準、並接受顯存上限,仍可用。 |
怎麼讀這張對照表
我們指定 Spark,是因為它把 128 GB 一致性統一記憶體、產品實際跑的 CUDA 棧、有文檔的雙節點集群路徑,和 240 W 辦公室體積放在一起。Mac Studio(尤其 M3 Ultra)在已經放得進的模型上,往往解碼更快,也可以超過 128 GB。同級 Windows PC 有 CUDA,但記憶體拆在顯存和系統記憶體,3-bit Flash 檔是別扭的那一檔。要一台能長大的 NVIDIA 盒子,選 Spark;已經活在 Apple 芯片、只要推理,選 Mac;更在意現有 PC 上的 CUDA、多於 128 GB 統一池,選 Windows 工作站。以上都不是每秒 token、質量或可用性保證。
- 01記憶體固定 128 GB。沒有記憶體插槽。
- 02273 GB/s 低於現時 Mac Studio 芯片。已經放得進模型時,解碼聊天在 Mac 上可以更快。
- 03CPU 是 Arm,不是 x86。部分僅 Windows 的工具跑不了。
- 04NVIDIA 的 2000 億/700 億/4050 億/1 PFLOP 是廠商規格(petaFLOP 數字含 FP4 稀疏),不是我們在你文件上跑的量測。
- 053-bit Flash 仍需要有界上下文。128 GB 的權重檔不等於 128 GB 的部署。
硬件:NVIDIA DGX Spark 產品頁與 Hardware Overview(GB10、128 GB LPDDR5x、273 GB/s、ConnectX-7 200 Gbps、240 W/140 W TDP、150 × 150 × 50.5 mm、1.2 kg、最高 1 PFLOP FP4 含稀疏、單機推理最高 2000 億、雙 Spark 4050 億、微調最高 700 億)。模型:Unsloth DeepSeek-V4-Flash-0731 GGUF(UD-IQ3_XXS 約 103 GB,約 110 GB 記憶體下限);Qwen3.8-27B 開放權重(約 270 億稠密,Q4_K_M 約 17 GB)。Mac Studio:Apple 2025 Studio 規格(M4 Max 最高 128 GB;M3 Ultra 最高 512 GB)。Apple 帶寬常見引用約 546 GB/s(M4 Max)與約 819 GB/s(M3 Ultra)——不是我們的基準。Windows 列是工作量級對照,不是某一型號。