自備硬件
不必買 Spark
DGX Spark 是核心+硬件方案裡打包的 SKU。不含硬件的核心服務(HK$28,800)跑在你已有的機器上——Apple 芯片 Mac、Linux,或帶合適 NVIDIA 顯存的 Windows——只要達到下面的下限。下限是為了讓 DeepSeek V4 Flash(3-bit)與 Qwen3.8-27B 能在本地跑。這是已公布檔案大小對記憶體,不是每秒 token 承諾。
本地跑這兩個模型的下限
卡邊的是 DeepSeek V4 Flash 3-bit(權重約 103 GB;建議約 110 GB 記憶體,才能放得下檔案、作業系統、運行時和有界 KV)。Qwen3.8-27B 4-bit 約 17 GB,記憶體夠了就寬裕。Mac/Linux/Windows 上,128 GB 統一記憶體或系統記憶體是各自能在本地跑的下限。Windows 上,顯存夠大也可以把模型放在卡上。兩個模型同時常駐再加長上下文,在 128 GB 上會緊——卸下一個,或加記憶體/顯存。
| 記憶體 | 128 GB 統一記憶體(Mac/Spark 這一檔)或 128 GB 系統記憶體(Linux 或 Windows)。這是 Flash 3-bit 的下限,除非顯卡本身約 96 GB 顯存。64 GB 記憶體裝不下那份 3-bit 檔。 |
|---|
| 系統 | Apple 芯片上的 macOS、Linux(x86_64 或 Arm),或帶 NVIDIA 顯卡的 Windows 10/11。只要達到記憶體/顯存下限,三條都是正路。 |
|---|
| 儲存 | 至少 500 GB 可用 NVMe(Flash 約 103 GB + Qwen 約 17 GB + 系統 + AI 資料庫)。1 TB 才寬裕。 |
|---|
| GPU/顯存 | 128 GB 統一記憶體的 Mac 或 Spark 不必另加獨顯。Windows 或 Linux 配獨立 NVIDIA 顯卡:顯存要裝得下你真正在卡上跑的模型。Qwen3.8-27B(4-bit 約 17 GB)要約 24 GB 顯存。DeepSeek V4 Flash 3-bit(約 103 GB)要約 96 GB 以上顯存才能留在卡上(RTX PRO 6000 這一檔)。24–32 GB GeForce 適合跑 Qwen;跑 Flash 3-bit 還要約 128 GB 系統記憶體做卸載,比一池統一記憶體慢。 |
|---|
| 網絡 | 產品是本地的。不必雲端 token。辦公室 1 GbE 就夠坐在機器旁邊用。 |
|---|
這個下限是為誰設的
DeepSeek V4 Flash — 3-bit
Unsloth UD-IQ3_XXS 約 103 GB,建議 ≥110 GB 記憶體,才能讓檔案、作業系統、運行時和有界 KV 共存。所以我們寫 128 GB,不是 64 GB。
Qwen3.8-27B
稠密約 270 億,常見 4-bit 約 17 GB。同一台 128 GB 機器上寬裕。不是定下限的那個模型。
低於下限
- 64 GB 或 96 GB 統一記憶體的 Mac——Qwen3.8-27B 能跑;Flash 3-bit 放不進可用上下文。
- 24–32 GB GeForce、系統記憶體不到 128 GB 的 PC——顯存適合跑 Qwen;不夠把 Flash 3-bit 留在卡上。
- 只連雲的筆電——權重和 AI 資料庫應留在現場。
我們怎麼建議
- 01已有 128 GB 的 Mac Studio/MacBook Pro(M4 Max 或 M3 Ultra 這一檔)或 128 GB Linux 工作站:用它。買不含硬件的核心服務。
- 02已有帶合適 NVIDIA 顯卡的 Windows PC:Qwen3.8-27B 要約 24 GB 顯存;Flash 3-bit 要留在卡上要約 96 GB 顯存。24–32 GB 卡加 128 GB 記憶體仍可用卸載跑 Flash 3-bit。買不含硬件的核心服務。
- 03達不到這些下限,或你要 CUDA、DGX OS、以及以後雙 Spark 集群:選全包 Spark(核心+硬件)。
- 04需要 Flash 與 Qwen 同時常駐、再加長上下文:傾向 192 GB 或以上(Mac Ultra 256/512,或第二台 Spark),或約 96 GB 顯存再加夠用的主機記憶體。128 GB 是各自能在本地跑的公布下限,不是保證兩個模型同時躺在記憶體裡。
大小是已公布的 GGUF/量化檔與廠商記憶體,不是我們的每秒 token。權重放得進,不是速度或質量承諾。
為什麼指定 Spark →
——方案比較
| 核心服務 不含硬件 HK$28,800 | 核心服務 連硬件 HK$58,800 | 遠端支援計劃 按月留任 HK$1,800 | 全面支援計劃 按月留任 HK$4,800 |
|---|
| 交付 |
|---|
| 計費 | 一次性 | 一次性 | 按月 | 按月 |
|---|
| 硬件 | 自備(Mac/Linux/Windows GPU/Spark,須達下限) | 含 DGX Spark | — | — |
|---|
| 前線部署,蒸餾現有文件 | 有 | 有 | — | — |
|---|
| AI 資料庫初始化 | 有 | 有 | — | — |
|---|
| 培訓交接 | 有 | 有 | — | — |
|---|
| 客製智能體工作流(含) | 最多 50 條智能體工作流 | 最多 50 條智能體工作流 | — | — |
|---|
| 一條工作流怎麼算 | 一種輸入→一種產出 = 1;加閘不加位 | 一種輸入→一種產出 = 1;加閘不加位 | 同一單位(新增或升級) | 同一單位(新增或升級) |
|---|
| 首三個月免費調校/升級 | 有 | 有 | — | — |
|---|
| 持續 |
|---|
| 新增或升級智能體工作流 | 另購 | 另購 | 每月 5 條智能體工作流 | 每月 15 條智能體工作流 |
|---|
| 簽名更新包 | — | — | 有 | 有 |
|---|
| 辦公時間遠端支援 | — | — | 有 | 有 |
|---|
| 季度健康檢查 | — | — | 有 | 有 |
|---|
| 上門(香港,≤3 小時) | — | — | — | 每月 1 次 |
|---|
| 年繳 | — | — | HK$18,000(付 10 用 12) | HK$48,000 |
|---|
支援計劃疊在核心服務之上,不能替代核心服務。核心服務首三個月內建好的智能體工作流,可免費調校與升級。在已有的具名路徑上加中途閘門,算升級,不另占 50 條裡的新位。
——50 條怎麼算
一條智能體工作流 = 一種輸入、一種產出;中間可以好長、閘門可以多過一個,都只算 1。兩件互不依賴的事並行,算 2。只有最後一個閘門也可以交,但長流程我們會建議中途加閘——加閘不加位。
計費單位是
- 01一種輸入——一類觸發(例如本月供應商單據)。
- 02一種產出——一類回執(例如草稿傳票停在待核准)。
- 03產出前至少一道閘門(AI bot 自動檢查或人)。同一條路上多加閘門不加位。
- 04子代理、資料夾、步驟按真實流程需要來,節點數不是計量表。投影器 64 節點/128 邊是圖上限,不是商務上限。
算 1
- 一條串列、一對輸入產出——包括兩道閘門的入帳路徑,也包括只有末端閘門的長線。
- 核心服務首三個月內,對同一條具名路徑的調校或升級(已含、免費)。
算 2 或以上
- 互不等待的平行分支(同一 run 裡供應商收單 vs 銀行月結包)。
- 第二種輸入(發票 vs 銀行 vs 薪酬 vs 申報包)。
- 第二種產出,業務上會單獨跑或單獨交付的。
不能當 1
- 不相干的工作用一個假的末端閘門捆在一起。
- 整間公司塞進一條工作流。
遠端支援(每月 5 條)或全面支援(每月 15 條)的計量是:新增或升級一條具名路徑。在已有路徑上加中途閘門、或調校子代理,算當月 5/15 裡的一次升級,不另占核心 50 條的新位。HK$400/HK$1,800 買的是新的具名路徑。
什麼是 Sophia智能體工作流 →
——額外智能體工作流
核心服務含最多 50 條客製智能體工作流(50 條具名路徑)。不夠可另購新的具名路徑。核心服務首三個月內建好的工作流,可免費調校與升級。
- 01
HK$400
超出核心服務所含 50 條之後,另購一條具名路徑(一種輸入→一種產出)。
- 02
HK$1,800
五條具名路徑打包價。按 HK$400 × 5 計為 HK$2,000。