Tag
標籤: llm-inference
所有標記為此標籤的文章 "llm-inference".
- Published: at 09:00 AM
Strata 讓 Qwen3.8-Flash-Next 這個 1250 億參數的 MoE 模型在一般電競 PC 上執行。整理它如何把模型拆到顯示卡、記憶體與 SSD,一個 token 的計算怎麼在 GPU 與 CPU 之間分工,以及它和通用推論引擎的差別與限制。
Tag
所有標記為此標籤的文章 "llm-inference".
Strata 讓 Qwen3.8-Flash-Next 這個 1250 億參數的 MoE 模型在一般電競 PC 上執行。整理它如何把模型拆到顯示卡、記憶體與 SSD,一個 token 的計算怎麼在 GPU 與 CPU 之間分工,以及它和通用推論引擎的差別與限制。