Qwen 3.8 發佈後沒有幾天,Ornith 1.5 也發佈了。先不管它的生母是誰,論壇上一片叫好「終於有較強的非陸製開源模型了」。實測其地域性敏感問題,沒有拒答,重點是在 DGX SPARK 上的速度非常快,體感非常順暢。
先天的體質,讓 Ornith 1.5 吐 token 用跑的
這次測的是 Ornith 1.5 35B-A3B。它不是每吐一個 token 都要把 35B 參數全部算一遍的 dense 模型,而是 MoE 架構,總參數約 35B,每個 token 約啟用 3B。可以把它想成一個有很多專家的團隊,每次回答只叫少數幾位上場,這就是它看起來像 35B 模型,解碼速度卻更接近小模型的主要原因。不過,35B 權重仍然要放進記憶體,所以「每 token 只啟用 3B」不等於只需要 3B 模型的容量。VRAM 過小還是有可能跑不動,DGX SPARK 自然不是問題。
官方把它定位成一個會推理、看圖、呼叫工具與寫程式的模型,一次最多可讀約 26 萬個 tokens。簡單說,它可以塞進很長的文件或對話,但真的把上下文開到這麼長,記憶體占用和首字等待時間也會跟著增加。
量化版本很多,看想用來做啥:
| 使用需求 | 優先路線 | 判斷理由 | 備註 |
|---|---|---|---|
| DGX SPARK 日常使用 | 官方 NVFP4 | 容量、速度與安裝難度較平衡 | 不知道就選這個 |
| 24GB 至 32GB 的 PC 或 Mac | GGUF Q4 或 Q5 | 比較容易符合一般設備的記憶體限制 | Mac 或頂級顯示選這個 |
| 單人聊天追求更快回應 | Ornith DFlash2 | 完成相容性調整後才有明顯收益 | 很吃特定軟硬體 |
| 比較量化前後品質 | BF16 | 保留高精度基準 | 與量化版本跑相同任務比較 |
| 只有 16GB 可用記憶體 | Q3 或更低精度 | 容量優先時才考慮 | 速度與回答品質都可能下降 |
在 DGX SPARK 運作,速度非常理想
在 DGX SPARK 上,我會先用 NVFP4 跑日常任務。BF16 留作量化前後的品質對照,拿相同問題比較回答差異,再決定是否需要保留高精度版本。
大家測試的數字差距不小,因為推論引擎、prompt、是否串流,以及 MTP 或 DFlash2 的設定都會改變結果。NVFP4 不加專用 draft 時約為 63 至 81 tok/s,再加入 MTP 或 DFlash2 後,約為 71 至 115 tok/s。
Ornith 1.5 在單台 DGX SPARK 的速度落點
可以確定的是,NVFP4 已把回答速度推進每秒 60 tokens 以上,投機解碼調得好時,單人輸出可以跨過 100 tok/s。
如果覺得 NVFP4 還不夠快,再研究 DFlash2。它會先猜主模型接下來要說什麼,猜對時就能一次處理多個 token,所以單人聊天可以更快。請注意,以上說的都是「單人」的速度,也就是單 Session 的速度。
這個速度的體感是什麼概念?基本上 Codex 的 /fast 模式差不多也是這個數字,所以在「速度」上, Ornith 1.5 在 DGX SPARK 上已經能跑出比擬一線雲端供應商的體感了。
聰不聰明?感覺略輸 Qwen 3.8
我測地端模型,通常有幾個既定的流程:
.餵它中文文章,看如何解析 - 測中文語意及中文寫作
.餵它已轉外框的 PDF 檔,叫它修改文字 - 測工具呼叫能力
.測試拒答程度 - 看看世界觀如何
.給它一段 Bug 百出的程式碼,請它重構 - 測程式能力
一輪測下來,其實除了快,沒有特別驚豔之處。而且拒答鎖得非常緊,用語意稀釋及多重條件注入都無法轉移它的注意力,不知道是為什麼,模型的設計者要鎖得那麼緊。反觀 Qwen 3.8 比較有親和力,雖然速度不快,至少可以達成任務。
建議用途
如果手上就是 DGX SPARK,我會先從官方 NVFP4 開始。它的容量、速度與安裝難度最平衡,適合長文件摘要、RAG、本機聊天,以及會持續來回修改內容的工作。
如果只想追求聊天速度,可以再試 DFlash2,如果要比品質上限,才回頭跑 BF16。若是一般 PC、Mac 或記憶體較小的設備,GGUF Q4 或 Q5 比較實際。Q3 以下我就沒試了,感覺也沒必要。
Ornith 1.5 在 DGX SPARK 上最大的優點是快,操作體感確實很好,適合小型需快速回報的任務。而且模型本身不是很大,常駐應是可行作法。
