Qwen 3.8 發佈後沒有幾天,Ornith 1.5 也發佈了。先不管它的生母是誰,論壇上一片叫好「終於有較強的非陸製開源模型了」。實測其地域性敏感問題,沒有拒答,重點是在 DGX SPARK 上的速度非常快,體感非常順暢。

先天的體質,讓 Ornith 1.5 吐 token 用跑的

這次測的是 Ornith 1.5 35B-A3B。它不是每吐一個 token 都要把 35B 參數全部算一遍的 dense 模型,而是 MoE 架構,總參數約 35B,每個 token 約啟用 3B。可以把它想成一個有很多專家的團隊,每次回答只叫少數幾位上場,這就是它看起來像 35B 模型,解碼速度卻更接近小模型的主要原因。不過,35B 權重仍然要放進記憶體,所以「每 token 只啟用 3B」不等於只需要 3B 模型的容量。VRAM 過小還是有可能跑不動,DGX SPARK 自然不是問題。

官方把它定位成一個會推理、看圖、呼叫工具與寫程式的模型,一次最多可讀約 26 萬個 tokens。簡單說,它可以塞進很長的文件或對話,但真的把上下文開到這麼長,記憶體占用和首字等待時間也會跟著增加。

量化版本很多,看想用來做啥:

使用需求優先路線判斷理由備註
DGX SPARK 日常使用官方 NVFP4容量、速度與安裝難度較平衡不知道就選這個
24GB 至 32GB 的 PC 或 MacGGUF Q4 或 Q5比較容易符合一般設備的記憶體限制Mac 或頂級顯示選這個
單人聊天追求更快回應Ornith DFlash2完成相容性調整後才有明顯收益很吃特定軟硬體
比較量化前後品質BF16保留高精度基準與量化版本跑相同任務比較
只有 16GB 可用記憶體Q3 或更低精度容量優先時才考慮速度與回答品質都可能下降

在 DGX SPARK 運作,速度非常理想

在 DGX SPARK 上,我會先用 NVFP4 跑日常任務。BF16 留作量化前後的品質對照,拿相同問題比較回答差異,再決定是否需要保留高精度版本。

大家測試的數字差距不小,因為推論引擎、prompt、是否串流,以及 MTP 或 DFlash2 的設定都會改變結果。NVFP4 不加專用 draft 時約為 63 至 81 tok/s,再加入 MTP 或 DFlash2 後,約為 71 至 115 tok/s。

BENCHMARK

Ornith 1.5 在單台 DGX SPARK 的速度落點

可以確定的是,NVFP4 已把回答速度推進每秒 60 tokens 以上,投機解碼調得好時,單人輸出可以跨過 100 tok/s。

如果覺得 NVFP4 還不夠快,再研究 DFlash2。它會先猜主模型接下來要說什麼,猜對時就能一次處理多個 token,所以單人聊天可以更快。請注意,以上說的都是「單人」的速度,也就是單 Session 的速度。

這個速度的體感是什麼概念?基本上 Codex 的 /fast 模式差不多也是這個數字,所以在「速度」上, Ornith 1.5 在 DGX SPARK 上已經能跑出比擬一線雲端供應商的體感了。

聰不聰明?感覺略輸 Qwen 3.8

我測地端模型,通常有幾個既定的流程:

.餵它中文文章,看如何解析 - 測中文語意及中文寫作

.餵它已轉外框的 PDF 檔,叫它修改文字 - 測工具呼叫能力

.測試拒答程度 - 看看世界觀如何

.給它一段 Bug 百出的程式碼,請它重構 - 測程式能力

一輪測下來,其實除了快,沒有特別驚豔之處。而且拒答鎖得非常緊,用語意稀釋及多重條件注入都無法轉移它的注意力,不知道是為什麼,模型的設計者要鎖得那麼緊。反觀 Qwen 3.8 比較有親和力,雖然速度不快,至少可以達成任務。

建議用途

如果手上就是 DGX SPARK,我會先從官方 NVFP4 開始。它的容量、速度與安裝難度最平衡,適合長文件摘要、RAG、本機聊天,以及會持續來回修改內容的工作。

如果只想追求聊天速度,可以再試 DFlash2,如果要比品質上限,才回頭跑 BF16。若是一般 PC、Mac 或記憶體較小的設備,GGUF Q4 或 Q5 比較實際。Q3 以下我就沒試了,感覺也沒必要。

Ornith 1.5 在 DGX SPARK 上最大的優點是快,操作體感確實很好,適合小型需快速回報的任務。而且模型本身不是很大,常駐應是可行作法。