兩三個月前,你會為了玩遊戲而買一張 RTX 5090 嗎?
遊戲應用的甜蜜點,其實一直離 RTX 5090 有點遠。反觀 RTX 5070 Ti 才是真正的戰鬥型號,上打定位尷尬的 RTX 5080,下打 4K 效能還不是很全面的 RTX 5060。現在有了地端 AI 應用,它一樣能算得快,尤其在算圖跟生影片這兩檔差事上。
4K 遊戲,它的效益比最高
RTX 5070 Ti 的主要定位就是 4K 遊戲,不只是剛好跑得動,還要跑得順。大多數玩家的 4K 螢幕更新率是 60Hz,往上的高更新率機種價格並不親民,能提升的實質體驗也有限。
16 GB 在目前的 4K 遊戲環境仍有實用性,能降低材質串流與高解析度貼圖造成的 VRAM 壓力。
RTX 5070 Ti 的 4K 遊戲 FPS
RTX 5070 Ti 的 4K 補幀遊戲 FPS
開啟 DLSS 補幀後,三款 4K 遊戲幀率來到約 67.0 至 86.8 FPS,能穩定跨過 60 FPS 門檻。
VRAM 跑 AI 不算多,架構差異是效能決定主因
一個簡單的問題。跑地端 AI,要選 16 GB 的 RTX 5070 Ti,還是 24 GB 的 RTX 3090?這題一樣回到容量與世代的較勁。
| 項目 | RTX 5070 Ti | RTX 3090 |
|---|---|---|
| 記憶體容量 | 16 GB GDDR7 | 24 GB GDDR6X |
| 理論頻寬 | 896 GB/s | 約 936 GB/s |
RTX 5070 Ti 的理論頻寬其實沒有高過 RTX 3090,兩者相當接近。所以兩張卡在 AI 推論上的速度差,不能只歸因於頻寬,更多來自 Blackwell 世代的運算架構與軟體支援,包括原生 FP8 路線,這是舊卡無法取得的架構紅利。
RTX 3090 多出來的 8 GB VRAM 確實有價值。當模型權重加 KV cache 超過 16 GB,RTX 5070 Ti 就得把部分層卸載到系統記憶體,速度立刻打折,這種情境下 3090 反而可能佔優。反過來說,只要整套工作能留在 16 GB 內,新架構的運算效率通常讓 5070 Ti 跑得更快。加上 3090 耗電量高,購買二手卡還要檢查散熱、供電與長期負載狀況,RTX 5070 Ti 對多數人是比較省事的選擇。真正的取捨很單純:模型裝得下選新卡,裝不下才考慮大容量舊卡。
MiniMax H3 算得比 DGX Spark 快
一張只有 16 GB VRAM 的遊戲顯卡,在同一套量化 MiniMax H3 工作流下,竟然能跑得比 NVIDIA DGX Spark 快。
實測分兩種情境。第一種是機器上沒有常駐其他大型模型,H3 可以獨占可用資源:
| 情境一:無常駐模型 | RTX 5070 Ti | DGX Spark |
|---|---|---|
| H3 工作流耗時 | 77.500 秒 | 168.253 秒 |
| 相對速度 | 約 2.17 倍 | 基準 |
第二種情境是系統裡同時常駐一個 Qwen 35B 模型,記憶體被分走一大塊:
| 情境二:Qwen 35B 常駐 | RTX 5070 Ti | DGX Spark |
|---|---|---|
| H3 工作流耗時 | 122.001 秒 | 170.244 秒 |
| 相對速度 | 約 1.40 倍 | 基準 |
速度優勢從 2.17 倍縮到 1.40 倍,原因很簡單。RTX 5070 Ti 的 16 GB 被常駐的 Qwen 35B 佔去一部分後,H3 的權重與中間張量需要更頻繁地在 VRAM 與系統記憶體之間搬運,耗時從 77.5 秒增加到 122 秒。DGX Spark 因為統一記憶體容量較大,耗時幾乎不變。這組數字把 16 GB 的物理限制講得很清楚,地端多模型並存時,容量就是會咬人。
MiniMax H3 量化工作流完成時間
相同工作流實測,數值越低越快
量化版與滿血版差在哪裡
日常使用的 H3 是 ComfyUI 量化版。它採用 pruned INT8 視訊模型、NVFP4/AWQ 視覺語言模型與兩個 VAE,四個模型檔合計約 42.5 GB。這個數字明顯大於 RTX 5070 Ti 的 16 GB,所以不能說整套權重都塞得進 VRAM。實際執行會靠分段載入與卸載完成工作,5070 Ti 的優勢是即使有這層搬運,GPU 運算速度仍足以把同工作流的總時間壓低。
滿血版則保留官方 FL2VA 全權重。本機 DGX Spark 路線在載入時進行動態 FP8 量化,整套模型目錄約 135 GiB,載入約需要 89 GiB 統一記憶體,生成時 worker 約占 93 GB。這已經不是 16 GB 或 24 GB 消費級顯卡能完整常駐的範圍,也是 DGX Spark 的 128 GB 統一記憶體真正有價值的地方。
不過,不能常駐不代表完全不能跑。SGLang 官方已驗證未剪枝 BF16 全權重可在 12 至 16 GiB VRAM上逐層串流。固定 864 × 480、124 格、20 NFE 的工作負載,在不同主記憶體條件下約需 180 至 302 秒。實體主記憶體只有 32 GB 時,模型無法完整留在頁面快取,NVMe 必須在每一步重新讀取大量權重,實際測得每步可拉長到約 38 秒。
全權重 H3 的 RTX 5070 Ti 與 DGX Spark 比較
| 全權重 H3 情境 | 完成時間 | 相對 Spark |
|---|---|---|
| DGX Spark,128 GB 統一記憶體 | 約 160 秒 | 基準 |
| RTX 5070 Ti,約 96 GB 以上可用 RAM | 約 180 至 300 秒 | 約慢 1.1 至 1.9 倍 |
| RTX 5070 Ti,64 GB RAM | 約 240 至 360 秒 | 約慢 1.5 至 2.3 倍 |
| RTX 5070 Ti,32 GB RAM | 約 780 至 960 秒 | 約慢 4.9 至 6 倍 |
32 GB RAM 的 RTX 5070 Ti 主機,滿血 H3 的耗時並非四、五分鐘,約 13 至 16 分鐘才夠。Spark 約 2.7 分鐘,會快約 4.9 至 6 倍。原因不是 Spark 的 GPU 算力比 5070 Ti 強這麼多,128 GB 統一記憶體能讓約 93 GB 的執行中工作集留在記憶體裡才是重點。32 GB 桌機必須在每一步從 SSD 重讀數十 GB 權重,時間主要耗在資料搬運。
反過來說,若替 5070 Ti 配置約 96 GB 以上可用 RAM,讓約 108 GB 的 DiT 與文字編碼器權重盡量留在主記憶體,差距可望縮到約 1.1 至 1.9 倍。但是……有人真的會這麼做嗎?
| 項目 | ComfyUI 量化版 | 官方全權重 FP8 路線 |
|---|---|---|
| 模型組成 | pruned INT8、NVFP4/AWQ、兩個 VAE | 官方 FL2VA 全權重,執行期動態 FP8 |
| 模型檔容量 | 約 42.5 GB | 約 135 GiB |
| 實測記憶體需求 | 16 GB 卡需分段載入與卸載 | 載入約 89 GiB,生成時約 93 GB |
| 適合用途 | 日常 ComfyUI 生成與速度優先工作 | 接近官方品質基準與全權重驗證 |
| 適合硬體 | 消費級顯卡可透過卸載執行 | 大容量統一記憶體最合適,消費級顯卡可逐層串流但很慢 |
Qwen 3.8 27B 速度與精度二選一
接著看 27B 級別的對話模型。在 RTX 5070 Ti 上以 llama.cpp 實測 32K context 跑 Qwen 3.8 27B,兩種量化設定的結果如下:
Qwen 3.8 27B 在 RTX 5070 Ti 的處理速度
32K context 實測,數值越高越快
IQ4_XS 的 decode 為約 18.5 tok/s。換成精度保留較多的 Q4_K_M,代價立刻浮現。權重變大之後 16 GB 裝不下,部分 FFN 層得卸載到 CPU 運算,prompt 降至約 33.4 tok/s,decode 只剩約 9.2 tok/s,速度大約砍半。
這就是 16 GB 卡的日常。要嘛接受更積極的量化換速度,要嘛用 CPU offload 保留更多精度,然後承受 PCIe 往返的拖累,你會明確感覺到它在等待記憶體。
總結
RTX 5070 Ti 適合以下應用:想在 4K 高畫質玩遊戲、願意用 DLSS 換幀率的玩家。想在地端跑能配合 16 GB 工作空間的量化模型、生圖與影片生成,而且一次只專心跑一個模型的人。預算有限,但想拿到 Blackwell 與 FP8 路線紅利的創作者。
不適合的應用也很明確。需要在本地同時常駐多個大模型的開發者,16 GB 會讓你天天跟 offload 奮戰,H3 那組從 2.17 倍縮到 1.40 倍的數據就是前車之鑑。想跑 H3 官方全權重、其他大型模型或長 context 的使用者,請直接看 24 GB 以上顯卡或大容量統一記憶體系統。
對大多數「遊戲為主、AI 為輔」的玩家,RTX 5070 Ti 是 2026 年這個時間點很現實的平衡點。
