RTX 5090 上市到現在超過一年半,真正買來跑遊戲的人多不多?不清楚,但,它是目前消費級顯卡裡跑大模型最快的單卡,這點應該沒有人有異議。
為什麼 RTX 5090 跑 AI 推論那麼快?
地端對話模型的生成速度,瓶頸幾乎都在記憶體頻寬,不在 CUDA 核心數。所以挑卡先看容量和頻寬,其他都是配菜:
| 項目 | RTX 3090 | RTX 4090 | RTX 5090 |
|---|---|---|---|
| VRAM容量 | 24 GB GDDR6X | 24 GB GDDR6X | 32 GB GDDR7 |
| 理論頻寬 | 936 GB/s | 1,008 GB/s | 1,792 GB/s |
| TGP | 350W | 450W | 575W |
| 上市定位 | 上代旗艦 | 前代旗艦 | 本代旗艦 |
5090 對 4090 的頻寬增幅接近八成,這在歷代旗艦交替裡算少見的大漲,主要歸功於 GDDR7 換上 PAM3 訊號編碼,同樣的實體針腳能擠出更高的傳輸率。多出來的 8GB 容量,剛好卡在幾個關鍵模型的分界線上,後面會展開講。
至於規格表上那些上千 TOPS 的 FP4 算力,對一般推論的意義其實有限。算力決定的是 prefill,也就是丟一大段 prompt 進去時,模型「讀完」的速度,而日常聊天體感取決的 decode 速度,幾乎全看頻寬,兩個階段吃的是不同資源。
用頻寬推算速度上限,是可行的
每吐一個 token,理論上要把整套權重從VRAM讀一遍。拿 70B 級模型 Q4 量化、權重約 40GB 來算,頻寬除以權重就是解碼速度的物理天花板:
理論上限 tok/s ≈ 記憶體頻寬 ÷ 每 token 需讀取的權重位元組
這個數字算出來後,實際達成率通常只有上限的五到七成,KV cache 讀寫、框架開銷、取樣也都會吃頻寬。不過在算速度之前,得先看一眼殘酷的容量缺口:
Llama 3.1 70B Q4_K_M 距離單卡VRAM還差多少
出乎意料吧!4090 和 3090 只有 24GB,面對 43.1 GB 的權重,缺口高達 19.1 GB,幾乎快一半得靠 CPU offload,速度直接被 PCIe 拖下水。5090 靠著 32GB 把缺口縮到 11.1 GB,卸載負擔少了一大截,再加上 1,792 GB/s 的暴量頻寬硬扛,才讓 70B 級模型第一次在消費級單卡上有了真正「順」的體感。
反過來看 prefill,情況顛倒。丟一萬字的文件請模型摘要,瓶頸落在 tensor core 的矩陣吞吐,5090 對 4090 的優勢會拉得比 decode 更大。所以「RTX 5090 快多少」要看工作偏讀還是偏寫。純聊天,頻寬說話;餵長文件,算力說話。雖然一定都是 RTX 5090 勝出 XD
時間才是成本,電費反而是零頭
575W 耗電費不低,划算嗎?其實還蠻划算的。先把極限吞吐拉出來看:
固定 16 GB Dense 權重集的理論全掃描上限
NVIDIA 峰值頻寬 ÷ 16 GB,只比較記憶體通道,不代表實際 tok/s
圖表比的是記憶體通道的極限掃描能力:同樣是一套 16GB 的 Dense 權重,5090 每秒理論上能完整掃過 112 次,4090 只有 63 次,3090 則是 58.5 次。接近八成的頻寬爆發力,反映在巨量生成工作上就是扎扎實實的時間差。
電費呢?就算整段生成時間都頂著 575W TGP 跑,以台電一度四元上下的級距估,跑滿一百萬 token 的電費也不過落在三十元新台幣附近,三張卡的電費差連一杯手搖飲都買不起。任務時間大幅縮短、一個月電費多幾十塊,這筆帳怎麼算都是時間貴。
順便講一件事,很多人會覺得:「地端跑模型很耗電」,得要看是不是真的不停在算,模型服務掛著不動時,整機功耗遠低於滿載,真正滿載的只有生成的那幾秒。除非管線是二十四小時不停吐 token 的批次作業,否則就算是 RTX 5090,待機時的耗電量跟不打遊戲時不會差多少。
32GB 的 VRAM,裝得下什麼?
32GB 的實用分界大致是這樣:
| 想跑的東西 | 32GB 夠嗎 | 說明 |
|---|---|---|
| 14B 級 Q4,日常問答 | 寬裕 | 權重、KV cache 與執行時仍有配置空間 |
| 30B 至 32B 級 Q4 | 可行 | 是否能開長上下文,要看實際模型檔與 KV cache 格式 |
| Llama 3.1 70B Q4_K_M | 放不下 | 公開模型容量約 43.1 GB,單是權重就超出 32 GB |
| 70B 更低位元量化 | 視模型而定 | 必須直接核對模型檔容量,不能只看「Q3」或「Q4」名稱 |
| 70B CPU offload | 可以執行 | 速度取決於卸載比例、PCIe、系統 RAM 與後端 |
| 100B 以上 Dense 模型 | 無法單卡完整常駐 | 需要更低位元、多卡或大容量統一記憶體 |
還有一個容易被忽略的情境:多人同時連線。自己一個人聊天,KV cache 一份而已;如果把這台機器當成工作室的共用 endpoint,三、四個人同時連線,KV cache 就乘上人數往上疊,原本游刃有餘的 32GB 會突然變得很緊。打算對內提供服務的人,容量規劃要直接用「最重情境乘以同時連線數」來估。
此外,平時用 AI 很少同時只會進行一個 Session,公司共享算力給員工的話更不在話下,Session 一多,數字是一定會打折的。
除了權重本身,別忘了 KV cache 這個隱形房客。上下文每拉長一倍,它就線性長大一倍,70B 級模型開到 32K 上下文,KV cache 輕易吃掉好幾 GB。平常用 GPT 的 262K Context 都嫌少了,32K 怎麼會夠。
另一個問題:40GB 權重怎麼塞進 32GB?塞不下,這正是很多人誤會的地方。上面圖表用的 40GB 權重情境,實務上要嘛選壓得更緊的量化把權重壓進 28GB 左右,要嘛讓少部分層卸載到系統記憶體、用頻寬優勢硬扛 PCIe 往返。32GB 的真正意義不是「70B 全裝下」,卸載比例小到幾乎無感、然後再靠高頻寬來拼速度才是重點。24GB 的 4090 跑同一個模型,卸載量直接翻倍,速度落差就是這麼來的。
要跑 RTX 5090,電源供應器官方建議 1000W 起跳。再來是散熱:575W 的熱全排在機殼裡,夏天室溫三十幾度、冷氣沒開強一點,就跟冬天機房不必開暖氣一樣。最後是卡身,Founders Edition 兩槽已經算客氣,AIB 廠動輒三槽起跳,小機殼先量尺寸再說吧。
軟體面倒是比上市初期成熟許多。Blackwell 剛推出那陣子,主流推論框架的支援斷斷續續,編譯版本一個不對就退回 CPU。現在 llama.cpp、vLLM 這些常用後端都已穩定支援,FP8 路線也能正常吃到架構紅利。這段陣痛期買首發的人已經替你付過學費了,論壇上整天都有人做最佳化,不必擔心。
所以該搞一張來玩嗎?
每天以 30B 到 70B 級模型產出、時間寶貴、需要 32GB 容量又不想上專業卡(未必買得到)、已經有 1000W 電源和通風良好的機殼,那麼擁有 RTX 5090 的爽度確實是挺高的。
如果只有 RTX 5070 Ti 也沒關係,需求停在 14B 以下的,5070 Ti 或更小的卡就夠,省下來的錢拿去加 RAM 更實在,雖然現在 RAM 也不便宜就是。想跑 100B 以上滿血模型的,還是要靠用統一記憶體的機器。
「買二手市場的 RTX 4090 OK 嗎?」,有可能便宜一些,24GB 也還堪用,但要扛三個風險:挖礦與長時間滿載的履歷不明、保固多數已過、以及 12VHPWR 接頭的老化問題。
5090 在地端 AI 的位置其實很單純:它是消費級速度的上限。每一套模型可以跑多快?MiniMax H3 可以飆車嗎?日後就在這慢慢更新吧!
