32GB 跑 Qwen3.6 35B MoE、12GB 用 Qwen3.5 9B,避開 offold 陷阱。依任務切換程式、推理、Agent、多模態專用模型,附 Ollama/LM Studio 部署指南。
核心結論:VRAM 決定模型上限,任務決定模型選擇
- RTX 5090(32 GB GDDR7,1792 GB/s):唯一能在消費級顯卡以 Q6/Q8 量化完整跑 30B 級模型且零 CPU offload 的選擇。
- RTX 5070(12 GB):只能穩定支援 9B–14B 級模型;強行跑 14B 會觸發 offload,速度從 ~53 tok/s 暴跌至 ~7 tok/s,體驗大幅下降。
- 部署工具:開發者偏好 Ollama(CLI、腳本友善),新手建議 LM Studio(GUI、一鍵量化下載)。兩者皆支援文中所有模型與量化格式。
RTX 5090(32 GB)推薦模型表
| 模型 | 量化 | 主要用途 | 關鍵優勢 |
|---|---|---|---|
| Qwen3.6 35B‑A3B (MoE) | Q6_K | 綜合最佳/日常助理 | MoE 架構約 80 tok/s,品質接近 35B 密集模型,速度最快 |
| Qwen3‑Coder‑30B | Q4 | 純程式碼/IDE 輔助 | 社群公認 32GB 下程式碼首選,保留充足 context 空間 |
| Qwen2.5‑Coder‑32B | Q4 | 程式碼重構、補全 | HumanEval 分數逼近 GPT‑4o,實測重構任務甚至勝出 |
| DeepSeek‑R1‑Distill‑32B | Q4 / Q5 | 數學、邏輯推理、複雜思維鏈 | 最佳推理型模型,適合「想清楚再答」的任務 |
| gpt‑oss 20B | Q8_0 | Agent/工具呼叫 | Tool call 輸出最乾淨,適合搭配 agent framework |
| Gemma 3 27B | Q4 | 多語言、圖片理解(多模態) | Google 開源權重,原生支援視覺輸入 |
實務切換策略:日常聊天/寫作用 Qwen3.6;寫程式切 Qwen3‑Coder;遇數學證明或複雜邏輯換 DeepSeek‑R1‑Distill;需 Agent 自動化用 gpt‑oss;多模態任務用 Gemma 3。
RTX 5070(12 GB)推薦模型表
| 模型 | 量化 | 速度 | 適用場景 |
|---|---|---|---|
| Qwen3.5 9B Instruct | Q6_K / Q8_0 | 35–53 tok/s | 日常問答、寫作、翻譯,12GB 卡最快首選 |
| Llama 3.1 8B | Q8_0 | ~40 tok/s | 通用對話穩定,適合備用助理模型 |
進階選項:若為 RTX 5070 Ti(16 GB),可升級跑 gpt‑oss 20B (Q4_K_M),Tool call 表現最乾淨,適合 Agent 任務。
任務對應快速查詢表
| 任務類型 | RTX 5090 首選 | RTX 5070 首選 | 備註 |
|---|---|---|---|
| 一般聊天/寫作/翻譯 | Qwen3.6 35B‑A3B (Q6_K) | Qwen3.5 9B Instruct (Q6_K/Q8_0) | 回應快、多輪流暢 |
| 程式開發/Debug/重構 | Qwen3‑Coder‑30B / Qwen2.5‑Coder‑32B (Q4) | — | 僅限 32GB,品質接近雲端 GPT‑4o |
| 數學題/邏輯推理/規劃 | DeepSeek‑R1‑Distill‑32B (Q4/Q5) | — | 思維鏈最強,需 32GB |
| Agent/自動化工具呼叫 | gpt‑oss 20B (Q8_0) | gpt‑oss 20B (Q4_K_M,需 16GB) | Tool call 格式最穩定 |
| 圖片理解/多語言多模態 | Gemma 3 27B (Q4) | — | 原生視覺輸入,需 32GB |
避坑指南與注意事項
- 不要在 12GB 卡硬跑 14B 以上模型:CPU offload 會將生成速度壓至個位數 tok/s,互動體驗極差。
- 量化等級權衡:Q6_K 平衡品質與速度;Q4 省 VRAM 但可能損失推理細節;Q8_0 品質最佳但佔用更多顯存。
- Context 長度:跑大模型時預留 VRAM 給 KV Cache,避免長對話中途 OOM。
- 驅動與運行時:確保 CUDA 12.6+、cuDNN 9.5+、最新 NVIDIA 驅動,以發揮 GDDR7 頻寬優勢。
- 模型來源:優先從 Hugging Face 官方倉庫(Qwen、deepseek‑ai、google 等)下載,確保權重完整。
部署快速入門
Ollama(CLI / 開發者導向)
# 安裝後直接拉取量化模型
ollama pull qwen3.6:35b-a3b-q6_k
ollama pull qwen3-coder:30b-q4
ollama pull deepseek-r1:32b-q4
# 啟動互動
ollama run qwen3.6:35b-a3b-q6_k
LM Studio(GUI / 新手友善)
- 下載安裝 LM Studio。
- 搜尋模型名稱(如
Qwen3.6 35B-A3B),選擇Q6_K量化下載。 - 在「Chat」頁面載入模型,調整 Context Length 與 GPU Offload 層數(5090 通常全層 GPU)。
- 切換模型只需在下拉選單選擇,無需重啟服務。
結語
VRAM 是硬限制,任務是軟導向。RTX 5090 的 32GB 讓你擁有「一卡走天下」的彈性,可依場景熱換專用模型;RTX 5070 則以 Qwen3.5 9B 為核心,專注輕量高速的日常助理角色。善用 Ollama 或 LM Studio 的多模型管理,即可在本地端構建出接近雲端級、且完全可控的 AI 工作流。