RTX 5090 5070 本地 LLM 模型推薦:VRAM 決定上限、任務換模型

32GB 跑 Qwen3.6 35B MoE、12GB 用 Qwen3.5 9B,避開 offold 陷阱。依任務切換程式、推理、Agent、多模態專用模型,附 Ollama/LM Studio 部署指南。

核心結論:VRAM 決定模型上限,任務決定模型選擇

  • RTX 5090(32 GB GDDR7,1792 GB/s):唯一能在消費級顯卡以 Q6/Q8 量化完整跑 30B 級模型且零 CPU offload 的選擇。
  • RTX 5070(12 GB):只能穩定支援 9B–14B 級模型;強行跑 14B 會觸發 offload,速度從 ~53 tok/s 暴跌至 ~7 tok/s,體驗大幅下降。
  • 部署工具:開發者偏好 Ollama(CLI、腳本友善),新手建議 LM Studio(GUI、一鍵量化下載)。兩者皆支援文中所有模型與量化格式。

RTX 5090(32 GB)推薦模型表

模型 量化 主要用途 關鍵優勢
Qwen3.6 35B‑A3B (MoE) Q6_K 綜合最佳/日常助理 MoE 架構約 80 tok/s,品質接近 35B 密集模型,速度最快
Qwen3‑Coder‑30B Q4 純程式碼/IDE 輔助 社群公認 32GB 下程式碼首選,保留充足 context 空間
Qwen2.5‑Coder‑32B Q4 程式碼重構、補全 HumanEval 分數逼近 GPT‑4o,實測重構任務甚至勝出
DeepSeek‑R1‑Distill‑32B Q4 / Q5 數學、邏輯推理、複雜思維鏈 最佳推理型模型,適合「想清楚再答」的任務
gpt‑oss 20B Q8_0 Agent/工具呼叫 Tool call 輸出最乾淨,適合搭配 agent framework
Gemma 3 27B Q4 多語言、圖片理解(多模態) Google 開源權重,原生支援視覺輸入

實務切換策略:日常聊天/寫作用 Qwen3.6;寫程式切 Qwen3‑Coder;遇數學證明或複雜邏輯換 DeepSeek‑R1‑Distill;需 Agent 自動化用 gpt‑oss;多模態任務用 Gemma 3。


RTX 5070(12 GB)推薦模型表

模型 量化 速度 適用場景
Qwen3.5 9B Instruct Q6_K / Q8_0 35–53 tok/s 日常問答、寫作、翻譯,12GB 卡最快首選
Llama 3.1 8B Q8_0 ~40 tok/s 通用對話穩定,適合備用助理模型

進階選項:若為 RTX 5070 Ti(16 GB),可升級跑 gpt‑oss 20B (Q4_K_M),Tool call 表現最乾淨,適合 Agent 任務。


任務對應快速查詢表

任務類型 RTX 5090 首選 RTX 5070 首選 備註
一般聊天/寫作/翻譯 Qwen3.6 35B‑A3B (Q6_K) Qwen3.5 9B Instruct (Q6_K/Q8_0) 回應快、多輪流暢
程式開發/Debug/重構 Qwen3‑Coder‑30B / Qwen2.5‑Coder‑32B (Q4) 僅限 32GB,品質接近雲端 GPT‑4o
數學題/邏輯推理/規劃 DeepSeek‑R1‑Distill‑32B (Q4/Q5) 思維鏈最強,需 32GB
Agent/自動化工具呼叫 gpt‑oss 20B (Q8_0) gpt‑oss 20B (Q4_K_M,需 16GB) Tool call 格式最穩定
圖片理解/多語言多模態 Gemma 3 27B (Q4) 原生視覺輸入,需 32GB

避坑指南與注意事項

  1. 不要在 12GB 卡硬跑 14B 以上模型:CPU offload 會將生成速度壓至個位數 tok/s,互動體驗極差。
  2. 量化等級權衡:Q6_K 平衡品質與速度;Q4 省 VRAM 但可能損失推理細節;Q8_0 品質最佳但佔用更多顯存。
  3. Context 長度:跑大模型時預留 VRAM 給 KV Cache,避免長對話中途 OOM。
  4. 驅動與運行時:確保 CUDA 12.6+、cuDNN 9.5+、最新 NVIDIA 驅動,以發揮 GDDR7 頻寬優勢。
  5. 模型來源:優先從 Hugging Face 官方倉庫(Qwen、deepseek‑ai、google 等)下載,確保權重完整。

部署快速入門

Ollama(CLI / 開發者導向)

# 安裝後直接拉取量化模型
ollama pull qwen3.6:35b-a3b-q6_k
ollama pull qwen3-coder:30b-q4
ollama pull deepseek-r1:32b-q4
# 啟動互動
ollama run qwen3.6:35b-a3b-q6_k

LM Studio(GUI / 新手友善)

  1. 下載安裝 LM Studio。
  2. 搜尋模型名稱(如 Qwen3.6 35B-A3B),選擇 Q6_K 量化下載。
  3. 在「Chat」頁面載入模型,調整 Context Length 與 GPU Offload 層數(5090 通常全層 GPU)。
  4. 切換模型只需在下拉選單選擇,無需重啟服務。

結語

VRAM 是硬限制,任務是軟導向。RTX 5090 的 32GB 讓你擁有「一卡走天下」的彈性,可依場景熱換專用模型;RTX 5070 則以 Qwen3.5 9B 為核心,專注輕量高速的日常助理角色。善用 Ollama 或 LM Studio 的多模型管理,即可在本地端構建出接近雲端級、且完全可控的 AI 工作流。