Ollama 教學:本地跑 AI 要多少記憶體、該選哪個模型,一次整理

Ollama 讓你在自己的電腦跑各種開源大語言模型,資料不外流、不用付 API 費,裝好一行指令就能跑(如 ollama run llama3.2)。記憶體是關鍵:模型能不能整個塞進 VRAM 是效能的最大變數,溢出到系統 RAM 會慢 5 到 10 倍。實測甜蜜點是 8 到 12GB VRAM,跑 7 到 8B 模型(Llama 3.1 8B、Qwen 3 8B)用 Q4_K_M 量化約 40+ tokens/秒;舒服日常建議 16GB RAM 加 8 到 12GB GPU(RTX 3060/4060 或 16GB Apple Silicon),跑 7 到 14B、30 到 60 tokens/秒。只有 8GB RAM 推薦:Phi-4 Mini(最快約 28 tokens/秒)、Llama 3.2 3B(全能)、Qwen 3 4B(推理)、Gemma 3 4B(多語言)、Mistral 7B(品質好但 context 要短)。要接受的現實:本地模型品質天花板在頂級雲端模型之下,不是 GPT-4/Claude 複雜任務的替代品,但簡單到中等任務在合適硬體上是通往免費私密 AI 後端最快的路。
- 效能最大變數:模型能不能整個塞進 VRAM,溢出到系統 RAM 會慢 5-10 倍
- 甜蜜點 8-12GB VRAM 跑 7-8B 模型(Llama 3.1 8B/Qwen 3 8B)約 40+ tokens/秒;舒服日常 16GB RAM + 8-12GB GPU
- 只有 8GB RAM 選:Phi-4 Mini(最快)、Llama 3.2 3B(全能)、Qwen 3 4B(推理)、Gemma 3 4B(多語)
- 現實:本地模型品質天花板在頂級雲端模型之下,不是 GPT-4/Claude 複雜任務替代品
搜「Ollama 教學」的人,最實際的問題通常是:我的電腦跑得動嗎、要選哪個模型。這篇直接把 2026 年的實測數據整理給你。
Ollama 是什麼
Ollama 讓你在自己的電腦跑各種開源大語言模型,資料不外流、也不用付 API 費用。裝好之後一行指令就能跑,像 ollama run llama3.2,對想在本機玩 AI 的人是最簡單的入口。
要多少記憶體:先看這個
最關鍵的一句話:模型能不能整個塞進 VRAM(顯示記憶體),是效能的最大變數。塞得進去就順,一旦溢出到系統 RAM,速度會慢 5 到 10 倍。
實測的甜蜜點是 8 到 12GB VRAM,能跑 7 到 8B 參數的模型(像 Llama 3.1 8B、Qwen 3 8B)用 Q4_K_M 量化,速度 40+ tokens/秒。想要舒服的日常使用,建議 16GB RAM 加上 8 到 12GB 的 GPU(NVIDIA RTX 3060/4060,或 16GB 的 Apple Silicon Mac),能跑 7 到 14B 模型、30 到 60 tokens/秒。
只有 8GB RAM 該選哪個模型
如果你機器普通、只有 8GB,這幾個是實測推薦:Phi-4 Mini(最快,約 28 tokens/秒)、Llama 3.2 3B(最全能的萬用款)、Qwen 3 4B(推理最好)、Gemma 3 4B(多語言最好)、Mistral 7B(品質最好,但要把 context 保持短)。寫程式的話,Qwen 2.5 Coder 14B 是 2026 本地寫程式的首選,但需要 16GB RAM。
一個要接受的現實
本地模型的品質天花板,還是在頂級雲端模型之下。它不是 GPT-4 或 Claude 在複雜任務上的替代品。但對簡單到中等的任務、在合適的硬體上,它是通往「免費、私密的 AI 後端」最快的路。想先想清楚要不要自己跑,可搭我另一篇 Ollama 開箱。
想先用不用架的方式把 AI 融進工作流,我在 AI101 也整理了一些工具,可先試手感。
我認為農場誇張詞會讓人秒識破你在學爆紅文。判斷很簡單,這個字會不會出現在農場標題,會就換掉。把「崩、爆、神級、秒懂」換成具體描述,可信度反而比喊得大聲還高。
我自己這幾年最深的體悟是:會被 AI 取代的是工具操作,留得下來的是判斷力。當定價被壓縮、護城河被打穿,行銷人能賣的只剩判斷,不是會不會用軟體。
不想碰伺服器,只想要結果?
這個 GitHub 專案功能完整,但你得自己配 server、串 API 金鑰、扛維運。
如果你現在只是要 AI 幫你寫文案、拆工作流、生行銷內容,免安裝、開箱即用的線上工具會更快上手。
30 秒免費試用 AI101 挑戰平台 →常見問題
Ollama 要多少記憶體才跑得動?
關鍵在於模型能否整個塞進 VRAM,溢出到系統 RAM 會慢 5 到 10 倍。實測甜蜜點是 8 到 12GB VRAM,可跑 7 到 8B 模型(如 Llama 3.1 8B、Qwen 3 8B)用 Q4_K_M 量化約 40+ tokens/秒。想要舒服的日常使用,建議 16GB RAM 加上 8 到 12GB 的 GPU(RTX 3060/4060 或 16GB Apple Silicon Mac),可跑 7 到 14B 模型、30 到 60 tokens/秒。
只有 8GB RAM 該用 Ollama 跑哪個模型?
2026 年的實測推薦:Phi-4 Mini(最快,約 28 tokens/秒)、Llama 3.2 3B(最全能的萬用款)、Qwen 3 4B(推理最好)、Gemma 3 4B(多語言最好)、Mistral 7B(品質最好但要把 context 保持短)。若要本地寫程式,Qwen 2.5 Coder 14B 是首選,但需要 16GB RAM。
Ollama 跑的本地模型能取代 ChatGPT 嗎?
在複雜任務上不能。本地模型的品質天花板仍在頂級雲端模型之下,不是 GPT-4 或 Claude 的替代品。但對簡單到中等的任務、在合適的硬體上,它是通往免費、私密 AI 後端最快的路,資料也完全留在自己這邊。
每天三篇 AI×行銷,訂閱不錯過
行銷觀點建立判斷力,AI / GitHub 工具開箱幫你選對工具。留個 email,新文章直接送到信箱。