🎯 重點摘要: 本文帶你從零開始在 Windows / macOS / Linux 上安裝並使用 Ollama,本地跑起 Llama、Mistral、Qwen 等開源 LLM:
① 安裝 Ollama(支援三大平台)
② 使用ollama pull下載模型,ollama run開始對話
③ 學會ollama ls、ollama rm、ollama show等指令管理模型
④ 進階設定 Modelfile 客製化提示模板、記憶上下文、GPU 加速
5 分鐘就能擁有一個私隱無外洩、0 API 費的本地 AI 助理!
前言 — 什麼是 Ollama?
Ollama 是一個開源工具,讓你能在本地電腦上下載、管理與執行大語言模型。它支援多種熱門開源模型(如 Llama 2/3、Mistral、Qwen、Gemma 等),並提供簡單的 CLI 介面讓你馬上就能跟模型對話。
與 llama.cpp 不同,Ollama 預設包裝了模型下載、格式轉換、記憶體管理等功能,對新手更加友好 — 就像 docker 對容器技術一樣,Ollama 讓本地 LLM 部署變得像吃飽喝水那麼簡單。
支援的平台與模型
Ollama 目前支援 Windows 10/11、macOS(Intel & Apple Silicon)、Linux(Ubuntu/Debian)。常見支援模型包括:
- Meta Llama:llama2、llama3、llama3.1、llama3.2(各版本都有)
- Mistral:mistral、mistral-nemo、mixtral-8x7b 等
- Qwen:qwen、qwen2.5、qwen2.5-coder 等(阿里模型)
- Gemma:Google 開源的 2B/7B 模型
- Phi:Microsoft 的小型語言模型
- DeepSeek:deepseek-coder 等程式語言模型
💡 提示: 模型名稱後面可以加上:latest或版本號來指定下載特定版本,例如ollama pull llama3.1:8b。
如何安裝 Ollama
Windows 安裝
- 前往 Ollama 官方下載頁面
- 下載 Windows 版本的安裝程式
OllamaSetup.exe - 雙擊執行,按照精靈完成安裝
- 安裝完成後,Ollama 會自動在背景啟動服務
驗證安裝:
ollama version
macOS 安裝
你可以使用 brew 或直接下載 dmg 安裝:
# 使用 Homebrew 安裝
brew install ollama
# 啟動 Ollama 服務
ollama serve
也可以直接下載 dmg 安裝包,拖曳到 Applications 資料夾即可。
🍎 Apple Silicon 注意: M1/M2/M3 等 ARM Mac 會自動下載 ARM 版本的模型,效能非常不錯!
Linux 安裝
Linux 使用者可以用官方提供的指令一鍵安裝:
curl -fsSL https://ollama.com/install.sh | sh
或者使用套件管理器(以 Ubuntu 為例):
# 添加 Ollama 的 repository key
curl -fsSL https://ollama.com/install.sh | sh
# 啟動服務
sudo systemctl start ollama
OLLAMA 基礎指令大全
以下是 Ollama 的核心指令,幫助你快速上手。
常用指令速查表
| 指令 | 說明 | 範例 |
|---|---|---|
ollama pull |
下載模型 | ollama pull llama3.1 |
ollama run |
啟動並對話 | ollama run llama3.1 |
ollama ls |
列出已下載模型 | ollama ls |
ollama rm |
刪除模型 | ollama rm llama3.1 |
ollama show |
顯示模型詳細資訊 | ollama show llama3.1 |
ollama update |
更新 Ollama 版本 | ollama update |
ollama serve |
啟動 Ollama 伺服器服務 | ollama serve |
ollama cp |
複製模型為新名稱 | ollama cp llama3.1 my-llama |
ollama create |
從 Modelfile 建立客製化模型 | ollama create my-model -f Modelfile |
ollama push |
推送模型到 Ollama 雲端 | ollama push my-model |
如何下載並執行第一個模型
步驟 1️⃣:下載模型
最簡單的方式是使用 ollama pull 來下載模型:
ollama pull llama3.1
下載完成後,你會看到類似這樣的訊息:
pulling manifest
pulling 8994806... 100%
pulling 7f3c7684... 100%
pulling 43a6dfa8... 100%
pulling cc740a25... 100%
pulling 1d83f75d... 100%
pulling 7bec07c3... 100%
verified 8a5b8d1e99e468129b9356749af49a021c276b1f7b8b8a60f4c81f66d2851617
步驟 2️⃣:開始對話
下載完成後,使用 ollama run 開始與模型對話:
ollama run llama3.1
進入互動模式後,你可以直接輸入問題:
>>> 你好,請簡介一下你自己。
你好!我是 Llama,你是問什麼呢?
(按下 Ctrl+C 兩次或輸入 /bye 離開)
💬 快速對話: 如果你只想問一次問題,可以直接在指令結尾加上提示:ollama run llama3.1 "請介紹一下 Python 的 lambda 表達式"
步驟 3️⃣:查詢已下載模型
使用 ollama ls 列出目前已下載的模型:
NAME ID SIZE MODIFIED
llama3.1 860c7560e7b4 4.9 GB 2 minutes ago
清理與管理模型
如果磁碟空間不足,可以使用 ollama rm 刪除不常用的模型:
# 刪除單一模型
ollama rm llama3.1
# 刪除所有未使用的模型
ollama prune
如何使用 Ollama API
Ollama 提供 HTTP API 供應程式與 AI 模型進行整合。你可以透過簡單的 HTTP 請求與模型溝通。
Ollama REST API
Ollama 預設監聽 http://localhost:11434,你可以發送 POST 請求:
# 啟動 API 服務
ollama serve
# 發送聊天請求
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1",
"prompt": "請問台灣的首都是哪裡?",
"stream": false
}'
API 參數說明
| 參數 | 類型 | 說明 |
|---|---|---|
model |
string | 模型名稱 |
prompt |
string | 提示問題 |
stream |
boolean | 是否逐字回應 (True/False) |
temperature |
float | 隨機性(0~1) |
top_p |
float | 核取詞彙累積機率 |
top_k |
int | 取 top-k 候選詞 |
num_ctx |
int | 上下文最大長度(tokens) |
Python 整合
如果你要在 Python 中使用 Ollama,可以透過requests呼叫 API:
import requests
def chat_ollama(model, prompt):
r = requests.post(
"http://localhost:11434/api/generate",
json={"model": model, "prompt": prompt, "stream": False}
)
return r.json()["response"]
print(chat_ollama("llama3.1", "請問台灣的首都是哪裡?"))
🔌 注意: 如果你已經安裝了ollama-python,也可以使用官方 SDK來呼叫模型,更加方便。
進階 — 如何客製化模型 (Modelfile)
Ollama 支援Modelfile讓你可以客製化模型行為,類似於 Dockerfile 的概念。
基本 Modelfile 語法
# 基於 llama3.1 建立新模型
FROM llama3.1
# 設定系統提示
SYSTEM 你是一個友善且專業的 AI 助理,會用繁體中文回答所有問題。
# 設定參數
PARAMETER temperature 0.7
PARAMETER num_ctx 4096
結語
Ollama 讓本地部署 LLM 變得前所未有地簡單 — 無論你是希望保護隱私、節省 API 費用,或是想要一個可離線使用的 AI 助理,Ollama 都是極佳的選擇。
🎯 快速回顧步驟:
1️⃣ 下載並安裝 Ollama(支援 Windows/macOS/Linux)
2️⃣ ollama pull <model> 下載模型
3️⃣ ollama run <model> 開始對話
4️⃣ 使用 Modelfile 客製化行為
5️⃣ 透過 API 整合進自己的應用
整個流程不到 10 分鐘,就能擁有一個私隱無外洩、0 API 費的本地 AI 助理。
🔗 推薦資源:
• Ollama 官網
• Ollama GitHub
• Modelfile 官方文檔
• API 文檔