🎯 重點摘要: 本文帶你從零開始在 Windows / macOS / Linux 上安裝並使用 Ollama,本地跑起 Llama、Mistral、Qwen 等開源 LLM:
  ① 安裝 Ollama(支援三大平台)
  ② 使用 ollama pull 下載模型,ollama run 開始對話
  ③ 學會 ollama lsollama rmollama show 等指令管理模型
  ④ 進階設定 Modelfile 客製化提示模板、記憶上下文、GPU 加速
  5 分鐘就能擁有一個私隱無外洩、0 API 費的本地 AI 助理!

前言 — 什麼是 Ollama?

Ollama 是一個開源工具,讓你能在本地電腦上下載、管理與執行大語言模型。它支援多種熱門開源模型(如 Llama 2/3、Mistral、Qwen、Gemma 等),並提供簡單的 CLI 介面讓你馬上就能跟模型對話。

與 llama.cpp 不同,Ollama 預設包裝了模型下載、格式轉換、記憶體管理等功能,對新手更加友好 — 就像 docker 對容器技術一樣,Ollama 讓本地 LLM 部署變得像吃飽喝水那麼簡單。

支援的平台與模型

Ollama 目前支援 Windows 10/11、macOS(Intel & Apple Silicon)、Linux(Ubuntu/Debian)。常見支援模型包括:

  • Meta Llama:llama2、llama3、llama3.1、llama3.2(各版本都有)
  • Mistral:mistral、mistral-nemo、mixtral-8x7b 等
  • Qwen:qwen、qwen2.5、qwen2.5-coder 等(阿里模型)
  • Gemma:Google 開源的 2B/7B 模型
  • Phi:Microsoft 的小型語言模型
  • DeepSeek:deepseek-coder 等程式語言模型
💡 提示: 模型名稱後面可以加上 :latest 或版本號來指定下載特定版本,例如 ollama pull llama3.1:8b

如何安裝 Ollama

Windows 安裝

  1. 前往 Ollama 官方下載頁面
  2. 下載 Windows 版本的安裝程式 OllamaSetup.exe
  3. 雙擊執行,按照精靈完成安裝
  4. 安裝完成後,Ollama 會自動在背景啟動服務

驗證安裝:

ollama version

macOS 安裝

你可以使用 brew 或直接下載 dmg 安裝:

# 使用 Homebrew 安裝
brew install ollama

# 啟動 Ollama 服務
ollama serve

也可以直接下載 dmg 安裝包,拖曳到 Applications 資料夾即可。

🍎 Apple Silicon 注意: M1/M2/M3 等 ARM Mac 會自動下載 ARM 版本的模型,效能非常不錯!

Linux 安裝

Linux 使用者可以用官方提供的指令一鍵安裝:

curl -fsSL https://ollama.com/install.sh | sh

或者使用套件管理器(以 Ubuntu 為例):

# 添加 Ollama 的 repository key
curl -fsSL https://ollama.com/install.sh | sh

# 啟動服務
sudo systemctl start ollama

OLLAMA 基礎指令大全

以下是 Ollama 的核心指令,幫助你快速上手。

常用指令速查表

指令 說明 範例
ollama pull 下載模型 ollama pull llama3.1
ollama run 啟動並對話 ollama run llama3.1
ollama ls 列出已下載模型 ollama ls
ollama rm 刪除模型 ollama rm llama3.1
ollama show 顯示模型詳細資訊 ollama show llama3.1
ollama update 更新 Ollama 版本 ollama update
ollama serve 啟動 Ollama 伺服器服務 ollama serve
ollama cp 複製模型為新名稱 ollama cp llama3.1 my-llama
ollama create 從 Modelfile 建立客製化模型 ollama create my-model -f Modelfile
ollama push 推送模型到 Ollama 雲端 ollama push my-model

如何下載並執行第一個模型

步驟 1️⃣:下載模型

最簡單的方式是使用 ollama pull 來下載模型:

ollama pull llama3.1

下載完成後,你會看到類似這樣的訊息:

pulling manifest
pulling 8994806... 100%
pulling 7f3c7684... 100%
pulling 43a6dfa8... 100%
pulling cc740a25... 100%
pulling 1d83f75d... 100%
pulling 7bec07c3... 100%
verified 8a5b8d1e99e468129b9356749af49a021c276b1f7b8b8a60f4c81f66d2851617

步驟 2️⃣:開始對話

下載完成後,使用 ollama run 開始與模型對話:

ollama run llama3.1

進入互動模式後,你可以直接輸入問題:

>>> 你好,請簡介一下你自己。
你好!我是 Llama,你是問什麼呢?
(按下 Ctrl+C 兩次或輸入 /bye 離開)
💬 快速對話: 如果你只想問一次問題,可以直接在指令結尾加上提示:
ollama run llama3.1 "請介紹一下 Python 的 lambda 表達式"

步驟 3️⃣:查詢已下載模型

使用 ollama ls 列出目前已下載的模型:

NAME           ID                                    SIZE    MODIFIED
llama3.1       860c7560e7b4                4.9 GB    2 minutes ago

清理與管理模型

如果磁碟空間不足,可以使用 ollama rm 刪除不常用的模型:

# 刪除單一模型
ollama rm llama3.1

# 刪除所有未使用的模型
ollama prune

如何使用 Ollama API

Ollama 提供 HTTP API 供應程式與 AI 模型進行整合。你可以透過簡單的 HTTP 請求與模型溝通。

Ollama REST API

Ollama 預設監聽 http://localhost:11434,你可以發送 POST 請求:

# 啟動 API 服務
ollama serve

# 發送聊天請求
curl http://localhost:11434/api/generate -d '{
  "model": "llama3.1",
  "prompt": "請問台灣的首都是哪裡?",
  "stream": false
}'

API 參數說明

參數 類型 說明
model string 模型名稱
prompt string 提示問題
stream boolean 是否逐字回應 (True/False)
temperature float 隨機性(0~1)
top_p float 核取詞彙累積機率
top_k int 取 top-k 候選詞
num_ctx int 上下文最大長度(tokens)

Python 整合

如果你要在 Python 中使用 Ollama,可以透過requests呼叫 API:

import requests

def chat_ollama(model, prompt):
    r = requests.post(
        "http://localhost:11434/api/generate",
        json={"model": model, "prompt": prompt, "stream": False}
    )
    return r.json()["response"]

print(chat_ollama("llama3.1", "請問台灣的首都是哪裡?"))
🔌 注意: 如果你已經安裝了ollama-python,也可以使用官方 SDK來呼叫模型,更加方便。

進階 — 如何客製化模型 (Modelfile)

Ollama 支援Modelfile讓你可以客製化模型行為,類似於 Dockerfile 的概念。

基本 Modelfile 語法

# 基於 llama3.1 建立新模型
FROM llama3.1

# 設定系統提示
SYSTEM 你是一個友善且專業的 AI 助理,會用繁體中文回答所有問題。

# 設定參數
PARAMETER temperature 0.7
PARAMETER num_ctx 4096
        

結語

Ollama 讓本地部署 LLM 變得前所未有地簡單 — 無論你是希望保護隱私、節省 API 費用,或是想要一個可離線使用的 AI 助理,Ollama 都是極佳的選擇。

🎯 快速回顧步驟:
  1️⃣ 下載並安裝 Ollama(支援 Windows/macOS/Linux)
  2️⃣ ollama pull <model> 下載模型
  3️⃣ ollama run <model> 開始對話
  4️⃣ 使用 Modelfile 客製化行為
  5️⃣ 透過 API 整合進自己的應用

整個流程不到 10 分鐘,就能擁有一個私隱無外洩、0 API 費的本地 AI 助理。
🔗 推薦資源:
  • Ollama 官網
  • Ollama GitHub
  • Modelfile 官方文檔
  • API 文檔