🎯 重點摘要: 本文帶你從零開始在電腦上安裝並使用 LM Studio,輕鬆在本地跑起 Llama、Mistral、Qwen 等開源 LLM:
  ① 下載並安裝 LM Studio(支援 Windows/macOS/Linux)
  ② 從內建商店下載 GGUF / Hugging Face 模型(Q4_K_M 推薦)
  ③ 設定 GPU 加速(CUDA / Metal / DirectML)提升推理速度
  ④ 使用對話介面、指令模板與提示工程功能
  ⑤ Local Server 模式整合進自己的應用程式
  不用程式碼、不用 CLI,10 分鐘就能擁有本地 AI 助理!

前言 — 什麼是 LM Studio?

LM Studio 是一個圖形化的本地 LLM 桌面應用程式,支援下載、管理、執行各種開源大語言模型(如 Llama 2/3、Mistral、Qwen、Phi 等)。它封裝了 ggmlgguf 格式的推理引擎,讓普通用戶無需寫任何程式碼,就能在自己的電腦上體驗強大的 AI 對話。

llama.cppOllama 相比,LM Studio 的最大特色在於「圖形化操作」與「即點即用」——你可以在視窗中直接搜尋模型、點擊下載、設定參數,然後馬上開始聊天。

支援的平台

  • Windows 10/11 — 支援 NVIDIA CUDA / AMD ROCm / Intel Arc
  • macOS — 支援 Intel + Apple Silicon(Metal 加速)
  • Linux — 支援 NVIDIA CUDA / AMD ROCm / CPU

如何下載並安裝 LM Studio

步驟 1️⃣:前往官方網站

打開瀏覽器前往 https://lmstudio.ai,點擊「Download」按鈕。

步驟 2️⃣:選擇對應版本下載

LM Studio 會自動偵測你的作業系統,並提供對應的安裝檔:

平台 檔案格式 備註
Windows .exe 支援 x64 / ARM64
macOS .dmg 支援 Intel / Apple Silicon (M1/M2/M3)
Linux AppImage / .deb / .rpm 支援大多數發行版

步驟 3️⃣:執行安裝

  • Windows: 雙擊下載好的 .exe 檔案,依據精靈完成安裝。
  • macOS: 打開 .dmg,將 LM Studio 拖進 Applications。
  • Linux: 執行 AppImage 或使用套件管理器安裝。
💡 技巧: 安裝後第一次啟動時,LM Studio 會要求你選擇模型下載資料夾,建議放在 SSD 磁碟以提升讀取速度。

如何下載模型

LM Studio 提供兩種方式下載模型:

方法 1:內建模型商店 (推薦)

啟動 LM Studio 後,點擊左側「Models」標籤,輸入關鍵字(如 llama3, qwen2.5)搜尋。

點擊模型卡片右下角的 Download 按鈕,就會開始下載。

方法 2:從 Hugging Face 匯入

如果找不到想要的模型,可以從 Hugging Face 直接下載 .gguf 檔案,然後拖曳到 LM Studio 視窗中匯入。

量化等級怎麼選?

LM Studio 支援多種量化等級,以下是推薦:

等級 檔案大小 品質 適合硬體
Q2_K ~2-3 GB 較低 VRAM < 4GB / CPU
Q4_K_M ~4-5 GB 良好 ⚡ 推薦!VRAM 4~8GB
Q5_K_M ~6-7 GB VRAM > 8GB
Q8_0 ~8-10 GB 接近完整 VRAM > 12GB
📊 推薦: 入門使用推 Q4_K_M — 品質不錯、體積 manageable,適合大多數電腦!

啟動模型 & 開始對話

下載完成後,點擊「Chat」標籤,選擇剛剛下載的模型,即可開始對話。

LM Studio 支援即時對話流,像 ChatGPT 一樣逐字顯示回應。

常用對話功能

  • 提示模板 (Prompt Templates):快速套用常用指令模板
  • 記憶功能:支援多輪對話,自動記住上下文
  • 字數限制:可設定 Max Tokens 控制回應長度
  • 溫度調整:調整 Temperature 控制隨機性
  • 停止詞設定:設定 Stop 詞條件來結束生成

設定 GPU 加速

LM Studio 支援 NVIDIA CUDA、AMD ROCm、Intel Arc 與 Apple Metal 加速。以下是設定方法:

Windows / Linux (NVIDIA CUDA)

  1. 確保已安裝 NVIDIA 驅動程式與 CUDA Toolkit。
  2. 在 LM Studio 的「設定」→「硬體加速」中,開啟 CUDA 選項。
  3. 重新啟動應用程式後,LLM 會自動使用 GPU 推理。

macOS (Apple Silicon)

  1. 確保你使用的是 Apple Silicon Mac(M1/M2/M3)。
  2. 在「設定」→「硬體加速」中啟用 Metal

AMD / Intel:

LM Studio 也支援 AMD GPU(透過 ROCm)與 Intel Arc(透過 OpenCL),具體支援取決於你的顯卡型號與驅動版本。

🚀 效能比較: 在 RTX 4060 + Llama 3.1 8B Q4_K_M 模型下,GPU 加速可讓推理速度提升 8~10 倍(約 25 tokens/s → 200 tokens/s)。

Local Server 模式

LM Studio 內建一個 Local Server 功能,讓你可以把本地模型當作 OpenAI API 的替代品來使用。

啟動 Local Server

  1. 點擊左側「Local Server」標籤。
  2. 選擇已下載的模型。
  3. 點擊「Start Server」。

啟動後,伺服器會監聽在 http://localhost:1234

使用 Local Server

你可以透過任何支援 OpenAI API 的應用程式(如 Continue、cursor 等)來連接 LM Studio:

# 發送聊天請求
curl http://localhost:1234/v1/chat/completions -H "Content-Type: application/json" -d '{
  "model": "llama-3.1",
  "messages": [{"role": "user", "content": "請問台灣的首都是哪裡?"}],
  "stream": false
}'
🔌 應用整合:http://localhost:1234/v1 填入應用程式的 OpenAI API 金鑰欄位即可使用。

進階功能介紹

提示模板 (Prompt Templates)

LM Studio 支援自訂提示模板,常見應用:

[INST] <>
你是一個友善且專業的 AI 助理,會用繁體中文回答所有問題。
<>
{{UserInput}} [/INST]

模型參數調整

在「Settings」→「模型參數」中,你可以調整:

參數 說明 推薦值
Temperature 隨機性(0~1) 0.7
Top P 核取詞彙累積機率 0.95
Top K 取 top-k 候選詞 40
Repeat Penalty 重褑懲罰因子 1.1
Max Tokens 最大生成長度 2048
Ctx Size 上下文最大長度(tokens) 4096

常見問題 (FAQ)

1. LM Studio 無法偵測到 GPU?

請確認:

  • GPU 驅動已更新到最新版本。
  • CUDA Toolkit 已正確安裝。
  • 在設定中啟用了對應的加速後端。

2. 模型回應速度慢怎麼辦?

嘗試以下優化:

  • 降低 Ctx Size 長度。
  • 選擇更小量化等級的模型(如 Q2_K)。
  • 確保在 SSD 上而非 HDD 存放模型。

3. 如何清除快取或重置設定?

在「設定」→「進階」中點擊「Reset」即可。模型檔案不會被刪除。

結語

LM Studio 讓本地 LLM 部署變得前所未有地簡單 — 無論你是希望保護隱私、節省 API 費用,或是想要一個可離線使用的 AI 助理,LM Studio 都是極佳的選擇。

🎯 快速回顧步驟:
  1️⃣ 前往 lmstudio.ai 下載並安裝
  2️⃣ 在「Models」標籤下載 Q4_K_M 模型
  3️⃣ 在「Chat」標籤開始對話
  4️⃣ 在「Settings」啟用 GPU 加速
  5️⃣ 可選:啟用 Local Server 整合進應用

整個流程不用一行程式碼,10 分鐘就能擁有一個私隱無外洩、0 API 費的本地 AI 助理。
🔗 推薦資源:
  • LM Studio 官網
  • LM Studio GitHub
  • Hugging Face GGUF 模型列表