🎯 重點摘要: 本文帶你從零開始在電腦上安裝並使用 LM Studio,輕鬆在本地跑起 Llama、Mistral、Qwen 等開源 LLM:
① 下載並安裝 LM Studio(支援 Windows/macOS/Linux)
② 從內建商店下載 GGUF / Hugging Face 模型(Q4_K_M 推薦)
③ 設定 GPU 加速(CUDA / Metal / DirectML)提升推理速度
④ 使用對話介面、指令模板與提示工程功能
⑤ Local Server 模式整合進自己的應用程式
不用程式碼、不用 CLI,10 分鐘就能擁有本地 AI 助理!
前言 — 什麼是 LM Studio?
LM Studio 是一個圖形化的本地 LLM 桌面應用程式,支援下載、管理、執行各種開源大語言模型(如 Llama 2/3、Mistral、Qwen、Phi 等)。它封裝了 ggml 和 gguf 格式的推理引擎,讓普通用戶無需寫任何程式碼,就能在自己的電腦上體驗強大的 AI 對話。
與 llama.cpp 或 Ollama 相比,LM Studio 的最大特色在於「圖形化操作」與「即點即用」——你可以在視窗中直接搜尋模型、點擊下載、設定參數,然後馬上開始聊天。
支援的平台
- Windows 10/11 — 支援 NVIDIA CUDA / AMD ROCm / Intel Arc
- macOS — 支援 Intel + Apple Silicon(Metal 加速)
- Linux — 支援 NVIDIA CUDA / AMD ROCm / CPU
如何下載並安裝 LM Studio
步驟 1️⃣:前往官方網站
打開瀏覽器前往 https://lmstudio.ai,點擊「Download」按鈕。
步驟 2️⃣:選擇對應版本下載
LM Studio 會自動偵測你的作業系統,並提供對應的安裝檔:
| 平台 | 檔案格式 | 備註 |
|---|---|---|
| Windows | .exe | 支援 x64 / ARM64 |
| macOS | .dmg | 支援 Intel / Apple Silicon (M1/M2/M3) |
| Linux | AppImage / .deb / .rpm | 支援大多數發行版 |
步驟 3️⃣:執行安裝
- Windows: 雙擊下載好的
.exe檔案,依據精靈完成安裝。 - macOS: 打開
.dmg,將 LM Studio 拖進 Applications。 - Linux: 執行 AppImage 或使用套件管理器安裝。
💡 技巧: 安裝後第一次啟動時,LM Studio 會要求你選擇模型下載資料夾,建議放在 SSD 磁碟以提升讀取速度。
如何下載模型
LM Studio 提供兩種方式下載模型:
方法 1:內建模型商店 (推薦)
啟動 LM Studio 後,點擊左側「Models」標籤,輸入關鍵字(如 llama3, qwen2.5)搜尋。
點擊模型卡片右下角的 Download 按鈕,就會開始下載。
方法 2:從 Hugging Face 匯入
如果找不到想要的模型,可以從 Hugging Face 直接下載 .gguf 檔案,然後拖曳到 LM Studio 視窗中匯入。
量化等級怎麼選?
LM Studio 支援多種量化等級,以下是推薦:
| 等級 | 檔案大小 | 品質 | 適合硬體 |
|---|---|---|---|
| Q2_K | ~2-3 GB | 較低 | VRAM < 4GB / CPU |
| Q4_K_M | ~4-5 GB | 良好 | ⚡ 推薦!VRAM 4~8GB |
| Q5_K_M | ~6-7 GB | 高 | VRAM > 8GB |
| Q8_0 | ~8-10 GB | 接近完整 | VRAM > 12GB |
📊 推薦: 入門使用推 Q4_K_M — 品質不錯、體積 manageable,適合大多數電腦!
啟動模型 & 開始對話
下載完成後,點擊「Chat」標籤,選擇剛剛下載的模型,即可開始對話。
LM Studio 支援即時對話流,像 ChatGPT 一樣逐字顯示回應。
常用對話功能
- 提示模板 (Prompt Templates):快速套用常用指令模板
- 記憶功能:支援多輪對話,自動記住上下文
- 字數限制:可設定
Max Tokens控制回應長度 - 溫度調整:調整
Temperature控制隨機性 - 停止詞設定:設定
Stop詞條件來結束生成
設定 GPU 加速
LM Studio 支援 NVIDIA CUDA、AMD ROCm、Intel Arc 與 Apple Metal 加速。以下是設定方法:
Windows / Linux (NVIDIA CUDA)
- 確保已安裝 NVIDIA 驅動程式與 CUDA Toolkit。
- 在 LM Studio 的「設定」→「硬體加速」中,開啟
CUDA選項。 - 重新啟動應用程式後,LLM 會自動使用 GPU 推理。
macOS (Apple Silicon)
- 確保你使用的是 Apple Silicon Mac(M1/M2/M3)。
- 在「設定」→「硬體加速」中啟用
Metal。
AMD / Intel:
LM Studio 也支援 AMD GPU(透過 ROCm)與 Intel Arc(透過 OpenCL),具體支援取決於你的顯卡型號與驅動版本。
🚀 效能比較: 在 RTX 4060 + Llama 3.1 8B Q4_K_M 模型下,GPU 加速可讓推理速度提升 8~10 倍(約 25 tokens/s → 200 tokens/s)。
Local Server 模式
LM Studio 內建一個 Local Server 功能,讓你可以把本地模型當作 OpenAI API 的替代品來使用。
啟動 Local Server
- 點擊左側「Local Server」標籤。
- 選擇已下載的模型。
- 點擊「Start Server」。
啟動後,伺服器會監聽在 http://localhost:1234。
使用 Local Server
你可以透過任何支援 OpenAI API 的應用程式(如 Continue、cursor 等)來連接 LM Studio:
# 發送聊天請求
curl http://localhost:1234/v1/chat/completions -H "Content-Type: application/json" -d '{
"model": "llama-3.1",
"messages": [{"role": "user", "content": "請問台灣的首都是哪裡?"}],
"stream": false
}'
🔌 應用整合: 將 http://localhost:1234/v1 填入應用程式的 OpenAI API 金鑰欄位即可使用。
進階功能介紹
提示模板 (Prompt Templates)
LM Studio 支援自訂提示模板,常見應用:
[INST] <>
你是一個友善且專業的 AI 助理,會用繁體中文回答所有問題。
< >
{{UserInput}} [/INST]
模型參數調整
在「Settings」→「模型參數」中,你可以調整:
| 參數 | 說明 | 推薦值 |
|---|---|---|
Temperature |
隨機性(0~1) | 0.7 |
Top P |
核取詞彙累積機率 | 0.95 |
Top K |
取 top-k 候選詞 | 40 |
Repeat Penalty |
重褑懲罰因子 | 1.1 |
Max Tokens |
最大生成長度 | 2048 |
Ctx Size |
上下文最大長度(tokens) | 4096 |
常見問題 (FAQ)
1. LM Studio 無法偵測到 GPU?
請確認:
- GPU 驅動已更新到最新版本。
- CUDA Toolkit 已正確安裝。
- 在設定中啟用了對應的加速後端。
2. 模型回應速度慢怎麼辦?
嘗試以下優化:
- 降低
Ctx Size長度。 - 選擇更小量化等級的模型(如 Q2_K)。
- 確保在 SSD 上而非 HDD 存放模型。
3. 如何清除快取或重置設定?
在「設定」→「進階」中點擊「Reset」即可。模型檔案不會被刪除。
結語
LM Studio 讓本地 LLM 部署變得前所未有地簡單 — 無論你是希望保護隱私、節省 API 費用,或是想要一個可離線使用的 AI 助理,LM Studio 都是極佳的選擇。
🎯 快速回顧步驟:
1️⃣ 前往 lmstudio.ai 下載並安裝
2️⃣ 在「Models」標籤下載 Q4_K_M 模型
3️⃣ 在「Chat」標籤開始對話
4️⃣ 在「Settings」啟用 GPU 加速
5️⃣ 可選:啟用 Local Server 整合進應用
整個流程不用一行程式碼,10 分鐘就能擁有一個私隱無外洩、0 API 費的本地 AI 助理。
🔗 推薦資源:
• LM Studio 官網
• LM Studio GitHub
• Hugging Face GGUF 模型列表