DeepSeek(深度求索)是 2023 年成立的中國 AI 研究實驗室。與 OpenAI、Google 不同,DeepSeek 的定位是「開源優先」 — 幾乎所有模型都以 MIT License 釋出,允許商業使用、修改與再發佈。憑藉強大的 MoE 架構與超低價 API,DeepSeek 在 2024–2025 年迅速躋身開源 LLM 領域的佼佼者。
本文將帶你從零了解 DeepSeek 的整個模型家族:V3 的技術架構、R1 的推理能力、API 定價與使用方法,以及怎麼在本地部署。無論你是想省錢用 API,還是想研究開源模型,這篇文章都適合你。
DeepSeek 模型家族概覽
DeepSeek 目前主要推出了以下幾個重要的模型系列:
| 模型 | 發布時間 | 參數/特性 | 適用場景 |
|---|---|---|---|
| DeepSeek-V3 | 2024-12 | 671B 總參數 (MoE,37B激活) 14.8T 訓練 token MIT License |
通用對話、編碼、長文本 |
| DeepSeek-V3.2 | 2025-12 | V3 的進化版 工具使用+推理整合 思考模式支援 tool-use |
Agent 任務、多工具協作 |
| DeepSeek-V3.2-Speciale | 2025-12 | 強化推理能力 DeepSeekMath-V2 資料 API-only |
數學題、邏輯推理 |
| DeepSeek-R1 | 2025-01 | 671B 參數 (MoE) Chain-of-Thought 推理 MIT License |
複雜推理、數學、程式設計 |
| DeepSeek-R1-Zero | 2025-01 | 純 RL 訓練 無預先訓練資料 表現媲美 OpenAI-o1 |
研究、推理驗證 |
| DeepSeek-Coder | 2024-11 | 專為程式設計優化 支援 42 種程式語言 |
程式生成、Bug 修復 |
| DeepSeek-VL | 2024-02 | 視覺-語言多模態 支援圖片理解 |
圖片問答、文檔分析 |
📌 選擇指南:
• 日常問答、編碼 →deepseek-chat (V3/V3.2)
• 複雜推理、數學、邏輯 →deepseek-reasoner (R1)
• 本地研究、商業用途 → 開源模型 (MIT License)
DeepSeek-V3 技術架構解析
671B MoE 架構
DeepSeek-V3 使用 Mixture-of-Experts (MoE) 架構,總參數達 671B,但每次 inference 只激活 37B 的參數。這樣設計的好處是:
- inference 效能高 — 單次推理只需運算一部分 experts,速度更快
- 訓練成本可控 — 14.8T tokens 訓練下,僅需 2788 小時的 H800 GPU 時間
- 品質不輸閉源模型 — 在 MMLU、HumanEval 等基準上表現優異,某些指標超越 LLaMA3、GPT-3.5
四大關鍵技術
| 技術 | 作用 | 效益 |
|---|---|---|
| MLA (Multi-Head Latent Attention) | 壓縮 KV Cache,減少記憶體使用 | 長上下文推理成本降低 50%+ |
| DeepSeekMoE | 稀疏 MoE 架構,動態選擇 experts | 計算 efficiency 大幅提升 |
| 輔助損失自由負載均衡 | 自動分佈式 routing,無需手動設定 | 多 GPU 訓練更穩定 |
| 多 token 預測 ( MTP ) | 同時預測多個 token,提升吞吐量 | 推理速度提升 20~30% |
DeepSeek-R1:開源推理模型
Chain-of-Thought 推理
R1 是 DeepSeek 的第一個專注推理的模型。它透過大規模 強化學習 (RL) 訓練,學會逐步拆解複雜問題。
- R1-Zero:純 RL,不使用任何預先訓練資料,直接達到 o1-mini 級推理水準
- R1:在 R1-Zero 基礎上加入 cold-start data,品質更穩,指令遵循更好
6 個推理 phase
R1 在訓練過程中經歷 6 個階段,每個階段解鎖新的推理能力:
- Phase 1 — 學會拖延 (waste time):模型開始展延輸出
- Phase 2 — 學會自我反思:開始使用
traced track進行內心對話 - Phase 3 — 學會分析問題:開始將問題分解為子問題
- Phase 4 — 學會使用工具:開始嘗試程式碼、LaTeX 等
- Phase 5 — 學會進行深入推理:進入複雜推理循環
- Phase 6 — 學會簡化輸出:縮短不必要的冗詞
🧠 R1 在 2025 IMO (國際數學奧林匹亞) 獲得滿分,證明其推理能力已達頂尖水準!
釋出的 Distilled 模型
R1 還釋出了 6 個基於 Llama / Qwen 的 Distilled 模型,從 1.5B 到 70B 不等。
| 模型 | 基礎模型 | 參數量 | 特點 |
|---|---|---|---|
| DeepSeek-R1-Distill-Qwen-1.5B | Qwen2.5 | 1.5B | 輕量,適合手機或邊緣裝置 |
| DeepSeek-R1-Distill-Qwen-7B | Qwen2.5 | 7B | 平衡效能與資源 |
| DeepSeek-R1-Distill-Qwen-14B | Qwen2.5 | 14B | 強推理,中等顯存需求 |
| DeepSeek-R1-Distill-Qwen-32B | Qwen2.5 | 32B | 接近滿血 R1 效能 |
| DeepSeek-R1-Distill-Llama-8B | Llama3 | 8B | Llama 生態系 |
| DeepSeek-R1-Distill-Llama-70B | Llama3 | 70B | 最強 Distilled,14B Qwen 也被擊敗 |
💡 驚爆:70B Distilled 模型在 MATH benchmark 上超越了 OpenAI-o1-mini!
DeepSeek API 使用教學
註冊與取得 API Key
- 前往 platform.deepseek.com 註冊帳號
- 在個人中心 → API 管理 → 建立 API Key
- 新註冊使用者可獲得 5M 免費 tokens(無需信用卡)
定價政策
DeepSeek API 的定價相比 OpenAI 便宜了 5–30 倍:
| 模型 | 輸入 (Peak) | 快取命中 | 輸出 | 備註 |
|---|---|---|---|---|
| DeepSeek-V4-Flash | $0.14 / 1M tokens | $0.0028 / 1M tokens | $0.28 / 1M tokens | 最快最便宜,自動快取 |
| DeepSeek-V4-Pro | $0.435 / 1M tokens | $0.0036 / 1M tokens | $0.87 / 1M tokens | 品質更高,並發度較低 |
| DeepSeek-V4-Flash-Vision | $0.14 / 1M tokens | $0.0028 / 1M tokens | $0.28 / 1M tokens | 支援圖片輸入 |
| deepseek-chat (V3.2) | $0.28 / 1M tokens | $0.028 / 1M tokens | $0.42 / 1M tokens | 舊版定價 |
| deepseek-reasoner (R1) | $0.28 / 1M tokens | $0.028 / 1M tokens | $0.42 / 1M tokens | 推理模型 |
💰 提示: DeepSeek 提供 Off-peak 時段 (週一至週五 01:00–04:00 & 06:00–10:00 UTC) 50% 折扣,非常適合安排非緊急的批次工作。
快速上手 Python
DeepSeek API 完全兼容 OpenAI 格式,只要改一個 base_url 就可以直接用:
# 安裝 SDK
pip install openai
# 基本對話
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-chat", # 或 deepseek-reasoner
messages=[
{"role": "system", "content": "你是一個 helpful 的助理。"},
{"role": "user", "content": "解釋一下什麼是 MoE 架構?"}
],
temperature=0.7,
max_tokens=2048,
stream=True # 啟用串流回應
)
for chunk in response:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
使用 R1 推理模式
當你使用 deepseek-reasoner 模型時,API 會自動生成「思考過程」(thinking block) 再給出答案:
response = client.chat.completions.create(
model="deepseek-reasoner",
messages=[
{"role": "user", "content": "求解 1+1=?"}
]
)
# thinking_block 包含模型的內心推理過程
print(response.choices[0].message.reasoning_content) # 思考過程
print(response.choices[0].message.content) # 最終答案
在本地部署 DeepSeek
下載模型
所有 DeepSeek 開源模型都在 Hugging Face:
# V3 主體模型 (70B 參數版,適合單卡部署)
huggingface-cli download deepseek-ai/DeepSeek-V3 --local-dir ./deepseek-v3
# R1 推理模型
huggingface-cli download deepseek-ai/DeepSeek-R1 --local-dir ./deepseek-r1
# Distilled 小模型 (推薦筆電用)
huggingface-cli download deepseek-ai/DeepSeek-R1-Distill-Qwen-14B --local-dir ./deepseek-r1-14b
硬體需求
| 模型 | 最小顯存 | 推薦顯存 | 備註 |
|---|---|---|---|
| DeepSeek-R1-Distill-Qwen-7B | 8GB | 16GB | RTX 3060/4060 撐得住 |
| DeepSeek-R1-Distill-Qwen-14B | 16GB | 24GB | RTX 4070/4090 |
| DeepSeek-V3 70B | 40GB | 80GB | A100 80GB / H100 |
| DeepSeek-V3 671B (MoE) | 多卡 | 多卡 | 最少 4×A100 80GB |
用 vLLM 部署
# 安裝 vLLM
pip install vllm
# 啟動 API 服務 (兼容 OpenAI 格式)
vllm serve deepseek-ai/DeepSeek-V3 \
--tensor-parallel-size 4 \
--max-model-len 128000 \
--port 8000
# 測試
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-ai/DeepSeek-V3",
"messages": [{"role": "user", "content": "Hello"}]
}'
DeepSeek CLI 工具
除了官方 API,社群也提供了方便的 CLI 工具:
deepseek-cli (Python)
pip install deepseek
# 互動模式
deepseek
# 單次問答
echo "解釋一下 MoE" | deepseek -m deepseek-chat
# 上傳文件
deepseek --file report.pdf "總結這份報告的重點"
DeepSeek-shell-cli (Bash)
# 純 shell script,無額外依賴
export DEEPSEEK_API_KEY=your_key
curl -s "https://api.deepseek.com/chat/completions" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-chat",
"messages": [{"role":"user","content":"解釋 MoE"}]
}' | jq -r '.choices[0].message.content'
DeepSeek vs 其他模型
以下是 DeepSeek 與市面上主流模型的簡單比較:
| 面向 | DeepSeek | OpenAI GPT-4o | Claude 3 | Gemini 2.0 |
|---|---|---|---|---|
| 開源性 | ✅ 完全開源 (MIT) | ❌ 閉源 | ❌ 閉源 | ❌ 閉源 |
| API 價格 (輸入/百萬 tokens) | $0.14–$0.44 | $5.00 | $3.00 | $2.00 |
| Context 長度 | 128K (V3), 1M (V3.2) | 128K | 200K | 1M |
| 推理能力 | ✅ R1 媲美 o1 | ✅ o1 | ✅ Claude 3.7 Sonnet | ✅ Flash Thinking |
| 商業可用性 | ✅ MIT License | ❌ 限制 | ❌ 限制 | ❌ 限制 |
🎯 選擇 DeepSeek 的理由:
• 預算緊繫 — 便宜 5–30 倍的 API
• 開源需求 — MIT License 無限制商用
• 推理任務 — R1 表現媲美 o1-preview
• 長上下文 — 高達 1M token 窗口
總結
DeepSeek 代表了開源 LLM 的一個轉折點 — 既有強大的性能,又有極具競爭力的價格。無論是用 API 省錢,或是本地部署研究,都是 2025–2026 年不可錯過的選項。
🚀 快速上手: 先在 platform.deepseek.com 註冊取得 5M 免費 tokens → 用 OpenAI SDK 5 分鐘就能跑起來 → 若要本地研究,從 HuggingFace 下載 Distilled 7B 模型即可上手。