模型訓練與調整選修指南¶
這是一張選路卡,不是訓練課。你只要看懂「哪一種方法會改模型,哪一種只是幫模型做事」。初學者可以先讀完表格,再回 Stage 1 呼叫現成模型。
資料查核:2026-08-31 UTC;範圍:模型訓練、調整與部署方法。
🧭 先看整條路¶
- Pre-training(預訓練):用大量資料建立 Base Model。
- Post-training(後訓練):用示範、偏好或回饋,讓模型更會照指令做事。
- Inference(推論):模型訓練完後,收到一次輸入並產生一次結果。
- Agent 系統:把模型和 Prompt、RAG、Memory、Tools、Harness 接起來完成工作。
🧩 先認識方法,不必先實作¶
| 目的 | 方法 | 白話意思 | 會改權重嗎? |
|---|---|---|---|
| 教模型怎麼做 | SFT(Supervised Fine-Tuning) | 把好問題和好答案給模型看,讓它模仿。 | 會 |
| DPO(Direct Preference Optimization) | 給模型看兩個答案,告訴它哪一個比較符合偏好。 | 會 | |
| RLHF/RL | 用人類或規則的回饋,讓模型學著拿到更好的結果。 | 會 | |
| GRPO | 讓同一題的多個答案互相比較,再用相對表現學習。 | 會 | |
| 少改一點就適應 | PEFT | 只訓練一小部分參數,減少需要更新的內容。 | 會改少量新增或選定參數 |
| LoRA | 凍結原本權重,另外學一組較小的低秩矩陣。 | 原權重不改;會訓練新增參數 | |
| 讓模型更小或更省 | Distillation(蒸餾) | 讓較小的 Student Model 學習較大的 Teacher Model。 | 會訓練 Student Model |
| Quantization(量化) | 用較少位元保存或運算權重,通常能少用記憶體。 | 通常不重新訓練原模型;部分方法會再調整 |
不要把外部系統誤認成訓練¶
| 方法 | 它真正做的事 | 通常會改模型權重嗎? |
|---|---|---|
| Prompt | 告訴模型這一次要做什麼。 | 不會 |
| RAG | 先找外部資料,再把證據放進這次輸入。 | 不會 |
| Memory | 保存之後還要用的狀態,再於需要時讀回。 | 不會 |
| Tools | 讓程式在檢查後執行搜尋、計算或其他動作。 | 不會 |
| Harness | 管理工具、權限、狀態、記錄、重試與停止規則。 | 不會 |
「通常不會」很重要。有些產品會在背後另外啟動訓練工作;只看畫面名稱無法判斷。要確認時,查看官方文件是否寫到 training job、trainable parameters 或 model weights。
📚 必修閱讀與精選資源¶
先讀前兩筆就能分清主線。其餘在你真的要訓練或壓縮模型時再看。推薦度是編輯判斷,不是 GitHub stars。
| 分類 | 資源 | 推薦度 | 你會學到什麼 |
|---|---|---|---|
| 先分清主線 | OpenAI:模型如何開發 | ⭐⭐⭐⭐⭐ | 資料、訓練與模型之間的關係。 |
| Google:LLM 調整 | ⭐⭐⭐⭐⭐ | Prompt Engineering、Fine-tuning 與 Distillation 的邊界。 | |
| 學 Post-training | OpenAI:gpt-oss | ⭐⭐⭐⭐ | 一個模型家族如何描述 Pre-training、SFT 與 RL。 |
| Hugging Face TRL | ⭐⭐⭐⭐ | SFT、DPO、GRPO 等 Post-training 方法入口。 | |
| 少改或壓縮 | Hugging Face PEFT | ⭐⭐⭐⭐ | 只訓練較少參數的做法與限制。 |
| Hugging Face LoRA | ⭐⭐⭐⭐ | 凍結原權重,再訓練低秩矩陣。 | |
| Hugging Face Quantization | ⭐⭐⭐ | 用較低精度減少記憶體與運算需求。 |
🛠 一個不花 GPU 的判斷練習¶
把下面四個問題各選一條先試的路,再用一句話說理由:
- 每天更新的公司規章要能被回答:先試 RAG。
- 每次輸出都要符合固定品牌語氣:先用 Prompt 與 Eval;證據顯示不夠時,再評估 Fine-tuning。
- 模型太大,裝置放不下:先評估 Quantization 或較小模型。
- 想少訓練參數,讓模型適應專門格式:先評估 LoRA/PEFT。
這不是永遠正確的答案。真正決定前,要用自己的資料、Eval、硬體與成本限制測試。
進階:真正動手前還要確認什麼?
- 你有沒有合法使用訓練資料,並移除不該出現的敏感資料?
- Base Model 的 license 是否允許你的用途與散布方式?
- 訓練集、驗證集與測試集是否分開?
- 你是否保留未調整模型作為 baseline?
- 訓練後是否重新跑安全、偏差、品質、成本與延遲 Eval?
- 你能不能停止失敗工作、保留 checkpoint,並回到上一個可用版本?
✅ 完成檢查¶
- 我能說出 Pre-training、Post-training 與 Inference 的順序。
- 我知道 Fine-tuning 會調整模型權重,RAG 通常不會。
- 我能用一句話分清 SFT、DPO、RLHF/RL 與 GRPO。
- 我知道 LoRA/PEFT、Distillation 與 Quantization 解決的問題不同。
- 我不會因為看到一個新名詞,就立刻開始昂貴的訓練工作。