跳轉到

模型訓練與調整選修指南

← 回到 Stage 1

這是一張選路卡,不是訓練課。你只要看懂「哪一種方法會改模型,哪一種只是幫模型做事」。初學者可以先讀完表格,再回 Stage 1 呼叫現成模型。

資料查核:2026-08-31 UTC;範圍:模型訓練、調整與部署方法。

🧭 先看整條路

資料經過 Pre-training 與 Post-training 變成可供 Inference 使用的模型;Prompt、RAG、Memory、Tools 與 Harness 在 Agent 系統中包住模型,通常不改模型權重
開啟原圖(新分頁)
  1. Pre-training(預訓練):用大量資料建立 Base Model。
  2. Post-training(後訓練):用示範、偏好或回饋,讓模型更會照指令做事。
  3. Inference(推論):模型訓練完後,收到一次輸入並產生一次結果。
  4. Agent 系統:把模型和 Prompt、RAG、Memory、Tools、Harness 接起來完成工作。

🧩 先認識方法,不必先實作

目的方法白話意思會改權重嗎?
教模型怎麼做SFT(Supervised Fine-Tuning)把好問題和好答案給模型看,讓它模仿。
DPO(Direct Preference Optimization)給模型看兩個答案,告訴它哪一個比較符合偏好。
RLHF/RL用人類或規則的回饋,讓模型學著拿到更好的結果。
GRPO讓同一題的多個答案互相比較,再用相對表現學習。
少改一點就適應PEFT只訓練一小部分參數,減少需要更新的內容。會改少量新增或選定參數
LoRA凍結原本權重,另外學一組較小的低秩矩陣。原權重不改;會訓練新增參數
讓模型更小或更省Distillation(蒸餾)讓較小的 Student Model 學習較大的 Teacher Model。會訓練 Student Model
Quantization(量化)用較少位元保存或運算權重,通常能少用記憶體。通常不重新訓練原模型;部分方法會再調整

不要把外部系統誤認成訓練

方法 它真正做的事 通常會改模型權重嗎?
Prompt 告訴模型這一次要做什麼。 不會
RAG 先找外部資料,再把證據放進這次輸入。 不會
Memory 保存之後還要用的狀態,再於需要時讀回。 不會
Tools 讓程式在檢查後執行搜尋、計算或其他動作。 不會
Harness 管理工具、權限、狀態、記錄、重試與停止規則。 不會

「通常不會」很重要。有些產品會在背後另外啟動訓練工作;只看畫面名稱無法判斷。要確認時,查看官方文件是否寫到 training job、trainable parameters 或 model weights。

📚 必修閱讀與精選資源

先讀前兩筆就能分清主線。其餘在你真的要訓練或壓縮模型時再看。推薦度是編輯判斷,不是 GitHub stars。

分類資源推薦度你會學到什麼
先分清主線OpenAI:模型如何開發⭐⭐⭐⭐⭐資料、訓練與模型之間的關係。
Google:LLM 調整⭐⭐⭐⭐⭐Prompt Engineering、Fine-tuning 與 Distillation 的邊界。
學 Post-trainingOpenAI:gpt-oss⭐⭐⭐⭐一個模型家族如何描述 Pre-training、SFT 與 RL。
Hugging Face TRL⭐⭐⭐⭐SFT、DPO、GRPO 等 Post-training 方法入口。
少改或壓縮Hugging Face PEFT⭐⭐⭐⭐只訓練較少參數的做法與限制。
Hugging Face LoRA⭐⭐⭐⭐凍結原權重,再訓練低秩矩陣。
Hugging Face Quantization⭐⭐⭐用較低精度減少記憶體與運算需求。

🛠 一個不花 GPU 的判斷練習

把下面四個問題各選一條先試的路,再用一句話說理由:

  1. 每天更新的公司規章要能被回答:先試 RAG
  2. 每次輸出都要符合固定品牌語氣:先用 Prompt 與 Eval;證據顯示不夠時,再評估 Fine-tuning
  3. 模型太大,裝置放不下:先評估 Quantization 或較小模型。
  4. 想少訓練參數,讓模型適應專門格式:先評估 LoRA/PEFT

這不是永遠正確的答案。真正決定前,要用自己的資料、Eval、硬體與成本限制測試。

進階:真正動手前還要確認什麼?
  • 你有沒有合法使用訓練資料,並移除不該出現的敏感資料?
  • Base Model 的 license 是否允許你的用途與散布方式?
  • 訓練集、驗證集與測試集是否分開?
  • 你是否保留未調整模型作為 baseline?
  • 訓練後是否重新跑安全、偏差、品質、成本與延遲 Eval?
  • 你能不能停止失敗工作、保留 checkpoint,並回到上一個可用版本?

✅ 完成檢查

  • 我能說出 Pre-training、Post-training 與 Inference 的順序。
  • 我知道 Fine-tuning 會調整模型權重,RAG 通常不會。
  • 我能用一句話分清 SFT、DPO、RLHF/RL 與 GRPO。
  • 我知道 LoRA/PEFT、Distillation 與 Quantization 解決的問題不同。
  • 我不會因為看到一個新名詞,就立刻開始昂貴的訓練工作。

← 回到 Stage 1,繼續第一次模型呼叫