Day 11:訓練管線與 CI/CD—品質門檻設定
· 閱讀時間約 7 分鐘
資料有版本(Day 09)、實驗有紀錄(Day 10),今天加上最重要會擋人的門,把它們串成一條自動跑也安心的管線。
這是 Level 0 到 Level 1 的關鍵一步,也是 Day 08 診斷表第 1、6、7 題的內容。
今天要解決的問題
先假設一個可能發生的災難:
團隊做了自動重訓,每週一自動用最新資料重訓並部署。 某個週一,上游資料管線出錯導致某個關鍵特徵全變成 0,模型照樣訓練完成(不會報錯)、照樣部署上線。到週四才有人發現,四天的預測全是垃圾。
自動化本身沒有錯,錯在自動化的路上沒有設關卡。今天要做的,就是在這條路上設三道關卡。
📊 職缺訊號
「訓練管線與 CI/CD」出現在 42.6% 的 MLOps 職缺中,是第三高的任務訊號。而在面試裡,這題常以「你會怎麼確保一個爛模型不會上線」的形式出現——答得出「品質門檻」三個字並能舉例,通常就過了。
一、現象:從一坨腳本到一條管線
先看管線該長什麼樣:

圖 11-1:訓練管線的六個步驟與三道關卡(示意架構)。每個步驟都可獨立重試、可快取、可分配不同資源;三道關卡分別擋資料、擋模型、擋部署。
拆成步驟的效益,不是「看起來比較專業」,而是三件很實際的事:
- 失敗可重試:訓練跑了兩小時後在註冊階段失敗,不必從頭再來。
- 步驟可快取:資料沒變時,前處理的結果可直接重用。
- 資源可分配:資料處理用 CPU、訓練用 GPU,各要各的。
