五台煙燻機,一個老師傅,每天早上 7 點半靠一張紙和一支筆把隔天的生產順序排出來。
這不是一個 AI 導入的失敗故事。這是一個 AI 導入技術上成功了,卻被主管親手關掉的真實案例。
黑橋牌,香腸火腿的製造商。煙燻站是整條產線裡最複雜的一關,旺季一天幾十張訂單,旺季淡季差三倍。他們想導入演算法排程,目標講得很清楚:讓員工早點下班。
技術人員跑演算法,跑出來的結果是——排程更好了,理論上能提早 20 分鐘完成。
然後有人問了一句:「這張訂單怎麼換了七次機台?」
資深排班員工回:「不行啊,訂單最多只能換一次。」
於是「最多換一次」被寫進了限制條件。AI 從此只能在這條線裡面算。
這個專案,技術上成功導入了,組織上失敗了。
而失敗的原因,聽起來一点都不像 AI 問題。
一、導入 AI 失敗,最常見的死法不是你想的那個
先講清楚這件事為什麼嚴重。
導入 AI 失敗,大家習慣講三個原因:資料不夠、預算不夠、人才不夠。這三個都是真的,但它們都不是最常見的死因。
最常見的死因是:你在告訴 AI 它能做到什麼程度的時候,順便把它以前做不到的事也算進去了。
主管跟技術團隊開會,通常是這樣問的:
「你們排程排得準嗎?」
「準。」
「那流程上還有哪些限制?」
主管在這裡問「限制」,是想要拿到一個清楚的邊界,讓團隊知道什麼不能碰。技術團隊聽到「限制」兩個字,馬上就會列出他們在現場觀察到的所有規則。
這一步沒錯。錯在清單裡面混了兩種東西。
一種是「這台機器就是只能煮,不能烘也不能煙」。這叫限制。
另一種是「一張訂單最好只換一次機台,不然現場會亂」。這叫慣例。
主管在會議室裡說不出這兩者的差別。於是兩種都進了限制條件表。技術團隊照著做,做出來一套符合「限制表」、但完全達不到「早點下班」的系統。
AI 沒有做錯任何事。它只是非常認真地,在一個被縮小的籠子裡,做到最優。
二、怎麼分辨「限制」和「慣例」
這是整篇文章最實用的一段。你可以照著問。
判準:它是不是因為「人算不動」才出現的?
- 限制:來自物理世界或硬體本身,改不掉。機台功能、產線長度、法規、工時上限、清潔需要幾小時。
- 慣例:來自某個時代的算力上限。人腦算不動,所以退一步,訂一條比較好算的規則。
黑橋牌那條「最多換一次」,是哪一種?
排班員工自己講得很清楚:要算一張訂單多次進出機台的排程,非常麻煩。所以他們訂了一條經驗法則,大部分時候不用做複雜調度就能把活幹完。
那條規則的目的不是「讓排程更好」,是「讓人算得起來」。
用現代 AI 去執行一條為了讓人算得起來而生的規則,這是拿拖拉機去跑一條給馬設的路。
三個追問,現場就問得出來
問技術團隊或現場主管這三句,答案會自己浮出來:
1. 「這條規則,是機器或法規強制的,還是人訂的?」
答「人訂的」,繼續問第二句。
2. 「如果不遵守,會發生什麼?是會壞掉,還是會很麻煩?」
「會壞掉」和「會很麻煩」是兩個等級的東西。「會壞掉」是限制,「很麻煩」常常只是沿用了舊方法。
3. 「這條規則是為了達成目標,還是因為怕麻煩?」
這句最重要。黑橋牌的目標是「提早下班」。規則是為了提早下班,還是為了讓排班員工少算一點?答案通常很清楚。
但這題沒有標準答案
講清楚一件容易被講成毒藥的事:分辨出來之後,不代表一定要拿掉。
黑橋牌最後的討論,卡在這裡:
如果放開限制,讓 AI 排出「一天換三十次、五十次機台」的排程,數學上確實更優,工時可能真的更短。
但現場的人會疲於奔命。搬貨、換線、清潔、每一次搬運都有出錯的機率。最後可能提早兩分鐘下班,卻多出三起搬運傷害。
那個兩分鐘的數字,是用現場人員的體能和風險換的。弊大於利。
所以正確的動作不是「把慣例全部刪掉」,而是把這條規則從「技術限制」降級回「一個要被權衡的營運決定」,然後由管理者主持那場討論。
這四個問題,沒有演算法能幫你回答:
- 公司能不能接受更頻繁的換進換出?
- 能不能靠教育訓練,把人員操作上的困難解掉?
- 要不要加人,換更精細的排程?
- 公司有沒有導入自動化的長期規劃?有的話,這條規則三年後本來就會消失,還有必要現在討論嗎?
這就是「AI 思維」最實在的一塊:不是在鍵盤前想,是在會議室裡想。
三、導入前,主管必須先講清楚的四件事
如果今天只能帶走一件事,帶走這個框架。導入任何 AI 之前,主管和技術團隊必須把這四個欄位填完,缺一個都不要開工。
| 項目 | 白話 | 黑橋牌的例子 |
| 參數(系統輸入) | 我要給它什麼資料 | 幾台機台、每張訂單要走哪幾道工序、每道工序多久、每張單的 deadline |
| 決策變數(系統輸出) | 它要告訴我什麼 | 每一個工作在幾點幾分進哪台機台、做哪個步驟 → 一張甘特圖 |
| 目標式(期望結果) | 怎麼算「比較好」 | 延遲訂單數最少 → 其次是總製造時間最短 |
| 限制式(可執行條件) | 什麼情況下不能做 | 機台 1 只能煮(限制)/ 訂單最多換一次(慣例,待權衡) |
「目標式」是全場最常被搞砸的那一欄
黑橋牌一開始的目標是:「盡量不要延遲」、「盡量讓員工早點下班」。
主管聽了覺得很合理,技術團隊也無從反駁。但「盡量」這兩個字,等於沒有目標。
AI 可以排出十套方案,技術團隊交給主管,主管說哪個比較好?「都還好」、「第二個感覺可以」——這時候你不是在管理一個 AI,你是在賭。
改寫成可判斷的版本:
- 第一優先:延遲的訂單張數最少。 這裡有個關鍵細節:一張單延遲 100 分鐘,跟延遲 1 分鐘,都算「延遲一張」。這個定義一改,AI 的排法會整個不一樣。
- 第二優先:總製造時間(Makespan)最短。 所有工作都做完的時間愈早愈好 → 才能關燈、清潔、準時下班。
「目標式」這一欄的品質,直接決定 AI 的品質。目標寫得含糊,AI 一定會給你一個含糊的答案。
「限制式」是主管的專屬工作
前三欄技術團隊可以自己問出來,「目標式」要業務端一起談。
但「限制式」只有主管能決定,因為它要回答的是「公司願意拿什麼去換什麼」。
把「訂單最多換一次」寫成硬限制,是把一個營運決定偽裝成技術限制。偽裝的好處是責任轉移——排程不好怪系統,因為「限制是你們自己寫的」。
這是導入失敗最被低估的一種原因:不是能力不足,是權責轉移。
四、預測型 AI:主管要問的兩個尖銳問題
講完最佳化,講另一種。預測型(判斷「會不會發生某事」)有完全不同的兩個坑,而且這兩個坑,主管問一句話就能擋下來。
坑一:用未來資料預測過去
案例是線上教育平台。兩年累積 6,000 名新訂戶,退訂 4,200 名。目標:預先知道哪些會員下個月會不會退訂,然後打電話關懷。
技術團隊交出一個模型,預測誤差很低。主管很高興。
問題在於:他們用了不該用的資料。
正確做法是——要在 3/1 預測未來一個月,特徵就只能用 2/1 之前的行為(1 月的答題數、正確率、停留時間)。
常見錯誤是順手把 2/1 到 3/1 之間的行為也放進特徵。理由很直覺:「這些都是這個會員的資料啊,多給一點模型準一點。」
但模型在 3/1 做判斷的時候,物理上不可能知道這些會員在 2/8 有沒有答題。 你在訓練時教它偷看答案,測試時它表現得神準,實際上線立刻崩掉。
主管要問的:「你們用的是哪一段時間的資料?特徵包含哪些欄位?這些資料的收錄期間是?『結果』是怎麼定義的?」
你不需要懂神經網路。但確認他們沒有用不該用的資料,是完全合理、也完全做得到的事。
坑二:拿訓練成績當真實成績
正確做法是切分:4 萬筆資料,隨機抽 20%(8,000 筆)當測試集,這 8,000 筆絕對不能給技術人員拿去訓練。剩下 32,000 筆訓練,模型完成後才用留著的 8,000 筆驗。
沒切分會發生什麼?模型等於是「背答案」。它記住的是訓練資料本身,不是「從行為預測退訂」的規律。
主管要問的:「你們有切分訓練和測試資料嗎?比例多少?你們報告的誤差率是『訓練誤差』還是『測試誤差』?」
只有測試誤差能代表上線後的表現。訓練誤差只代表模型記得自己看過的東西。
這兩句話,建議直接存起來。下次技術團隊來報告,念出來。
五、真正的主管任務:定義「錯了有多貴」
這是整篇文章最反直覺、也最值錢的一段。
模型測試誤差很低,業務端開心,主管開心,專案看起來要成功了。
然後呢?預測錯了怎麼辦?
線上教育平台的預測結果,會分成四種情況:
| 實際退訂 | 實際續訂 | |
| 預測會退訂 | 對 | 錯(打錯電話關懷) |
| 預測會續訂 | 錯(沒人管,人跑了) | 對 |
技術人員的預設目標:把猜錯次數降到最少。
這是專業直覺,但對業務是錯的。 因為這兩種錯,成本差非常多。
- 誤判高風險(其實會續訂):一通關懷電話的電話費、員工工時。成本小。
- 漏掉高風險(其實要退訂):這個會員原本會付的月費 × 剩餘生命週期。成本大很多。
- 還有一個隱藏風險:少數情況下,關懷電話反而提醒了會員「我是不是忘了續訂」。機率低,但單次不便宜。
所以正確的目標不是「猜對最多」,是「把預期損失壓到最低」。
具體做法是:主管要給出一個成本權重。 漏掉一個高風險會員,等於損失多少錢?誤打一通電話,等於損失多少錢?把這兩個數字給技術團隊,讓他們去最小化加權損失。
這一步很難,因為成本預估本來就模糊。但不做這一步,技術團隊永遠只會用「準確率」當目標——而準確率在這個情境裡幾乎沒有業務意義。
這是主管無法外包的工作。技術團隊不會替你猜你的會員值多少錢,因為那不是他們的專業。
放兩個更好懂的對照:
- 工廠把良品判成不良品 → 浪費材料、誤報廢
- 工廠把不良品判成良品 → 瑕疵品流到客戶手上
技術人員眼中,這兩個錯誤的「錯誤次數」一樣是 1。但公司損失差一個數量級。
海關也是一樣:錯殺(冤枉好人)和錯放(違禁品通關),誰比較該重罰?
六、最容易被講成毒藥的一句話
有些主管在聽完前面這些之後會說:
「所以數位轉型還要改流程?我們先導入看看效果,流程以後再說。」
講這句話的人,AI 導入成功率會低到可憐。
原因很直接:AI 的能力邊界會改變流程的經濟性。 人算不動的東西現在算得動了,那條「為了讓人算得起來」的規則就沒有存在理由了。你不改流程,就等於把 AI 塞進一個人工時代的框架裡,然後抱怨它效果不好。
不肯改流程的數位轉型,實際上只是花錢買了一套新工具。
這句話聽起來像管理 jargon,但你可以這樣檢驗:你導入 AI 之後,有沒有任何一個流程因為「AI 算得動」而變得不一樣? 如果答案是「沒有,就是把人工做的步驟自動化」,那你買的是電腦,不是 AI。
七、可直接使用的導入前檢查清單
這張表可以印出來,貼在會議室。下次要跟技術團隊開導入會議,照著問。
A. 目標與輸入(業務端 + 技術端一起填)
- ☐ 目標式:怎麼算「比較好」?用哪個數字衡量?(「盡量」不算答案)
- ☐ 第一優先目標:是哪一個?排序為什麼這樣排?
- ☐ 參數:我會給系統什麼資料?每個欄位的定義寫下來了嗎?
- ☐ 決策變數:系統要輸出什麼?輸出長什麼樣?
B. 限制式體檢(主管主持,這是重點)
逐條列出所有規則,標記 L 或 I:
| 規則 | L 限制 / I 慣例 | 判定理由 | 若放開會怎樣 |
| 機台 1 只能煮 | L | 硬體功能 | 無(不可能) |
| 一張單最多換一次 | I? | 人算不動 | 需權衡現場負荷 |
- ☐ 每條規則都標了 L 或 I
- ☐ 所有 I 都問過:「為什麼當初這樣訂?」
- ☐ 所有 I 都被獨立討論過「要不要保留」,不是自動沿用
- ☐ 討論結論有記錄在案(這一條最重要,日後甩鍋就靠它)
C. 預測型專屬
- ☐ 特徵和結果的時間點切清楚了?
- ☐ 有沒有用到「預測當下不可能知道」的資料?
- ☐ 訓練 / 測試有切分嗎?比例?
- ☐ 報告的是測試誤差嗎?
- ☐ 兩類錯誤的成本權重定出來了嗎?(誤打電話的成本 vs 漏掉高風險會員的成本)
D. 流程改造盤點
- ☐ 導入後,哪個流程因為「AI 算得動」而可以不一樣?
- ☐ 要配套什麼?(教育訓練、增加人力、自動化設備)
- ☐ 主管決定:要改造哪些、保留哪些,並公告
結語:主管真正的產品是「決策環境」
回到開場那個黑橋牌的排班員工。
他不是不懂 AI,他也沒有反對。他只是在他三十年的專業裡,給出了一個非常誠實的回答:這條規則,是因為我們算不動才訂的。
這個回答,是整個專案最貴的資產。 因為它誠實地告訴你,AI 的機會在哪裡。
而他之所以願意說這句話,是因為有人問了對的問題——不是「你們的限制是什麼」(得到一堆混在一起的規則),而是「這條規則是為了讓人算得起來嗎」(得到一個真正的洞察)。
主管導入 AI,最終交付的不是一套系統,是一個讓技術和業務願意把真話說出來的決策環境。
說得直白一點:
技術團隊的工作是建模。主管的工作,是讓他們能把真話說出來。
業務單位的工作是提需求。主管的工作,是讓他們知道該提哪一個需求。
沒有主管,這兩邊永遠不會自己對上。
這是一門不需要寫程式、但決定導入成不成的技術。
探索更多來自 大衛的觀察日記 的內容
訂閱即可透過電子郵件收到最新文章。
