AI 導入失敗,是因為主管把「習慣」寫成了「規則」

五台煙燻機,一個老師傅,每天早上 7 點半靠一張紙和一支筆把隔天的生產順序排出來。

這不是一個 AI 導入的失敗故事。這是一個 AI 導入技術上成功了,卻被主管親手關掉的真實案例。

黑橋牌,香腸火腿的製造商。煙燻站是整條產線裡最複雜的一關,旺季一天幾十張訂單,旺季淡季差三倍。他們想導入演算法排程,目標講得很清楚:讓員工早點下班。

技術人員跑演算法,跑出來的結果是——排程更好了,理論上能提早 20 分鐘完成。

然後有人問了一句:「這張訂單怎麼換了七次機台?」

資深排班員工回:「不行啊,訂單最多只能換一次。」

於是「最多換一次」被寫進了限制條件。AI 從此只能在這條線裡面算。

這個專案,技術上成功導入了,組織上失敗了。

而失敗的原因,聽起來一点都不像 AI 問題。

一、導入 AI 失敗,最常見的死法不是你想的那個

先講清楚這件事為什麼嚴重。

導入 AI 失敗,大家習慣講三個原因:資料不夠、預算不夠、人才不夠。這三個都是真的,但它們都不是最常見的死因。

最常見的死因是:你在告訴 AI 它能做到什麼程度的時候,順便把它以前做不到的事也算進去了。

主管跟技術團隊開會,通常是這樣問的:

「你們排程排得準嗎?」
「準。」
「那流程上還有哪些限制?」

主管在這裡問「限制」,是想要拿到一個清楚的邊界,讓團隊知道什麼不能碰。技術團隊聽到「限制」兩個字,馬上就會列出他們在現場觀察到的所有規則。

這一步沒錯。錯在清單裡面混了兩種東西。

一種是「這台機器就是只能煮,不能烘也不能煙」。這叫限制。

另一種是「一張訂單最好只換一次機台,不然現場會亂」。這叫慣例。

主管在會議室裡說不出這兩者的差別。於是兩種都進了限制條件表。技術團隊照著做,做出來一套符合「限制表」、但完全達不到「早點下班」的系統。

AI 沒有做錯任何事。它只是非常認真地,在一個被縮小的籠子裡,做到最優。

二、怎麼分辨「限制」和「慣例」

這是整篇文章最實用的一段。你可以照著問。

判準:它是不是因為「人算不動」才出現的?

  • 限制:來自物理世界或硬體本身,改不掉。機台功能、產線長度、法規、工時上限、清潔需要幾小時。
  • 慣例:來自某個時代的算力上限。人腦算不動,所以退一步,訂一條比較好算的規則。

黑橋牌那條「最多換一次」,是哪一種?

排班員工自己講得很清楚:要算一張訂單多次進出機台的排程,非常麻煩。所以他們訂了一條經驗法則,大部分時候不用做複雜調度就能把活幹完。

那條規則的目的不是「讓排程更好」,是「讓人算得起來」。

用現代 AI 去執行一條為了讓人算得起來而生的規則,這是拿拖拉機去跑一條給馬設的路。

三個追問,現場就問得出來

問技術團隊或現場主管這三句,答案會自己浮出來:

1. 「這條規則,是機器或法規強制的,還是人訂的?」
答「人訂的」,繼續問第二句。

2. 「如果不遵守,會發生什麼?是會壞掉,還是會很麻煩?」
「會壞掉」和「會很麻煩」是兩個等級的東西。「會壞掉」是限制,「很麻煩」常常只是沿用了舊方法。

3. 「這條規則是為了達成目標,還是因為怕麻煩?」
這句最重要。黑橋牌的目標是「提早下班」。規則是為了提早下班,還是為了讓排班員工少算一點?答案通常很清楚。

但這題沒有標準答案

講清楚一件容易被講成毒藥的事:分辨出來之後,不代表一定要拿掉。

黑橋牌最後的討論,卡在這裡:

如果放開限制,讓 AI 排出「一天換三十次、五十次機台」的排程,數學上確實更優,工時可能真的更短。

但現場的人會疲於奔命。搬貨、換線、清潔、每一次搬運都有出錯的機率。最後可能提早兩分鐘下班,卻多出三起搬運傷害。

那個兩分鐘的數字,是用現場人員的體能和風險換的。弊大於利。

所以正確的動作不是「把慣例全部刪掉」,而是把這條規則從「技術限制」降級回「一個要被權衡的營運決定」,然後由管理者主持那場討論。

這四個問題,沒有演算法能幫你回答:

  • 公司能不能接受更頻繁的換進換出?
  • 能不能靠教育訓練,把人員操作上的困難解掉?
  • 要不要加人,換更精細的排程?
  • 公司有沒有導入自動化的長期規劃?有的話,這條規則三年後本來就會消失,還有必要現在討論嗎?

這就是「AI 思維」最實在的一塊:不是在鍵盤前想,是在會議室裡想。

三、導入前,主管必須先講清楚的四件事

如果今天只能帶走一件事,帶走這個框架。導入任何 AI 之前,主管和技術團隊必須把這四個欄位填完,缺一個都不要開工。

項目白話黑橋牌的例子
參數(系統輸入)我要給它什麼資料幾台機台、每張訂單要走哪幾道工序、每道工序多久、每張單的 deadline
決策變數(系統輸出)它要告訴我什麼每一個工作在幾點幾分進哪台機台、做哪個步驟 → 一張甘特圖
目標式(期望結果)怎麼算「比較好」延遲訂單數最少 → 其次是總製造時間最短
限制式(可執行條件)什麼情況下不能做機台 1 只能煮(限制)/ 訂單最多換一次(慣例,待權衡)

「目標式」是全場最常被搞砸的那一欄

黑橋牌一開始的目標是:「盡量不要延遲」、「盡量讓員工早點下班」。

主管聽了覺得很合理,技術團隊也無從反駁。但「盡量」這兩個字,等於沒有目標。

AI 可以排出十套方案,技術團隊交給主管,主管說哪個比較好?「都還好」、「第二個感覺可以」——這時候你不是在管理一個 AI,你是在賭。

改寫成可判斷的版本:

  • 第一優先:延遲的訂單張數最少。 這裡有個關鍵細節:一張單延遲 100 分鐘,跟延遲 1 分鐘,都算「延遲一張」。這個定義一改,AI 的排法會整個不一樣。
  • 第二優先:總製造時間(Makespan)最短。 所有工作都做完的時間愈早愈好 → 才能關燈、清潔、準時下班。

「目標式」這一欄的品質,直接決定 AI 的品質。目標寫得含糊,AI 一定會給你一個含糊的答案。

「限制式」是主管的專屬工作

前三欄技術團隊可以自己問出來,「目標式」要業務端一起談。

但「限制式」只有主管能決定,因為它要回答的是「公司願意拿什麼去換什麼」。

把「訂單最多換一次」寫成硬限制,是把一個營運決定偽裝成技術限制。偽裝的好處是責任轉移——排程不好怪系統,因為「限制是你們自己寫的」。

這是導入失敗最被低估的一種原因:不是能力不足,是權責轉移。

四、預測型 AI:主管要問的兩個尖銳問題

講完最佳化,講另一種。預測型(判斷「會不會發生某事」)有完全不同的兩個坑,而且這兩個坑,主管問一句話就能擋下來。

坑一:用未來資料預測過去

案例是線上教育平台。兩年累積 6,000 名新訂戶,退訂 4,200 名。目標:預先知道哪些會員下個月會不會退訂,然後打電話關懷。

技術團隊交出一個模型,預測誤差很低。主管很高興。

問題在於:他們用了不該用的資料。

正確做法是——要在 3/1 預測未來一個月,特徵就只能用 2/1 之前的行為(1 月的答題數、正確率、停留時間)。

常見錯誤是順手把 2/1 到 3/1 之間的行為也放進特徵。理由很直覺:「這些都是這個會員的資料啊,多給一點模型準一點。」

但模型在 3/1 做判斷的時候,物理上不可能知道這些會員在 2/8 有沒有答題。 你在訓練時教它偷看答案,測試時它表現得神準,實際上線立刻崩掉。

主管要問的:「你們用的是哪一段時間的資料?特徵包含哪些欄位?這些資料的收錄期間是?『結果』是怎麼定義的?」

你不需要懂神經網路。但確認他們沒有用不該用的資料,是完全合理、也完全做得到的事。

坑二:拿訓練成績當真實成績

正確做法是切分:4 萬筆資料,隨機抽 20%(8,000 筆)當測試集,這 8,000 筆絕對不能給技術人員拿去訓練。剩下 32,000 筆訓練,模型完成後才用留著的 8,000 筆驗。

沒切分會發生什麼?模型等於是「背答案」。它記住的是訓練資料本身,不是「從行為預測退訂」的規律。

主管要問的:「你們有切分訓練和測試資料嗎?比例多少?你們報告的誤差率是『訓練誤差』還是『測試誤差』?」

只有測試誤差能代表上線後的表現。訓練誤差只代表模型記得自己看過的東西。

這兩句話,建議直接存起來。下次技術團隊來報告,念出來。

五、真正的主管任務:定義「錯了有多貴」

這是整篇文章最反直覺、也最值錢的一段。

模型測試誤差很低,業務端開心,主管開心,專案看起來要成功了。

然後呢?預測錯了怎麼辦?

線上教育平台的預測結果,會分成四種情況:

實際退訂實際續訂
預測會退訂對錯(打錯電話關懷)
預測會續訂錯(沒人管,人跑了)對

技術人員的預設目標:把猜錯次數降到最少。

這是專業直覺,但對業務是錯的。 因為這兩種錯,成本差非常多。

  • 誤判高風險(其實會續訂):一通關懷電話的電話費、員工工時。成本小。
  • 漏掉高風險(其實要退訂):這個會員原本會付的月費 × 剩餘生命週期。成本大很多。
  • 還有一個隱藏風險:少數情況下,關懷電話反而提醒了會員「我是不是忘了續訂」。機率低,但單次不便宜。

所以正確的目標不是「猜對最多」,是「把預期損失壓到最低」。

具體做法是:主管要給出一個成本權重。 漏掉一個高風險會員,等於損失多少錢?誤打一通電話,等於損失多少錢?把這兩個數字給技術團隊,讓他們去最小化加權損失。

這一步很難,因為成本預估本來就模糊。但不做這一步,技術團隊永遠只會用「準確率」當目標——而準確率在這個情境裡幾乎沒有業務意義。

這是主管無法外包的工作。技術團隊不會替你猜你的會員值多少錢,因為那不是他們的專業。

放兩個更好懂的對照:

  • 工廠把良品判成不良品 → 浪費材料、誤報廢
  • 工廠把不良品判成良品 → 瑕疵品流到客戶手上

技術人員眼中,這兩個錯誤的「錯誤次數」一樣是 1。但公司損失差一個數量級。

海關也是一樣:錯殺(冤枉好人)和錯放(違禁品通關),誰比較該重罰?

六、最容易被講成毒藥的一句話

有些主管在聽完前面這些之後會說:

「所以數位轉型還要改流程?我們先導入看看效果,流程以後再說。」

講這句話的人,AI 導入成功率會低到可憐。

原因很直接:AI 的能力邊界會改變流程的經濟性。 人算不動的東西現在算得動了,那條「為了讓人算得起來」的規則就沒有存在理由了。你不改流程,就等於把 AI 塞進一個人工時代的框架裡,然後抱怨它效果不好。

不肯改流程的數位轉型,實際上只是花錢買了一套新工具。

這句話聽起來像管理 jargon,但你可以這樣檢驗:你導入 AI 之後,有沒有任何一個流程因為「AI 算得動」而變得不一樣? 如果答案是「沒有,就是把人工做的步驟自動化」,那你買的是電腦,不是 AI。

七、可直接使用的導入前檢查清單

這張表可以印出來,貼在會議室。下次要跟技術團隊開導入會議,照著問。

A. 目標與輸入(業務端 + 技術端一起填)

  • ☐ 目標式:怎麼算「比較好」?用哪個數字衡量?(「盡量」不算答案)
  • ☐ 第一優先目標:是哪一個?排序為什麼這樣排?
  • ☐ 參數:我會給系統什麼資料?每個欄位的定義寫下來了嗎?
  • ☐ 決策變數:系統要輸出什麼?輸出長什麼樣?

B. 限制式體檢(主管主持,這是重點)

逐條列出所有規則,標記 L 或 I:

規則L 限制 / I 慣例判定理由若放開會怎樣
機台 1 只能煮L硬體功能無(不可能)
一張單最多換一次I?人算不動需權衡現場負荷
  • ☐ 每條規則都標了 L 或 I
  • ☐ 所有 I 都問過:「為什麼當初這樣訂?」
  • ☐ 所有 I 都被獨立討論過「要不要保留」,不是自動沿用
  • ☐ 討論結論有記錄在案(這一條最重要,日後甩鍋就靠它)

C. 預測型專屬

  • ☐ 特徵和結果的時間點切清楚了?
  • ☐ 有沒有用到「預測當下不可能知道」的資料?
  • ☐ 訓練 / 測試有切分嗎?比例?
  • ☐ 報告的是測試誤差嗎?
  • ☐ 兩類錯誤的成本權重定出來了嗎?(誤打電話的成本 vs 漏掉高風險會員的成本)

D. 流程改造盤點

  • ☐ 導入後,哪個流程因為「AI 算得動」而可以不一樣?
  • ☐ 要配套什麼?(教育訓練、增加人力、自動化設備)
  • ☐ 主管決定:要改造哪些、保留哪些,並公告

結語:主管真正的產品是「決策環境」

回到開場那個黑橋牌的排班員工。

他不是不懂 AI,他也沒有反對。他只是在他三十年的專業裡,給出了一個非常誠實的回答:這條規則,是因為我們算不動才訂的。

這個回答,是整個專案最貴的資產。 因為它誠實地告訴你,AI 的機會在哪裡。

而他之所以願意說這句話,是因為有人問了對的問題——不是「你們的限制是什麼」(得到一堆混在一起的規則),而是「這條規則是為了讓人算得起來嗎」(得到一個真正的洞察)。

主管導入 AI,最終交付的不是一套系統,是一個讓技術和業務願意把真話說出來的決策環境。

說得直白一點:

技術團隊的工作是建模。主管的工作,是讓他們能把真話說出來。
業務單位的工作是提需求。主管的工作,是讓他們知道該提哪一個需求。
沒有主管,這兩邊永遠不會自己對上。

這是一門不需要寫程式、但決定導入成不成的技術。


探索更多來自 大衛的觀察日記 的內容

訂閱即可透過電子郵件收到最新文章。

發表迴響