飛機與鐵路的預測性維修:AI 怎麼在零件壞掉之前就知道

飛機與鐵路的預測性維修:AI 怎麼在零件壞掉之前就知道

最新機型產生的資料量是上一世代的 50 倍,勞斯萊斯用數位孿生預測引擎何時該進廠,EASA 從 2020 年就開始寫 AI 路線圖。這篇拆解航空與軌道的預測性維修怎麼運作、為什麼「異常偵測要先於壽命預測」,以及開發者最常踩的右設限資料與工單標籤兩個大坑。

凌晨一點四十分,桃園機場旁的機棚裡沒人想聽到「拆下來看看」

凌晨一點四十分,桃園機場南邊的一座機棚亮著燈。一架隔天早上要飛的窄體客機停在裡面,工程師盯著螢幕上一條抖動的振動曲線——數值還在容許範圍內,但趨勢跟三週前不太一樣。

接下來的決定很現實:要不要現在拆開看?拆了,這架飛機明天早上飛不了,航班要調度、旅客要安撫,成本六位數起跳。不拆,萬一真的出事,代價完全不在同一個量級。

這就是預測性維修真正要解的問題。它不是「AI 幫你看儀表板」,而是「在資訊不足的情況下,把一個賭注變成一個有信心區間的決策」。飛機如此,高鐵的轉向架如此,晶圓廠的機台也是如此。

事件背景

維修這件事,工程上大致分三種做法。

第一種是壞了再修(reactive),成本最低但風險最高,只適用於壞掉不會出人命的東西。第二種是定期預防(time-based),航空業行之有年的 A check、C check,鐵路的定期檢修週期,都屬於這一類——用飛行小時、起降次數或行駛公里數當觸發條件。第三種是狀態基礎維修(condition-based)與預測性維修(predictive),也就是靠感測資料判斷「這個零件現在的健康狀況如何、大概還能撐多久」。

第二種做法安全,但浪費得驚人。定期換件的邏輯是「假設所有零件都用得一樣兇」,實際上同一款軸承裝在不同路線、不同氣候、不同駕駛習慣的車輛上,壽命可以差好幾倍。換太早,等於把還能用的零件丟掉;換太晚,就是那個沒人想遇到的場景。

推動這一波改變的,是資料量。漢莎技術(Lufthansa Technik)的 AVIATAR 平台在官方說明中提到,「最新的機型所產生的資料量,是上一世代的 50 倍」;平台本身則定位為「支援客戶即時管理複雜機隊,並預測單一零件的失效機率」。這句話值得咀嚼——重點不是機隊儀表板,而是「single component」的失效機率。

引擎端也一樣。勞斯萊斯(Rolls-Royce)在說明數位孿生(Digital Twin)時寫得很白:這個孿生體「會在虛擬世界中以實體引擎掛在機翼上運轉的方式運作,判斷引擎的運作狀態,並預測它何時可能需要維修」,這是該公司 IntelligentEngine 願景的一環。

法規端則比多數人以為的更早動起來。歐洲航空安全總署(EASA)在 2020 年 2 月 7 日發布 AI Roadmap 1.0,2023 年 5 月 10 日發布 2.0,並於 2024 年 3 月 6 日發布 AI Concept Paper Issue 2,提供 Level 1 與 Level 2 機器學習應用的指引;EASA 也執行了 MLEAP(Machine Learning Application Approval)研究專案,處理機器學習系統該怎麼被審驗核准的問題。EASA 自己說明這份路線圖是「living document」,每年會更新一次,核心主張則是「a human-centric approach to AI in aviation」。

台灣不是這條供應鏈的旁觀者。長榮航太科技(EGAT)1998 年由長榮航空與奇異(GE)合資成立,基地在桃園國際機場,官網載明持有 FAA、EASA 與日本 JCAB 的 Part-145 維修廠認證,並服務超過 40 家航空公司。維修這門生意,台灣是有實績的。

本次重點

  • 訊號來源比模型重要:航空端有 ACARS 傳輸的引擎狀態訊息、QAR 飛行資料;工業與軌道端則多半靠加裝的振動與溫度感測器。Augury 走的就是「自有無線感測器+機器學習」的路線,TRACTIAN 也是把 IoT 振動與溫度感測跟 AI 異常偵測綁在一起賣。
  • 先做異常偵測,壽命預測擺後面:先做得出「這台跟它自己上個月不一樣」,再談剩餘使用壽命(RUL)。多數失敗的專案都是順序顛倒。
  • 預測完還要能排進工單:預警沒有接到維修排程、零件庫存與人力調度,價值等於零。C3 AI 這類企業級平台強調的預建應用,重點也在後半段的排程與庫存最佳化。
  • 影像巡檢正在普及:軌道幾何、架空線、機身表面損傷,用相機加模型掃過一遍,比人爬上去看快得多,也安全得多。
  • 法規不允許你直接改維修間隔:模型說可以延後換件,不代表你能延後。維修方案的變更要走適航當局的程序,這是航空與軌道跟一般製造業最大的差別。

市場影響分析

台灣使用者

你感受得到的是準點率與臨時取消。預測性維修做得好的機隊,會把「本來要在外站臨時處理」的問題,提前挪到夜間基地維修的時段完成——旅客端看到的就是少一次「因機械故障延誤」。

但也別過度期待。維修預警只能處理「有徵兆的漸進式劣化」,對突發外物損傷、鳥擊、天候這類事件無能為力。誤點的成因裡,機械問題往往不是最大宗。

企業應用

這裡有一個台灣製造業常忽略的重點:航空和軌道的預測性維修方法論,跟工廠設備幾乎是同一套。馬達、泵浦、壓縮機、風機、主軸——振動頻譜、溫升趨勢、電流特徵,換個場域邏輯不變。

我的建議是反著做。先別急著買模型,先花三個月把三件事弄好:一,維修工單數位化,而且要記錄「換了什麼、為什麼換、當時症狀」;二,感測器裝在真的會壞、壞了會痛的設備上,不是裝最多;三,先定義清楚一次非計畫停機的實際成本是多少。這個數字算不出來,後面的投資報酬率都是憑感覺。

開發者

這是一個很不 Kaggle 的問題,講幾個實務上的坑。

資料極度不平衡而且被截斷(censored)——多數設備到觀測期結束都還沒壞,這在統計上叫右設限資料,直接丟進二元分類器會得到一個看起來很準、實際沒用的模型。生存分析、韋伯分布這些老工具在這裡反而比深度學習好用。

標籤來自維修工單,而工單是人寫的:同一個故障有五種寫法,時間戳記可能是登記時間而不是發生時間。特徵工程也吃領域知識,振動訊號要做 FFT、包絡解調,找的是特定頻率的邊帶,不是把原始波形丟進網路就好。

評估指標更要小心。準確率毫無意義,要看的是 PR-AUC、平均提前預警時間,以及誤報一次要付出多少代價——在航空業,一次不必要的拆檢成本可能高過模型一年省下的錢。最後是部署:現場網路差、算力有限,模型多半得跑在邊緣,還要能解釋為什麼發警報,因為稽核會問。想練 prompt 與資料整理的基本功,可以先翻翻站上的 提示詞庫任務庫

未來發展趨勢

未來三年,我看好三個方向。

一是時間序列與振動訊號的基礎模型。目前多數方案還是一台設備訓一個模型,跨設備遷移能力很差;如果預訓練模型能讓新設備冷啟動所需的資料量下降一個數量級,導入門檻會整個改變。

二是法規逐步鬆綁。EASA 已經把 Level 1 與 Level 2 的機器學習應用寫進指引,路線圖每年更新;當「AI 輔助的維修決策」有明確的審驗路徑,MRO 業者才敢真的把它寫進維修方案。

三是台灣的機會在中間層。我們有 MRO 實績、有半導體設備的稼動率壓力、也有做感測器與工控的供應鏈。真正稀缺的不是模型,是「懂設備又懂資料」的人——這種人現在台灣不夠,薪水也還沒反映稀缺程度。

TheAI學院 總結與評語

我自己看預測性維修的專案,判斷成敗只問一句話:這個預警發出來以後,誰會做什麼事?答不出來的,做再準也是白做。

這個領域最迷人的地方在於,它逼你面對機器學習裡最不浪漫的部分——資料很髒、正樣本很少、模型要能解釋、錯了要負責。它不會有 demo day 上的驚呼,但它會直接反映在飛機能不能準時起飛、列車會不會在隧道裡停下來。

預測性維修的價值不在預測,在於它讓維修從「賭」變成「算」。

給台灣讀者的具體建議:如果你是工程師,把生存分析、訊號處理跟工單資料清理補起來,這三樣的市場價值遠高於再多刷一個 LLM 應用。如果你是製造業主管,這個月就去確認一件事——你的維修工單裡,有沒有記錄「症狀」。沒有的話,任何預測性維修的採購都言之過早。

資料來源

常見問題

預測性維修跟定期保養差在哪?

定期保養以飛行小時、起降次數或行駛公里數當觸發條件,假設所有零件用得一樣兇;預測性維修則依感測資料判斷個別設備當下的健康狀態。同款零件裝在不同路線與環境下,壽命可能差好幾倍,這正是定期保養浪費(或風險)的來源。

模型說可以延後換件,就可以延後嗎?

不行。航空與軌道的維修方案變更必須依循適航或主管機關的程序,模型輸出只能作為決策輸入。這是這兩個產業跟一般製造業最大的差別,也是導入時最常被低估的時程成本。

EASA 對航空 AI 的規範走到哪一步了?

EASA 於 2020 年 2 月 7 日發布 AI Roadmap 1.0、2023 年 5 月 10 日發布 2.0,並在 2024 年 3 月 6 日發布 AI Concept Paper Issue 2,提供 Level 1 與 Level 2 機器學習應用的指引,另有 MLEAP 研究專案處理機器學習系統的審驗核准。EASA 表示路線圖是逐年更新的 living document。

開發預測性維修模型最常見的錯誤是什麼?

最常見的是忽略右設限資料:多數設備到觀測期結束都還沒故障,直接做二元分類會得到看似很準、實際無用的模型。另一個是把準確率當指標——應該看 PR-AUC、平均提前預警時間,以及每一次誤報的實際成本。

中小型製造業要導入,第一步該做什麼?

先把維修工單數位化,而且要記錄「換了什麼、為什麼換、當時症狀」;接著只在真的會壞、壞了會痛的設備上裝感測器;最後把一次非計畫停機的實際成本算出來。這三件事沒做,任何模型採購都難以評估報酬率。