聲音能不能當生命徵象?語音生物標記的現況、限制,還有台灣最大的那道語言牆

聲音能不能當生命徵象?語音生物標記的現況、限制,還有台灣最大的那道語言牆

用幾秒鐘的說話聲看出情緒、認知甚至肺功能的變化——這件事今年已經有可上線的產品。但在台灣,它們全部先撞到同一道牆:中文,還有台語。

聲音能不能當生命徵象?語音生物標記的現況、限制,還有台灣最大的那道語言牆

一位長照機構的個案管理師每週要打幾十通電話關懷獨居長輩。她跟我說,電話裡最難判斷的不是有沒有生病,而是「今天聽起來怪怪的」那種感覺——她知道那個感覺往往是對的,但寫在紀錄上只能寫「精神狀況尚可」。

語音生物標記想做的,就是把那種說不出口的感覺變成一個可以記錄、可以比較的數字。

現在的產品分成兩條路

先把最重要的分類講清楚,因為它決定了隱私難度與適用場景。

被動聆聽路線。 Canary Speech 的 Canary Ambient 自稱是業界第一個環境聆聽式的語音生物標記工具——不必請使用者唸特定句子做測驗,而是在日常對話(客服電話、遠距門診)中被動分析,輸出與情緒和認知狀態相關的決策支援訊號。它走 API 優先,客群涵蓋醫院、臨床電話中心、客服中心、保險支付方與臨床試驗單位。

主動量測路線。 Sonde Health 的做法相反——請使用者對著手機發聲幾秒,換取一組可重複比較的分數,涵蓋 Mental Fitness、Cognitive Fitness、壓力與呼吸健康四類指標,用數百萬筆有醫學標註的語音樣本訓練。

這個差別的實務意義比技術差異大得多。被動聆聽的長期追蹤可行性高(使用者零負擔),但隱私與告知同意的難度陡升;主動量測的隱私爭議小很多(使用者知道自己正在被量),代價是需要使用者配合。台灣要導入,這一題會決定你的專案是三個月上線還是卡在法遵一整年。

另外兩種更專門的切法

追蹤神經退化。 Aural Analytics 走的是臨床級路線,把發音與語言運動功能量化成可重複的神經指標,技術基礎是約二十五年的 NSF 與 NIH 資助研究,官方標示支援八種語言、部署橫跨四大洲,主戰場是 ALS、帕金森氏症、多發性硬化症這類需要長期追蹤細微變化的疾病。它真正的價值在頻率——傳統語言功能評估要到院、要語言治療師操作,一年做兩三次;改成在家錄音幾分鐘,追蹤密度可以提高一個數量級,而藥物療效的變化往往就藏在那些一年兩次量不到的斜率裡。

篩檢呼吸道疾病。 VoiceMed 是義大利羅馬的團隊,產品 Airlyn 分析語音與呼吸的聲學特徵,分成 Check for COPD(早期篩檢)與 Predict for COPD(確診後監測與急性發作風險預測)兩段。COPD 這個病特別適合這種做法——早期幾乎無感、很多人是進急診才確診,而確診後最貴的成本是反覆住院。手機可測、可以每天測,對它的意義特別大。

順帶一提,同類的「非接觸量測」還有另一條路:NuraLogix 用一般攝影機捕捉臉部血流變化,三十秒推估生理指標,其中脈搏率與呼吸率已取得 FDA 許可。原理不同,但要面對的行銷誠信問題一模一樣。

它們能做什麼、不能做什麼

能做的:提供趨勢訊號、標示出「值得進一步評估」的對象、以低負擔的方式高頻追蹤同一個人的變化。

不能做的:診斷。所有這些產品的官方定位都是決策支援或健康資訊,而不是診斷工具。這條線不是法規上的技術性區分,它反映的是真實的能力邊界——聲音的變化可以來自感冒、宿醉、熬夜、剛跑完步,把單次的異常訊號當成疾病指標,誤判率會高到沒有臨床價值。

也因此,這類工具最正確的用法是看同一個人隨時間的變化,而不是跟別人比大小。連續三五天往壞的方向走,才是可行動的訊號;某一天的分數偏低,什麼都不代表。

台灣的兩道關卡

第一道,也是最硬的一道:語言。

上面提到的產品裡,沒有一家明確宣稱支援繁體中文。而語音生物標記對語言的依賴程度非常高——華語是聲調語言,聲調的變化在英文裡不承載語意,在中文裡卻是辨義的核心,這對聲學特徵抽取的影響不是「準確度掉一點」,而是整個特徵空間的意義都要重新驗證。

更麻煩的是台語。台灣長照與社區關懷的實際對話裡,台語或國台語混用的比例非常高——而這正好是語音生物標記最有應用價值的族群(高齡者)。一個只在英文語料上驗證過的模型,直接用在台語長輩身上,出來的分數我認為不該被當成臨床訊息。

所以評估這類工具的第一個問題不是功能,是:你有沒有中文、最好是台灣華語的驗證資料? 沒有的話,這個專案就是研究計畫,不是導入計畫。

第二道:隱私與告知同意。

被動聆聽在台灣要處理個資法的告知同意與目的特定原則,醫療場域還要疊上病歷與敏感個資的規範。實務上這一關的成本經常高於技術導入本身。如果你的專案時程很緊,我會建議先做主動量測——使用者知道自己在被量,同意書單純得多。關於 AI 使用個人資料的界線,我們在 AI 隱私與資料安全指南 裡有更完整的整理。

給台灣不同角色的建議

長照與醫療機構:從主動量測開始,找一個明確的追蹤目的(例如憂鬱傾向的變化),先在三十到五十位個案上做三個月的對照,看語音分數的趨勢有沒有對應到你們既有的量表結果。有對應再談擴大,沒有對應就是語言驗證沒過。

企業健康方案:技術不是門檻,勞資信任才是。誰看得到分數、會不會影響考績、資料保存多久——這些規則沒先講清楚,參與率會低到資料失真。我看過太多這類專案死在這一關,而不是死在模型不準。

一般讀者:如果你在某個 App 上看到語音健康評分,合理的態度是把它當成體重計——看趨勢有意義,單次數字別當真,而且它絕對不是醫師。

TheAI學院 總結與評語

這個領域我追了兩年,技術進展是真的,產品成熟度也確實到了可上線的程度。但它在台灣的落地障礙,講到底不是技術問題。

評語:語音生物標記最迷人的地方是「不用測驗就能追蹤」,而這剛好也是它最危險的地方——零摩擦的量測,同時意味著零摩擦的監看。這條線要自己劃。

具體建議收成三句話。第一,先問語言驗證資料,沒有中文驗證就當研究做,別當服務賣。第二,能選主動量測就別急著做被動聆聽,省下的法遵時間往往比技術差異值錢。第三,任何時候看到單次的異常分數,第一反應應該是「再測一次」,而不是「去查這是什麼病」。

資料來源

本文依各廠商公開資訊整理,所有效能與定位說明均為官方自述。文中內容為技術趨勢分析,不構成醫療建議;語音健康指標不具診斷效力,任何健康疑慮請諮詢專業醫療人員。

常見問題

語音生物標記可以診斷疾病嗎?

不行。這類產品的官方定位都是決策支援或健康資訊,不是診斷工具。聲音的變化可能來自感冒、熬夜、剛運動完等無關因素,單次異常訊號的誤判率高到沒有臨床價值。它的正確用法是看同一個人隨時間的趨勢變化。

主動量測和被動聆聽差在哪?

被動聆聽在日常對話中分析(例如客服電話、遠距門診),使用者零負擔,適合長期追蹤,但隱私與告知同意的難度高;主動量測請使用者發聲幾秒完成量測,隱私爭議小、同意較好取得,代價是需要使用者配合。台灣專案若時程緊,建議先做主動量測。

中文使用者可以用嗎?

這是台灣導入最硬的一道關卡。目前主要產品都沒有明確宣稱支援繁體中文,而華語是聲調語言,聲學特徵的意義與英文不同,需要重新驗證;台語混用的情況更複雜,而高齡者恰好是最有應用價值的族群。評估時第一個該問的就是有沒有中文驗證資料。

企業要做員工語音健康方案,最該注意什麼?

不是模型準不準,是勞資信任。誰能看到分數、會不會影響考績、資料保存多久、能不能要求刪除——這些規則沒先講清楚,員工參與率會低到資料失去意義。實務上這類專案失敗多半死在這一關,而非技術。