Phonic
語音代理人平台,主打「聽的是聲音不只是文字」,回應延遲約 500 毫秒。
Phonic 是給開發者建語音代理人的平台,能打出接近真人感覺的電話。它的技術主張有個值得注意的細節:它強調自己「聽的是音訊本身,不只是文字」——會去辨識語氣與遲疑,而不是先把聲音轉成文字再處理。
這個差別在對話中影響很大。傳統做法是語音轉文字、文字進 LLM、回覆再轉語音,這條鏈路每一段都要時間,而且轉文字的瞬間就把語氣、停頓、猶豫這些資訊全丟了。客戶說「嗯……好啊」跟「好啊!」在文字上一模一樣,實際意思差很多。Phonic 走語音對語音的路線,官網宣稱回應時間 500 毫秒,相較之下許多競品需要超過一秒。語言支援 50 種以上,強調母語級品質。
功能特色與適用場景
整合面支援 LiveKit、webhook 與 websocket,不用重建既有基礎設施。它用前沿模型做工具呼叫(tool calling)與推理,所以代理人能實際去查資料、改訂單,而不只是聊天。企業部署選項齊全:雲端、單租戶、VPC 對接與自架都有。客戶包含 Ashby、Rho、Assort Health 與 Maven AGI。適用場景集中在招募團隊的初步電話面談、醫療機構的病人初診資料蒐集、物流業的司機協調,以及客服的分流與處理。
給台灣使用者的具體用法
台灣的人力仲介、診所預約與電商客服是最對得上的情境。但導入語音代理人前,有幾件事比技術規格更重要:台灣消費者對機器人接電話的接受度仍偏低,開場一定要明確告知這是 AI;涉及個資的對話(病歷、身分驗證)要確認錄音儲存與法遵;中文的語音對語音品質也必須實測。建議先從低風險場景試水溫,例如預約確認或滿意度回訪,而不是一開始就讓它處理客訴。
TheAI學院 編輯建議
編輯實測後的真心話語音代理人的技術門檻正在快速下降,現在真正的難題是「人願不願意跟它講話」。Phonic 的語音對語音路線技術上我很認同——把語氣丟掉再判斷意圖,本來就很吃虧。台灣要導入,我的建議一律是:先從預約確認這種無痛場景開始,別讓 AI 第一天就去接客訴。
主要功能
- 語音對語音處理,辨識語氣與遲疑而非只看文字
- 官方宣稱回應延遲約 500 毫秒
- 支援 50 種以上語言
- 工具呼叫能力,代理人可實際查詢與操作資料
- 整合 LiveKit、webhook 與 websocket
- 企業部署選項:雲端、單租戶、VPC 對接、自架
如何使用 Phonic
- 團隊到 Phonic 開通平台。
- 整合 STT、模型與 TTS。
- 建語音 AI 代理。
- 用評估工具測試。
- 做品質監控。
- 穩定上線。
- 依用量計費。
適用場景
- 招募團隊做應徵者的初步電話篩選
- 診所與醫療機構蒐集病人初診資料
- 物流業協調司機的排程與狀態確認
- 電商客服的來電分流與常見問題處理
- 預約確認與滿意度回訪等低風險外撥
Phonic 的優點與缺點
優點
- 不先轉文字就處理音訊,保留語氣資訊,對話判斷更貼近真實意圖
- 部署選項完整,對資料主權有要求的企業有解
- 有工具呼叫,代理人能真的辦事而不只是對話
缺點
- 未公開價格,中小型團隊不易評估
- 繁體中文的語音對語音品質未公開,需自行實測
- 台灣消費者對 AI 接聽電話接受度仍有限,導入需配套設計
價格方案
官網未公開價格,需洽詢。
Phonic 常見問題
「聽音訊不只聽文字」實際差在哪?
差在語氣資訊有沒有被保留。傳統流程一轉文字,停頓、猶豫、語調就全沒了——「嗯……好啊」和「好啊!」在文字上完全一樣。語音對語音的做法讓模型能感知這些訊號,對判斷客戶是真的同意還是勉強接受有差。
台灣客戶會接受 AI 打來的電話嗎?
接受度還在建立中,而且跟場景高度相關。預約確認、滿意度回訪這類低風險互動接受度較高;客訴處理、推銷就容易引起反感。實務建議:開場明確說明是 AI 助理、提供隨時轉真人的選項,這兩件事對信任度的影響比語音多自然還大。
需要多少工程資源才能上線?
它支援 LiveKit、webhook 與 websocket,對已有客服系統的團隊整合不算太重。但真正花時間的通常不是接 API,是設計對話流程、處理例外情境、以及跟現有 CRM 串資料。抓時程時記得把這部分算進去。
使用者評價
還沒有足夠評價,搶先分享你的使用心得!