數發部公布主權 AI 評測:188 個模型比拚「懂不懂台灣」,本土模型雅婷智慧擠進第 4
2026年9月8日
當我們問 AI「土地公廟前面那條路怎麼走」,它聽不聽得懂?數發部把這件事變成了一場正式評測——用高中學測的國文、社會科加上台灣價值觀,考了 188 個國內外模型。結果前三名不意外由三大巨頭包辦,但第 4 名是一個只有 300 億參數的台灣模型。這件事比排名本身更值得談。
數發部公布主權 AI 評測:188 個模型比拚「懂不懂台灣」,本土模型雅婷智慧擠進第 4
九月初的一個下午,台北一間中小企業的老闆想用 AI 幫忙寫一份給員工的公告,內容提到勞基法的特休規定。他把問題丟給某個國外的聊天機器人,得到一段條理分明、格式漂亮的回覆——只是裡面引用的是中國大陸的勞動法規。
他不是不會用 AI,他只是沒想到要懷疑。
這種「講得很流利但根本不是在講台灣」的狀況,正是主權 AI 這個概念要處理的問題。而數位發展部在 2026 年 9 月 2 日公布的一份評測結果,第一次把它變成了可以量化比較的東西。
事件背景
數位發展部轄下的 AI 產品與系統評測中心(AIEC)公布台灣主權 AI 評測結果,對國內外 188 個通用模型進行測試。評測建立三項基本指標,測的是三種「理解力」:
- 對台灣使用的繁體中文的語言理解能力——以近 5 年高中學測國文科命題測試
- 對台灣社會文化的理解能力——以近 5 年高中學測社會科命題測試
- 對台灣價值觀的理解能力——以專門設計的台灣價值觀題組測試
用學測考卷來考 AI,這個設計其實蠻聰明的。它現成、公開、有標準答案,而且題目本身就內建了台灣的社會脈絡——學測社會科會考台灣的地理、歷史、公民與政治制度,這些正是國外模型最容易失準的地方。
數發部長林宜敬對「主權 AI」界定了兩個核心意義:第一,AI 模型必須具有台灣觀點,能理解台灣的繁體中文、熟悉台灣社會文化,並具備符合台灣社會的價值觀;第二,AI 模型部署的算力中心必須位於台灣境內,才能受台灣法律管轄,確保資料治理與模型運作符合我國法規。
第二點常被忽略,但其實同樣關鍵——一個很懂台灣但跑在境外機房的模型,在資料治理上仍然是個問題。
本次重點
- 前三名由國際巨頭包辦:依公視新聞網報導,第一名為 OpenAI 的 GPT-5.6-Sol、第二名為 Anthropic 的 Claude-Fable-5、第三名為 Google 的 Gemini-2.5-Pro。
- 台灣模型表現超乎預期:雅婷智慧、亞太智能機器、鴻海研究院與長聯科技等 4 家國產模型業者表現亮眼,其中雅婷智慧與亞太智能機器進入前 10 強。
- 雅婷智慧第 4 名,且參數量差了兩個量級:據報導,雅婷智慧的模型參數量為 300 億,而前三名的模型參數量均超過一兆。林宜敬指出,這代表它用更少的電力與算力資源達成了相近的成績。
- 台灣價值觀項目本土模型拿滿分:報導指出雅婷智慧與亞太智能機器在「台灣價值觀」項目取得滿分;雅婷智慧的模型在高中學測國文正確率 86.20%、社會 84.00%、台灣價值觀 100%。
- 本土模型在價值觀項目明顯領先:整體而言台灣本土模型在此項的表現優於多數國外模型。
市場影響分析
對台灣使用者
最實際的價值是:你終於有個依據可以判斷該用哪個模型做什麼事。
如果你的工作涉及台灣的法規、公文格式、在地文化脈絡(例如寫給台灣員工的公告、處理台灣的合約、做在地行銷文案),這份評測告訴你本土模型並非只能當備胎——至少在「懂不懂台灣」這件事上,它們是有競爭力的。
但也別過度解讀。學測題目測的是特定類型的理解能力,跟你實際工作中的任務(寫程式、做摘要、跑資料分析)不見得高度相關。前三名的國際模型在通用能力上仍有明顯優勢,這份評測沒有否認這件事,它測的是另一個維度。
務實的做法是分工:需要台灣脈絡判斷的任務,本土模型值得一試;需要複雜推理或程式能力的任務,還是走國際模型。想比較各家模型可以看站上的 ChatGPT、Claude、Gemini 與 TAIDE 的介紹。
對企業應用
對台灣企業,這份評測提供了一個過去沒有的採購依據。過去要說服老闆「為什麼要用本土模型而不是直接接 OpenAI API」,能講的理由多半是模糊的資安考量。現在至少有官方的評測數字可以放進評估報告。
參數量的差距特別值得企業注意。300 億參數對上一兆以上,意味著推論成本與部署彈性完全不同——地端部署、邊緣運算、成本控制,這些在資料不能出境的場景(醫療、金融、公部門)是決定性因素。一個「夠好且能放在自己機房」的模型,實務價值往往高於「最強但只能連外」的模型。
對開發者
對台灣的 AI 團隊,這是一個相對正面的訊號:垂直的在地化是打得贏的戰場。你不需要在通用能力上跟一兆參數的模型硬碰硬,但在「懂台灣」這個維度上,資料的近用性與在地團隊的理解是真正的護城河。
要提醒的是,評測拿滿分和產品好用是兩件事。學測考得好不代表 API 穩定、文件完整、生態系成熟。本土模型接下來的挑戰在工程與生態,不在分數。
未來發展趨勢
評測會持續演化,而且應該要。 用學測命題是很好的起手式,但它有天花板——學測考的是高中生該會的東西,測不出模型在專業領域(法律、醫療、工程)的台灣脈絡理解。下一階段的評測若能往專業領域延伸,價值會更大。
「算力在境內」這個要求會影響產業結構。 主權 AI 的第二個定義如果真的落實到公部門採購規範,對台灣的資料中心與地端部署業者是實質的商機。
價值觀評測本身會成為討論焦點。 「台灣價值觀」怎麼定義、由誰定義、題目怎麼設計,這些問題本身就值得公共討論。把價值觀納入 AI 評測是個大膽的做法,也需要相應的透明度。
TheAI學院 總結與評語
老實說,我一開始看到「用學測考 AI」的時候是有點想笑的——這聽起來像個新聞哏。但仔細想想,這個設計解決了一個真實的難題:怎麼客觀衡量一個模型「懂不懂台灣」?學測題目公開、有標準答案、內建台灣的社會脈絡,比起自己出一套沒人認識的題庫,可信度高多了。
最值得談的其實是那個參數量的對比。300 億對上一兆,這中間差的不只是分數,是電費、是機房、是能不能放進醫院的地端伺服器。台灣在 AI 這場競賽裡,本來就不該去比誰的模型大。
評語:台灣模型贏不了通用能力,但在「懂台灣」這件事上不必自卑——真正的問題是分數之後,工程與生態能不能跟上。
給台灣讀者的具體建議:別把這份評測當成模型排行榜看,把它當成任務分工的參考。實際做法是,你手上如果有涉及台灣法規、公文、在地文化的任務,花十分鐘同時丟給國際模型和本土模型比較一次,你會很快知道差別在哪。這個實測比任何排名都準。
如果你是企業的 IT 或採購負責人,這份評測值得放進你的評估文件——特別是當你的資料有不能出境的顧慮時,本土模型現在有了拿得出手的客觀依據。
資料來源
依公開資訊整理、以官方為準。
常見問題
什麼是「主權 AI」?
依數發部長林宜敬的界定,主權 AI 包含兩個核心意義:一是 AI 模型必須具有台灣觀點,能理解台灣使用的繁體中文、熟悉台灣社會文化、並具備符合台灣社會的價值觀;二是模型部署的算力中心必須位於台灣境內,才能受台灣法律管轄,確保資料治理與模型運作符合我國法規。第二點常被忽略,但對資料治理同樣關鍵。
這次評測是怎麼測的?
數發部 AIEC 建立三項基本指標,分別以近 5 年高中學測國文科測繁體中文語言理解、學測社會科測台灣社會文化理解,以及專門設計的題組測台灣價值觀理解,對 188 個國內外通用模型進行評測。用學測命題的好處是題目公開、有標準答案,且本身就內建台灣的社會脈絡。
台灣模型第 4 名,代表可以取代 ChatGPT 了嗎?
不能這樣解讀。這份評測測的是「懂不懂台灣」這個特定維度,不是模型的通用能力。前三名的國際模型在複雜推理、程式撰寫等通用任務上仍有明顯優勢。比較務實的理解是任務分工:需要台灣在地脈絡判斷的任務,本土模型值得一試;需要複雜推理的任務,國際模型仍較強。
參數量 300 億對上一兆,這個差距有什麼意義?
意義主要在部署成本與彈性。參數量小很多但成績相近,代表推論所需的算力與電力低得多,這讓地端部署、邊緣運算與成本控制變得可行。對於資料不能出境的場景(醫療、金融、公部門),一個「夠好且能放在自己機房」的模型,實務價值往往高於「最強但只能連外」的模型。
資料來源:TheAI學院編輯團隊原創