TAIDE 完整使用教學:台灣自己的繁中模型,怎麼下載、怎麼用、什麼時候該用
國科會推動的 TAIDE 已經迭代到 Gemma-3 與 Embedding 模型。這篇從「它到底是什麼」講到實際下載部署的步驟、進階技巧與使用限制,不吹捧也不唱衰。
TAIDE 完整使用教學:台灣自己的繁中模型,怎麼下載、怎麼用、什麼時候該用
先說一個台灣使用者常遇到的處境。
你在一家診所、事務所或公務機關工作,手上有一批資料想用 AI 整理。資料不能外流,所以 ChatGPT 不能用、Claude 不能用、DeepSeek 更不用說。你查了一圈,發現要嘛得花大錢買企業方案,要嘛只能算了。
TAIDE 存在的意義,就在這個縫隙裡。
TAIDE 是什麼
TAIDE 全名是 Trustworthy AI Dialogue Engine(可信任生成式 AI 對話引擎),是國科會推動的計畫,目標是打造具台灣主體性的繁體中文大型語言模型。
它跟你平常用的 AI 服務最大的差別是:TAIDE 釋出的是模型權重,不是一個網站。你可以把模型下載到自己的電腦或伺服器上跑,資料完全不出你的環境。
第一代 TAIDE-LX-7B 在 2024 年 4 月 15 日釋出,以 Meta 的 Llama-2-7B 為基礎,額外擴充繁體中文的字元與字詞,主打五項能力:自動摘要、寫信、寫文章、中翻英、英翻中。釋出後不到半個月就超過 6,000 人次下載。
現在有哪些版本
這兩年迭代得相當快,目前官網列出的模型包含:
- Embeddinggemma-GTAIDE-300m-2605(2026 年 6 月):強化台灣法規知識的檢索能力,這是嵌入模型,用於檢索而非對話
- Gemma-3-TAIDE-12b-Chat-2602(2026 年 2 月):加強台灣在地化知識與日常用語,導入了中期訓練(midtraining)技術
- Gemma-3-TAIDE-12b-Chat(2025 年 8 月):基於 Gemma-3-12b,強化辦公室任務
- Llama-3.1-TAIDE-LX-8B-Chat(2025 年 2 月):上下文長度擴大至 131K
- Llama3-TAIDE-LX-8B-Chat-Alpha1 及 4bit 量化版本
- TAIDE-LX-7B 系列(含 4bit 量化版本)
從基礎模型的選擇可以看出路線:早期用 Llama,後來轉向 Google 的 Gemma。對使用者的實際意義是——你要先確認自己的推論工具支援哪個架構。
那個 2026 年 6 月的 Embedding 模型特別值得注意,它強化的是正體中文法規檢索。如果你要做的是「讓 AI 讀懂一堆法規條文並回答問題」,這類任務需要的是好的檢索模型加上生成模型,而不是只靠一個聊天模型硬背。
怎麼用:三種路徑
路徑一:直接下載權重自己跑(資料完全不出境)
這是 TAIDE 最大的價值所在。
步驟一:到 TAIDE 官網(taide.tw,會導向 taide.stpi.niar.org.tw)或 Hugging Face 找到你要的模型頁面。
步驟二:先讀使用條款與許可協議。這步不能跳過——TAIDE 的模型建立在 Llama 或 Gemma 之上,因此同時受原始模型的授權條款約束,商業用途的條件要自己確認清楚。
步驟三:選擇推論工具。一般使用者最簡單的是 Ollama 或 LM Studio 這類圖形化工具;要做整合開發的可以用 vLLM 或 llama.cpp。
步驟四:依模型大小準備硬體。12B 的模型未量化時需要相當可觀的顯示記憶體;如果你的機器不夠力,優先選 4bit 量化版本,品質會降一些但能跑得動。
步驟五:跑起來之後,先用你真實的任務測試,不要只問「你好」。
路徑二:當成 RAG 系統的一部分
如果你的需求是「讓 AI 回答公司內部文件或法規的問題」,正確做法不是把文件塞進提示詞,而是建 RAG(檢索增強生成):用 Embedding 模型把文件建成索引,查詢時先檢索相關段落,再交給生成模型回答。
TAIDE 這兩塊都有提供,而且 Embedding 模型特別針對台灣法規做過強化,這在台灣的應用場景是有意義的優勢。
路徑三:拿它當基礎再微調
如果你有特定領域的資料(醫療紀錄、法律文書、產業術語),可以用 TAIDE 當基底做微調。相較於從英文模型開始,繁中的底子已經打好,微調的成本較低。
進階技巧
善用量化版本做原型驗證。 先用 4bit 量化版在筆電上跑,確認流程可行、提示詞有效,再決定要不要投資更好的硬體跑完整版本。這個順序可以省掉很多不必要的採購。
別拿它跟 GPT 比通用能力。 這是最常見的誤用。TAIDE 是數十億到百億參數等級的模型,跟動輒上兆參數的前沿模型比通用推理,結果一定難看。正確的比較基準是「同樣規模的開源模型在繁中任務上的表現」。
任務要收斂。 開放式的創意寫作、複雜的多步驟推理,不是它的強項。摘要、改寫、翻譯、分類、依格式抽取資訊——這類邊界清楚的任務才是它的主場,而這些也正好是機關與企業最大量的實際需求。
提示詞寫得比平常更明確。 較小的模型對模糊指令的容忍度低。與其說「幫我整理這份會議記錄」,不如說「從以下會議記錄中,列出所有決議事項,每項標註負責人與期限,用條列式呈現」。想找現成的寫法,可以參考本站的 提示詞範本庫。
注意事項
第一,這不是 ChatGPT 的替代品。 如果你的需求是通用助理、要能寫程式能查資料能聊天,ChatGPT 或 Claude 目前還是更合適。TAIDE 的定位是「資料不能外流時的可行選項」。
第二,硬體是真實門檻。 自行部署需要機器。沒有 GPU 的話,小模型加量化勉強能跑,但速度與品質都要有心理準備。
第三,授權要自己確認。 模型建立在 Llama 或 Gemma 之上,受原始授權約束,商用前務必讀過條款。
第四,輸出仍需查證。 就算是台灣團隊訓練的模型,一樣會產生看似合理但錯誤的內容。涉及法規、醫療、財務的輸出,回原始文件核對是必要的,這點不因為它比較懂台灣就例外。
TheAI學院 評語
TAIDE 這幾年最大的進展,我認為不是模型變強,是選項變多了——從單一的 7B 聊天模型,到不同規模、不同基礎架構、還有專門做法規檢索的嵌入模型。這代表它開始理解使用者的真實需求不只是「聊天」。
評語:TAIDE 的價值不在跟前沿模型比誰聰明,在於它讓「資料不出境」這個選項的門檻降到一般機構也負擔得起。
給台灣讀者三個具體建議。第一,如果你的資料本來就可以上雲,老實說直接用成熟的商用服務效率更高,不必為了本土而本土。第二,如果你在公務機關、醫療院所、法律事務所這類資料敏感的環境,TAIDE 值得花一個週末實際跑起來看看,那個週末可能會改變你對「我們不能用 AI」這個結論的判斷。第三,別忘了 2026 年 6 月那個法規檢索的嵌入模型——如果你要處理的是台灣的法規文件,那可能比聊天模型更有用。
想看更多台灣本土的 AI 工具,可以逛逛本站的 AI 工具庫。
資料來源
依公開資訊整理,以 TAIDE 官方網站公告為準。模型版本與授權條款可能更新,使用前請自行確認。
常見問題
TAIDE 可以像 ChatGPT 那樣直接在網頁上用嗎?
TAIDE 的主要釋出形式是模型權重,設計上是讓你下載到自己的環境部署,而不是一個面向大眾的聊天網站。這正是它的價值——資料完全不出你的機器。如果你要的是打開網頁就能用的通用助理,成熟的商用服務會更方便;TAIDE 適合的是資料不能外流的場景。
需要什麼樣的硬體才跑得動?
看你選哪個版本。12B 等級的模型未量化時需要相當可觀的顯示記憶體;4bit 量化版本的需求低很多,一般配備獨立顯卡的電腦有機會跑,品質會降一些但可用。建議的做法是先用量化版在現有機器上做原型驗證,確認流程可行、提示詞有效,再決定要不要為完整版本投資硬體。
TAIDE 的能力比得上 GPT 或 Claude 嗎?
通用能力上比不上,這點要誠實。TAIDE 是數十億到百億參數等級,跟前沿的大型模型比通用推理不是公平的比較。正確的比較基準是同樣規模的開源模型在繁中任務上的表現。而且它的定位本來就不是取代通用助理,是在「資料不能外流」的前提下提供一個可行選項。
用 TAIDE 做商業用途可以嗎?
要看授權條款。TAIDE 的模型建立在 Meta Llama 或 Google Gemma 之上,因此同時受原始模型的授權約束,不同基礎模型的商用條件不同。官網有「條款與許可協議」的連結,下載前務必讀過。這不是形式問題——授權條款會直接影響你能不能把它放進對外的產品裡。