Transkribus
歐洲合作社經營的手寫古文獻 AI 辨識平台,每月送 50 點
OCR 這件事,印刷體早就解決了。手寫體沒有。
十七世紀的教區登記簿、日治時期的戶籍謄本、家族留下的書信——這些東西掃描成圖檔容易,變成可搜尋的文字幾乎不可能。字跡潦草、書寫慣例已失傳、紙張泛黃破損,傳統 OCR 全部投降。
Transkribus 做的就是這件難事,而且做了很多年。
功能特色與適用場景
它的核心是 HTR(Handwritten Text Recognition,手寫文字辨識),支援超過 100 種語言與歷史書體。官網公布的累積數字相當可觀:辨識超過 2 億頁、社群提供 300 個以上的 AI 模型。
功能不只辨識文字,還包含版面偵測(layout detection)、欄位辨識、表格辨識、資訊擷取、協作編輯器、詮釋資料標記、全文檢索與發布,以及供整合用的 REST API。也就是說,從掃描檔到可查詢的數位典藏,整條路都在平台上。
它也支援自訂模型訓練——如果你手上有一批特定書寫者或特定書體的文獻,可以用少量標註資料訓一個專屬模型,這是檔案館最實際的需求。
營運方是 READ-COOP SCE,一個歐洲合作社,擁有 250 位以上的共同所有人。資料處理與儲存都在奧地利伺服器,符合 GDPR。免費層每月給 50 點,不用綁信用卡。
適用場景:檔案館與圖書館的典藏數位化、歷史學與數位人文研究、家譜與家族史調查、老報紙與族譜的建檔、以及圖書館開放資料的全文化。台灣的族譜、地契、日治文書數量龐大但多數仍以影像形式沉睡,這類工具的思路值得參考。可對照 Teklia 的機構級服務與 Archipanion 的典藏搜尋。
TheAI學院 編輯建議
編輯實測後的真心話我一直覺得檔案數位化是最被低估的 AI 應用。它不會登上科技媒體頭條,但一批沉睡三百年的文獻能被搜尋,對歷史研究的意義遠超過再多一個聊天機器人。Transkribus 用合作社形式經營也很特別——不追求被收購、不追求爆炸成長,就是把一件冷門但重要的事做好。台灣的族譜和地契要是有一天能全文檢索,那會是文化上的大事。
主要功能
- HTR 手寫文字辨識,支援 100+語言與歷史書體
- 累積辨識 2 億頁以上、300+社群 AI 模型
- 版面、欄位與表格辨識
- 自訂模型訓練
- 協作編輯器與詮釋資料標記
- 全文檢索與線上發布
- REST API 整合
- 每月 50 點免費額度
如何使用 Transkribus
- 到 Transkribus 開通平台。
- 上傳手寫古文獻掃描檔。
- 用 HTR 辨識手寫文字。
- 選合適的社群模型。
- 做版面與表格辨識。
- 匯出可搜尋文字。
- 每月送 50 點試用。
適用場景
- 檔案館典藏的手稿全文數位化
- 歷史學與數位人文的文本探勘
- 家譜與家族書信的辨識建檔
- 老報紙、地契與帳簿的可檢索化
- 以 API 串接自有典藏系統
Transkribus 的優點與缺點
優點
- 手寫古文獻辨識是它的本業,不是順便做的功能
- 合作社形式營運,不受單一投資人退場風險影響
- 免費層不綁卡,個人研究者與家譜愛好者可直接用
- 資料存放奧地利、GDPR 合規,機構採購較放心
缺點
- 中文與東亞古籍的模型資源遠少於歐洲語系
- 自訂模型訓練需要一定數量的人工標註,前期投入不小
- 點數制對大批量專案的成本需先試算
- 介面與文件以歐語系使用者為主
價格方案
每月免費 50 點額度、免綁信用卡;另有付費方案,詳見官網 pricing 頁。
Transkribus 常見問題
它認得中文毛筆字或日治時期的文書嗎?
技術上 HTR 不限語言,但實務上取決於有沒有對應的訓練模型。Transkribus 的社群模型絕大多數是歐洲語系與拉丁、哥德書體,中文與日文的公開模型非常有限。台灣文獻要用,多半得自己標註資料訓練專屬模型——這條路可行但不輕鬆。
免費的 50 點能做多少事?
點數對應處理頁數,具體換算依模型與功能而異,實際用量建議直接試跑。對個人研究者做小批量的家譜或書信辨識,免費層通常夠試水溫;機構級的整批數位化則一定要走付費方案並先做成本試算。
辨識出來的文字需要人工校對嗎?
需要,而且這是正常流程。HTR 的產出是「大幅減少打字工作」而不是「零錯誤」,尤其在字跡潦草或紙張受損處。平台內建協作編輯器,就是為了讓校對這一步能多人分工進行。
使用者評價
還沒有足夠評價,搶先分享你的使用心得!
寫下你的評價
Transkribus 的替代方案
查看相似的 AI 工具 →相關 AI 工具
猜你也想看的AI 內容解讀
更多奧地利的 AI 工具
同樣來自奧地利的 AI 工具,一起看看。