Transkribus 完整教學:把手寫古文獻變成可搜尋的文字,每月 50 點免費額度怎麼花
族譜、地契、老帳簿、曾祖父的書信——掃描成圖檔很容易,變成可搜尋的文字幾乎不可能。Transkribus 累積辨識超過 2 億頁,是這個領域最成熟的工具。這篇從建立 Collection 講到匯出 PAGE XML,並說清楚中文文獻的真實限制。
一位在雲林做地方文史的老師,手上有一箱東西。
裡面是七十幾份日治時期的土地台帳影本、三本手抄的宗族譜,還有一疊 1950 年代的農會收據。全部掃描成 PDF 了,放在硬碟裡佔了 3GB。
「可是,」他說,「我要查『第三保 王姓』,還是得一張一張看。」
這就是文獻數位化最大的謊言:掃描完不等於數位化。一個不能搜尋的 PDF,跟一箱紙的差別只在於不會發霉。
Transkribus 要解的就是這一段。
Transkribus 是什麼
Transkribus 是一個專門做**手寫文字辨識(HTR,Handwritten Text Recognition)**的平台。
這跟一般的 OCR 不一樣。印刷體的 OCR 早就是成熟技術,但手寫體完全是另一個難度——字跡因人而異、書寫慣例會隨年代改變、紙張泛黃破損。傳統 OCR 遇到手稿基本上全數投降。
平台由 READ-COOP SCE 營運,這是一個歐洲合作社,擁有 250 位以上的共同所有人。資料處理與儲存都在奧地利的伺服器,符合 GDPR。
官網公布的累積數字相當可觀:辨識超過 2 億頁、300 個以上的社群 AI 模型、支援 100 種以上語言與歷史書體。
它能做什麼
除了辨識文字,平台涵蓋的是從掃描檔到可查詢典藏的整條路:
- 版面偵測(Document Layout Analysis)——自動判斷頁面的欄位、區塊與文字行位置
- 行偵測(Line Detection)——把每一行文字框出來,這是辨識的前置步驟
- 表格辨識——處理帳簿、名冊這類結構化文獻
- 欄位辨識(Field Recognition)——針對表單類文獻抓取指定欄位
- 協作編輯器——多人分工校對
- 詮釋資料標記
- 全文檢索與線上發布
- REST API——供系統整合
- 自訂模型訓練——用少量標註資料訓練專屬模型
最後一項對檔案館最重要:如果你有一批同一位書寫者、同一種書體的文獻,可以訓練一個專屬模型,準確度會遠高於通用模型。
怎麼用:完整步驟
步驟一:註冊並確認免費額度
註冊帳號,Free 方案每月給 50 點,不需要綁信用卡。
先弄清楚點數怎麼算,這會決定你的測試策略。依官方定價頁:
- 手寫文字辨識:每頁 1 點
- 行偵測:每頁 0.25 點
- 表格辨識:每頁 1 點
- 欄位辨識:每頁 1 點
官方並註明:使用表格或欄位辨識時,仍需搭配文字辨識才能得到完整轉寫。也就是說表格頁實際上要 2 點。
換算下來,每月 50 點大約可做 50 頁的手寫辨識。對個人試水溫夠用,正式專案則需要付費方案。
步驟二:建立 Collection
在 Collections 分頁建立一個新的 collection。這是 Transkribus 的基本組織單位,你所有的文件都會歸在某個 collection 底下。
建議的分法是依文獻性質而非時間——同一種書體、同一位書寫者的文獻放在一起,之後訓練專屬模型時會方便很多。
步驟三:上傳影像
點開你要的 collection,在右上角選單點 Upload。可以直接拖放檔案,或瀏覽選取本機檔案,輸入文件標題後按 Submit。
格式限制要注意:接受 JPEG/JPG、PNG 與 TIFF,單張影像最大 20 MB。
掃描品質的建議:300 dpi 以上、盡量平整、避免陰影。前置的掃描品質對辨識結果的影響,往往比選哪個模型還大。
步驟四:跑版面與行偵測
上傳後先做版面分析,讓系統框出文字行的位置。
這一步每頁只要 0.25 點,很便宜,但非常關鍵——如果行沒框對,後面的文字辨識一定是亂的。建議先跑幾頁看結果,確認框線合理再批次處理。
複雜版面(多欄、有插圖、有邊註)常常需要人工調整,編輯器裡可以手動修正行的範圍。
步驟五:挑模型並跑文字辨識
選取要處理的頁面,從模型清單中挑一個適合的文字辨識模型——依語言、年代與書體挑選。
這是整個流程中最需要判斷的一步。300 多個社群模型的說明頁通常會列出訓練資料的來源與時代,挑錯模型的結果會差很多。
實務建議:先用 3 到 5 頁測試不同模型,比較結果再決定要用哪一個跑全部。用 5 點試模型,比用 50 點跑錯模型划算太多。
步驟六:在編輯器裡校對
辨識完成後,在 Transkribus Editor 裡校對。介面會左右對照——左邊是原始影像,右邊是辨識出的文字,點擊某一行會同步定位。
校對的實務技巧:
- 先掃一遍找系統性錯誤(某個字母或字詞固定被認錯),這種一次全部取代最快
- 人名、地名、年代這類關鍵欄位優先校對,敘述性內容可以之後再處理
- 多人分工時,用 collection 的權限設定分配範圍
步驟七:匯出
選取要匯出的文件或頁面,點上方選單的 Action 下拉,選 Export。
主要的匯出選項有兩種:
- PAGE XML——保留影像特徵、版面結構與頁面內容的 XML 格式,每頁一個檔案。要接進自己的典藏系統或做進一步處理,選這個
- 可搜尋的 PDF——文字層疊在原始影像上,適合直接給人閱讀與查找
如果你的目的是「讓這批資料可以被檢索」,PAGE XML 是正解;如果只是要一份能搜尋的檔案給同事看,PDF 就夠。
進階技巧
一、訓練自己的模型。 如果你有一批同一書寫者的文獻,先人工精校幾十頁當訓練資料,再訓練專屬模型。前期投入不小,但後續幾百頁的準確度會明顯提升。官方部落格有完整的訓練指南。
二、用行偵測當備案。 就算文字辨識不準(例如中文文獻),版面與行偵測仍然有用——它能把版面結構抓出來,讓你人工打字時至少不必重建結構。
三、先分群再處理。 把文獻依書體與年代分群,每群測一次模型。混在一起跑會被最難的那一種拖累整批準確度。
四、隨選點數不會過期。 官方標示單買的 250 點(59.5 歐元)永不過期,適合專案性質、用量不固定的使用者,不必被年度訂閱綁住。
注意事項
中文文獻是最大的限制。 這件事要講清楚:HTR 技術本身不限語言,但 Transkribus 的社群模型幾乎都是歐洲語系與拉丁、哥德書體。中文與日文的公開模型非常有限。台灣的族譜、地契、日治文書要用,實務上得自己標註資料訓練專屬模型。
校對是必要流程,不是選配。 HTR 的產出是草稿。字跡潦草、墨跡暈開、紙張破損的地方一定會出錯。合理的期待是「省下八成的打字時間」。
成本要先試算。 機構級的整批數位化一定要先算清楚。1,000 頁的手寫辨識加行偵測約需 1,250 點,這個量級已經超過 Scholar 方案的年度額度。
資料在奧地利。 資料處理與儲存在奧地利伺服器並符合 GDPR,這對歐洲機構是加分。台灣的公部門典藏若有資料落地要求,導入前需確認法規可行性。
TheAI學院 評語
我拿家裡一批日文書信試跑過。結論很誠實:歐洲語系的模型完全派不上用場。
最後我用的是它的版面與行偵測——把每一行的位置框出來,文字還是自己打。但即使如此,那個結構化的輸出仍然幫我省下不少重建版面的工。
這個經驗讓我對這個工具的評價變得更精準。
評語:Transkribus 是手寫文獻辨識目前最成熟的平台,但它的成熟度建立在歐洲語料上。對台灣讀者,它現階段真正的價值不是「馬上能辨識我的族譜」,而是它證明了一件事——只要有人願意投入標註,手寫古文獻的全文檢索技術上完全成立。台灣缺的不是技術,是有人開始做。
給台灣讀者的具體建議:
如果你是個人研究者或家譜愛好者:免費層 50 點足以試水溫。先用來測試「版面偵測對你的文獻有沒有用」,這一步只要 0.25 點一頁,很划算。
如果你在檔案館、圖書館或地方文史單位:先做一件不花錢的事——把文獻依書體與年代分群,並精校幾十頁當基準。這份標註資料無論將來用哪個平台都有價值,而且只有你做得出來。
如果你是開發者或研究團隊:台灣手寫文獻的 HTR 模型是一個既有社會意義、又有明確技術門檻的題目。公視的手語新聞、國史館的檔案、各地的族譜——素材是有的。
想了解同類的機構級方案,可以看 Teklia(羅浮宮與美國國會圖書館都在用)與 Archipanion 的典藏搜尋路線;想先搞懂 AI 工具怎麼挑,可以看 怎麼挑 AI 工具。
資料來源
- Transkribus 官方定價頁
- Transkribus 官方說明文件:Beginner's Guide to Transkribus
- Transkribus 官方說明文件:Automatically transcribing your documents
本文依公開資訊整理,點數計價與功能以 Transkribus 官方公告為準。
常見問題
Transkribus 免費額度有多少?
官方定價頁列出 Free 方案每年 0 歐元、每月 50 點,不需綁信用卡。付費方案為 Scholar 每年 99 歐元(900 點/年)、Team 每年 449 歐元(1,500 點/年)、Organisation 為客製報價(75,000 點以上/年)。另可隨時單買 250 點 59.5 歐元的隨選點數,且永不過期。
一點可以處理多少內容?
依官方定價頁的每頁點數:手寫文字辨識每頁 1 點、行偵測(line detection)每頁 0.25 點、表格辨識每頁 1 點、欄位辨識每頁 1 點。官方並註明使用表格或欄位辨識時,仍需搭配文字辨識才能得到完整轉寫。換算下來,每月 50 點大約能做 50 頁的手寫辨識。
它認得中文毛筆字或台灣的日治文書嗎?
技術上手寫文字辨識(HTR)不限語言,但實際能不能用取決於有沒有對應的訓練模型。Transkribus 的社群模型絕大多數是歐洲語系與拉丁、哥德書體,中文與日文的公開模型非常有限。台灣文獻要用,多半得自己標註資料訓練專屬模型——這條路可行但需要前期投入。
辨識出來的文字需要人工校對嗎?
需要,而且這是正常流程。HTR 的產出是「大幅減少打字工作」而非「零錯誤」,字跡潦草或紙張受損處尤其明顯。平台內建協作編輯器就是為了讓校對能多人分工。實務上的效益比較基準應該是「從空白開始打字」,而不是「完全不用看」。