← AI 動態
The Decoder
拯救AI訓練!FineBooks低成本修復古籍OCR資料
Hugging Face與EleutherAI推出FineBooks專案,以極低成本將古籍掃描檔轉化為高準確率的乾淨文字,成功解決劣質OCR資料破壞語言模型訓練的痛點。
OCR
資料清理
模型訓練
開源模型
在AI模型的訓練過程中,「垃圾進,垃圾出」是千古不變的定律。過去許多歷史書籍與文獻雖然經過OCR(光學字元辨識)數位化,但早期的技術容易產生大量錯字與亂碼。如果直接將這些充滿瑕疵的舊資料餵給大型語言模型,會嚴重破壞模型學習語言結構與知識的能力。
為了解決這個資料品質危機,Hugging Face與EleutherAI合作發起了FineBooks專案,針對超過兩千頁的歷史書籍測試了14款開源OCR模型。結果顯示,許多輕量級小型模型的表現反而優於大型模型,其中最佳的「dots.mocr」模型字元準確率高達97.6%,且處理一千頁的成本不到兩美元。
這項技術突破對AI發展意義重大,它能以極低的成本將海量人類歷史文獻轉化為高品質的訓練燃料,大幅降低了資料清理的門檻。雖然目前的精確度尚未達到嚴謹的學術考證標準,但對於擴展生成式AI的知識庫與豐富預訓練資料集而言,已經是極具價值與開創性的一大步。