@sxltx 在 老报纸扫描件(繁简 / 旧字形混排、横竖排混排)如何准确 OCR 并转简体? 中发帖
各位佬们,我手头有一批古老的的汉文报纸扫描件需要做数字化处理,遇到几个比较棘手的问题,想请教大家有没有成熟的方案或工具推荐。
报纸文字特征:
字形不统一:繁体、简体、旧字形 / 俗字混用,介于港台繁体和大陆规范简体之间;
排版方向混排:同一版面上有竖排从右往左(照片说明、大标题),有横排从右往左(老式横排正文),也有横排从左往右(广告、后期内容);
印刷质量一般:扫描件墨色不均、字号偏小,照片、广告、正文混排;
专有名词多:人名、地名、机构名、通讯社电头等需要准确。
我的需求:
准确识别全部文字内容,并转成规范简体中文,尽量保留分栏分段结构。
目前试过的:
通用 OCR(手机截图识字、普通网页 OCR)对竖排和老式横排方向判断经常出错,繁简转换也不准,错字率比较高。
想请教:
这类老报纸有没有专门的 OCR 工具或模型推荐?(本地可部署最好,云 API 也可以)
排版...