记录一下。
早上有群友求助,需要某书籍中译版本的 EPUB,原因是之前用的 PDF 版本不太好划线。
书名、作者、译者信息都十分明确,所以要做的就是直接搜索此书的 EPUB 版本资源或是基于 PDF 版本用工具转换成 EPUB。
我简单检索了下,并没有直接找到 EPUB 版本,所以打算下载 PDF 后进行格式转换这条路子。但我发现,此书的 PDF 是扫描的,并且选择文本后发现 OCR 质量非常差。这可能也是群友觉得“不太好划线”的主要原因。
查询元数据可以看到 creator: ocrmypdf / Tesseract OCR-PDF 5.2.0 其中 Tesseract 是原 HP 工程师 Ray Smith 开发并在 2006 年由谷歌接手的 OCR 引擎。不过这个引擎的强项在拉丁字母印刷体,所以中文印刷体的识别会不太好。
于是我使用 MinerU VLM 对全书四百多页做了全量的 OCR,然后让 Agent 编写了合并排版并导出 EPUB 的脚本。脚本中清除了页眉标题、行首页码残渣和纯数字行,并重新构建了目录索引,脚注格式也尽可能还原。
已知的小瑕疵有:原跨页产生的断行以及极少量游离数字(MinerU 的识别误差)。
这个工作流感觉是可以 SKILL 化的,后续针对扫描版的电子书,可以通过 MinerU OCR,然后让 Agent 写脚本来排版(每一本书的处理逻辑应该都会有些差异,这里把如何做交给 Agent 判断效果应该更好)。
