MinerU VLM 还是有点厉害,这“水”字都缺一块了,也能识别出来。可能是根据上下文补全的?如果是传统的 OCR 引擎我感觉应该会翻车。


节选自《一般系统论 : 基础、发展和应用》 冯·贝塔朗菲 1987年
截图后半段的识别效果令我震惊。


发布时间: 2026-08-28 14:03(北京时间)
摘要: 作者分享使用 MinerU VLM 进行 OCR 识别的体验,感叹其对残缺字符的识别能力,推测其依赖上下文补全而非传统模板匹配。随后以书中截图为例,强调该模型在复杂文本识别上的出色表现,语调务实且带有技术观察色彩。
标签: OCR识别, 技术体验, 模型能力, 上下文补全, 观察记录
字数: 162
MinerU VLM 还是有点厉害,这“水”字都缺一块了,也能识别出来。可能是根据上下文补全的?如果是传统的 OCR 引擎我感觉应该会翻车。


节选自《一般系统论 : 基础、发展和应用》 冯·贝塔朗菲 1987年
截图后半段的识别效果令我震惊。

