历史书OCR做到97%准确率才两刀一千页?这成本模型我是服的

FineBooks项目测了14个开源OCR模型,处理两千多页古籍的最佳成绩是字符准确率97.6%,每千页成本不到两美元。这个性价比拿来清洗训练数据确实够了,但团队自己也说,离学术级别的精确转录还有距离。

从这个角度看,大规模语料清洗的成本模型比单纯的准确率更重要。很多团队一上来就追求99%+的完美OCR,但训练大模型可能根本用不着那么精细,成本先爆了。FineBooks这种“够用就好”的思路,反而更贴近真实的产品和研发场景——先解决“有没有”数据的问题,再迭代“好不好”。

现在的问题是,有多少高质量的文本语料其实被老OCR的低质量输出给污染了?清洗这批存量数据的ROI到底有多高。

2 个赞

这波是数据洗澡,价格比澡票还便宜,洗不干净也得先冲个水,属于是数字搓澡师傅了。

4 个赞

小白请教一下,这个“字符准确率97.6%”具体是怎么算的呢?是不是错几个字就扣分?我不太确定这对我们理解质量有没有影响。

前排蹲后续,坐等其他模型评测或者有没有更便宜的方案出现。

1 个赞

每千页两美元?这个能白嫖吗?有没有开源或者免费额度更高的平台平替?纯好奇问一下。

2 个赞

你问到了点上。FineBooks的论文我扫了一眼,他们用的CER(字符错误率)在特定测试集上算的,样本量两千多页古籍。但泛化到其他类型的古籍或印刷体,这个数据可能就不准了。所以别光看97%这个数,得看具体benchmark。

数据传哪了?默认上传到项目方的服务器做处理了吧?这种批量OCR的隐私条款一般都写得很宽泛,能本地部署跑模型吗?不能的话,很多敏感历史档案根本不敢用。

ROI算过吗?如果我有一万页老旧文档需要数字化,花20美元得到97%准确率的文本,后续人工校对修复3%错误的时间成本,比直接用更贵但更准的服务,哪个更划算?这才是关键。

就这?97%对古籍OCR来说离“可用”还差得远呢,一个句读错了意思全歪。又是炒概念,真做研究的谁敢直接用这个数据,回头污染了模型训练,三个月后就得哭。泡沫总会破。

哦~是吗?不愧是您,眼光就是高远。那按您的意思,大家都该人手99.9%准确率、每页一百刀的服务呗,赢麻了,反正经费不是钱。

这个成绩在开源OCR里算不错的,但距离SOTA还有差距。有相关paper对比过,在历史文档OCR特定任务上,某些商用API的CER可以更低。不过他们的价值在于给出了一个公开的成本-准确率benchmark,这为数据清洗的ROI讨论提供了基础。