logo
1
话题头图

96.33% 新 SOTA !企业版文档解析(PaddleOCR-VL)1.6 同步上线

合同扫描件多栏排版,解析出来乱成一团?
财报里的图表数据,只能靠人工肉眼提取?
研报里的复杂公式,识别出来全是乱码?
别急,文档解析(PaddleOCR-VL)1.6 来了。
过去几个月,PaddleOCR-VL 系列凭借强大的文档解析能力,已被业界广泛用于大模型训练数据和应用数据构建。随着PaddleOCR-VL 1.6在开源社区正式发布,并在 OmniDocBench v1.6上以96.33%精度刷新SOTA,百度智能云同步将企业版文档解析(PaddleOCR-VL)API服务升级至1.6版本。
区别于开源版本「自行部署、自行运维」的使用方式,文档解析(PaddleOCR-VL)企业级API服务具备以下特性:
  • 开箱即用:标准化API接入,无需GPU集群部署与模型调优
  • 生产级稳定:企业SLA保障、弹性扩缩容与高可用架构,支撑业务高峰并发
  • 全格式覆盖:除PDF、图片等版式文档外,原生支持Word、PPT等流式办公文档一键解析
  • 结构化输出:直接返回Markdown /JSON,无缝对接大模型应用与知识库流水线
在继承开源版模型顶尖效果的同时,为企业提供更加便捷、稳定、全面的文档解析能力。

全面领先:96.33%新SOTA

PaddleOCR-VL 1.6 在1.5版本基础上,通过对数据和训练策略的极致优化,实现全面能力跃升:
  • OmniDocBench v1.6总指标96.33%,文本、公式、表格识别等细项均全面领先
  • OmniDocBench v1.5/Real5-OmniDocBench同步刷新SOTA
  • 表格、古籍、生僻字识别效果进一步提升,印章、Spotting、图表识别等多场景显著增强
  • 模型结构与1.5完全一致,平台平滑升级,业务无感迁移
详细指标和技术点请见:《96.33% 新SOTA!PaddleOCR-VL-1.6 发布,大模型时代的数据基座再升级》

效果预览示例

  • 表格识别场景
  • 图表识别场景
  • 公式识别场景
  • 古籍识别场景
  • 生僻字识别场景
  • 印章识别场景
  • 真实畸变场景

典型应用场景

场景
价值
大模型训练数据
高质量文档结构化标注,降低数据工程成本
RAG知识库
Word/PPT/PDF统一解析为Markdown,提升检索与问答质量
合同/财报分析
表格、印章、公式精准识别,支撑智能审阅
档案数字化
古籍、扫描件、拍照件等多形态文档批量处理
智能办公
汇报材料、方案文档结构化提取,接入 Agent 工作流

文档解析(PaddleOCR-VL)可与百度千帆大模型、Agent 开发平台、知识库等能力无缝组合,构建端到端文档智能应用。

评论
用户头像