百度发布 PaddleOCR-VL-1.6,在 OmniDocBench v1.6 评测中准确率达 96.33%,超越 GPT-5.2 和 Gemini-3-Pro,刷新文档解析 SOTA。
📝 详细摘要
百度正式发布 PaddleOCR-VL-1.6,这是基于文心大模型训练的 OCR 模型的最新版本。该模型在 OmniDocBench v1.6 权威评测中总指标达到 96.33%,超越 Gemini-3-Pro、GPT-5.2、MinerU-2.5-Pro 等主流方案,综合性能全球第一。在面向真实复杂场景的 Real5-OmniDocBench 评测中,准确率达 93.19%,较 Gemini-3-Pro 提升近 4 个百分点。PaddleOCR-VL-1.6 在文本、公式、表格等核心识别能力上全面领先,在表格、古籍、生僻字识别等复杂场景能力显著提升。模型采用 0.9B 轻量化架构,与上一代模型结构一致,开发者可平滑迁移。目前模型已开源至 GitHub 和 Hugging Face,支持网页端和 API 调用。
💡 主要观点
- PaddleOCR-VL-1.6 在 OmniDocBench v1.6 评测中准确率达 96.33%,超越 GPT-5.2 和 Gemini-3-Pro。 该模型在权威评测中综合性能全球第一,在文本、公式、表格等核心识别能力上全面领先当前主流开源及闭源方案。
💬 文章金句
- PaddleOCR-VL-1.6 在 OmniDocBench v1.6 权威评测中准确率突破 96.3%,综合性能全球第一,刷新业界 SOTA。
- 在面向真实复杂场景构建的 Real5-OmniDocBench 评测中,PaddleOCR-VL-1.6 总指标达到 93.19%,较 Gemini-3-Pro 提升近 4 个百分点。
- PaddleOCR-VL-1.6 在 PaddleOCR-VL-1.5 基础上进一步升级,通过模型驱动的数据构建机制和渐进式训练优化,在保持 0.9B 轻量化架构的情况下,模型准确率和复杂场景适应能力进一步提升。
📊 文章信息
AI 初评:86
来源:量子位
作者:量子位的朋友们
分类:人工智能
语言:中文
阅读时间:4 分钟
字数:938
标签: PaddleOCR, 百度, 文心大模型, OCR, 文档解析