← 回總覽

百度文心发布 PaddleOCR-VL-1.6:准确率突破 96.33%,刷新文档解析 SOTA

📅 2026-06-02 15:47 量子位的朋友们 人工智能 2 分鐘 1490 字 評分: 86
PaddleOCR 百度 文心大模型 OCR 文档解析
📌 一句话摘要 百度发布 PaddleOCR-VL-1.6,在 OmniDocBench v1.6 评测中准确率达 96.33%,超越 GPT-5.2 和 Gemini-3-Pro,刷新文档解析 SOTA。 📝 详细摘要 百度正式发布 PaddleOCR-VL-1.6,这是基于文心大模型训练的 OCR 模型的最新版本。该模型在 OmniDocBench v1.6 权威评测中总指标达到 96.33%,超越 Gemini-3-Pro、GPT-5.2、MinerU-2.5-Pro 等主流方案,综合性能全球第一。在面向真实复杂场景的 Real5-OmniDocBench 评测中,准确率达 93.1

📌 一句话摘要

百度发布 PaddleOCR-VL-1.6,在 OmniDocBench v1.6 评测中准确率达 96.33%,超越 GPT-5.2 和 Gemini-3-Pro,刷新文档解析 SOTA。

📝 详细摘要

百度正式发布 PaddleOCR-VL-1.6,这是基于文心大模型训练的 OCR 模型的最新版本。该模型在 OmniDocBench v1.6 权威评测中总指标达到 96.33%,超越 Gemini-3-Pro、GPT-5.2、MinerU-2.5-Pro 等主流方案,综合性能全球第一。在面向真实复杂场景的 Real5-OmniDocBench 评测中,准确率达 93.19%,较 Gemini-3-Pro 提升近 4 个百分点。PaddleOCR-VL-1.6 在文本、公式、表格等核心识别能力上全面领先,在表格、古籍、生僻字识别等复杂场景能力显著提升。模型采用 0.9B 轻量化架构,与上一代模型结构一致,开发者可平滑迁移。目前模型已开源至 GitHub 和 Hugging Face,支持网页端和 API 调用。

💡 主要观点

- PaddleOCR-VL-1.6 在 OmniDocBench v1.6 评测中准确率达 96.33%,超越 GPT-5.2 和 Gemini-3-Pro。 该模型在权威评测中综合性能全球第一,在文本、公式、表格等核心识别能力上全面领先当前主流开源及闭源方案。

模型采用 0.9B 轻量化架构,与上一代结构一致,支持平滑迁移。 通过模型驱动的数据构建机制和渐进式训练优化,在保持轻量化架构的同时提升了准确率和复杂场景适应能力,开发者无需额外适配。
PaddleOCR-VL-1.6 已全面开源,支持网页端和 API 调用。 模型代码及权重已同步开源至 GitHub 和 Hugging Face,面向全球开发者开放使用,降低了文档数字化技术的使用门槛。

💬 文章金句

- PaddleOCR-VL-1.6 在 OmniDocBench v1.6 权威评测中准确率突破 96.3%,综合性能全球第一,刷新业界 SOTA。

  • 在面向真实复杂场景构建的 Real5-OmniDocBench 评测中,PaddleOCR-VL-1.6 总指标达到 93.19%,较 Gemini-3-Pro 提升近 4 个百分点。
  • PaddleOCR-VL-1.6 在 PaddleOCR-VL-1.5 基础上进一步升级,通过模型驱动的数据构建机制和渐进式训练优化,在保持 0.9B 轻量化架构的情况下,模型准确率和复杂场景适应能力进一步提升。

📊 文章信息

AI 初评:86

来源:量子位

作者:量子位的朋友们

分类:人工智能

语言:中文

阅读时间:4 分钟

字数:938

标签: PaddleOCR, 百度, 文心大模型, OCR, 文档解析

阅读完整文章

查看原文 → 發佈: 2026-06-02 15:47:30 收錄: 2026-06-02 20:00:49

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。