← 回總覽

百度开源无限 OCR,跑通长程解析,核心作者 YY 疑是来自 DeepSeek

📅 2026-06-23 15:20 机器之心 人工智能 2 分鐘 1574 字 評分: 88
OCR 文档解析 注意力机制 长程推理 开源项目
📌 一句话摘要 百度开源 Unlimited OCR,通过参考滑动窗口注意力(R-SWA)在一次前向推理中解析数十页文档,在 OmniDocBench 上超越 DeepSeek OCR,并引发核心作者来自 DeepSeek 的猜测。 📝 详细摘要 文章报道百度开源的 Unlimited OCR 模型,该模型以 DeepSeek OCR 为基线,通过将多头注意力替换为参考滑动窗口注意力(R-SWA),将输出侧 KV Cache 限制在固定窗口(默认 128 token),从而在解码阶段保持计算和显存开销恒定,实现真正的一次前向推理长程文档解析。实验显示,Unlimited OCR 在 Omn

📌 一句话摘要

百度开源 Unlimited OCR,通过参考滑动窗口注意力(R-SWA)在一次前向推理中解析数十页文档,在 OmniDocBench 上超越 DeepSeek OCR,并引发核心作者来自 DeepSeek 的猜测。

📝 详细摘要

文章报道百度开源的 Unlimited OCR 模型,该模型以 DeepSeek OCR 为基线,通过将多头注意力替换为参考滑动窗口注意力(R-SWA),将输出侧 KV Cache 限制在固定窗口(默认 128 token),从而在解码阶段保持计算和显存开销恒定,实现真正的一次前向推理长程文档解析。实验显示,Unlimited OCR 在 OmniDocBench v1.5 上以 93.23%总分超越 DeepSeek OCR 6 个百分点,在 PPT、杂志等复杂版式上表现一致;长程实验中,处理 40+页文档的编辑距离低于 0.11,Distinct-35 约为 97%。文章还分析了 R-SWA 与 DeepSeek OCR 编码器 DeepEncoder 的互补关系,并基于技术报告风格、作者署名“YY”及 DeepSeek 人员离职动态,猜测核心作者可能来自 DeepSeek。

💡 主要观点

- Unlimited OCR 通过 R-SWA 将输出 KV cache 限制在固定窗口,解决长程解析的显存和延迟膨胀。 R-SWA 让模型始终关注视觉参考 token 和最近 128 个输出 token,模拟人类“软遗忘”的抄书过程,使解码计算开销不随输出长度增加。

Unlimited OCR 在 OmniDocBench 上以 93.23%得分超越 DeepSeek OCR 6 个百分点,复杂版式表现一致。 在 PPT、报纸、杂志等测试中全面领先,表明 R-SWA 不仅适用于简单文本,也适用于复杂版式,且准确性未因窗口限制而下降。
模型基于 DeepSeek OCR 的 DeepEncoder 改造解码器,实现了不依赖外部调度器的真正连续解析。 直接构建在 DeepSeek OCR 上,专门解决解码端 KV cache 膨胀问题,而非分页处理或外部拼接,属于技术路线上编码端与解码端的互补。
技术报告风格和作者署名暗示核心作者可能来自 DeepSeek 团队。 报告对 DeepSeek OCR 引用达 40 次,风格激进且具有故事性,署名“YY”的 technical director 去向不明,结合 DeepSeek 人员离职动态,推测为同一团队。

💬 文章金句

- Unlimited OCR 并没有另起炉灶。恰恰相反,它直接构建在 DeepSeek OCR 的基础之上。

  • 一个发生在编码端,一个发生在解码端。单独看,两者各自成立,放在一起看,却意外地连贯。

📊 文章信息

AI 初评:88

来源:机器之心

作者:机器之心

分类:人工智能

语言:中文

阅读时间:19 分钟

字数:4685

标签: OCR, 文档解析, 注意力机制, 长程推理, 开源项目

阅读完整文章

查看原文 → 發佈: 2026-06-23 15:20:00 收錄: 2026-06-23 20:00:39

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。