百度开源 Unlimited OCR,通过参考滑动窗口注意力(R-SWA)在一次前向推理中解析数十页文档,在 OmniDocBench 上超越 DeepSeek OCR,并引发核心作者来自 DeepSeek 的猜测。
📝 详细摘要
文章报道百度开源的 Unlimited OCR 模型,该模型以 DeepSeek OCR 为基线,通过将多头注意力替换为参考滑动窗口注意力(R-SWA),将输出侧 KV Cache 限制在固定窗口(默认 128 token),从而在解码阶段保持计算和显存开销恒定,实现真正的一次前向推理长程文档解析。实验显示,Unlimited OCR 在 OmniDocBench v1.5 上以 93.23%总分超越 DeepSeek OCR 6 个百分点,在 PPT、杂志等复杂版式上表现一致;长程实验中,处理 40+页文档的编辑距离低于 0.11,Distinct-35 约为 97%。文章还分析了 R-SWA 与 DeepSeek OCR 编码器 DeepEncoder 的互补关系,并基于技术报告风格、作者署名“YY”及 DeepSeek 人员离职动态,猜测核心作者可能来自 DeepSeek。
💡 主要观点
- Unlimited OCR 通过 R-SWA 将输出 KV cache 限制在固定窗口,解决长程解析的显存和延迟膨胀。 R-SWA 让模型始终关注视觉参考 token 和最近 128 个输出 token,模拟人类“软遗忘”的抄书过程,使解码计算开销不随输出长度增加。
💬 文章金句
- Unlimited OCR 并没有另起炉灶。恰恰相反,它直接构建在 DeepSeek OCR 的基础之上。
- 一个发生在编码端,一个发生在解码端。单独看,两者各自成立,放在一起看,却意外地连贯。
📊 文章信息
AI 初评:88
来源:机器之心
作者:机器之心
分类:人工智能
语言:中文
阅读时间:19 分钟
字数:4685
标签: OCR, 文档解析, 注意力机制, 长程推理, 开源项目