一个工程视角的对照挺有意思:DeepSeek-OCR 解的是"输入端"——视觉 token 把长上下文压扁;百度刚放出来的 Unlimited-OCR 解的是"输出端"——decoder 的 KV cache 不再累积。两边凑齐,长文档端到端 OCR 这条链路才算闭环。
核心招式叫 R-SWA(Reference Sliding Window Attention),把 decoder 全部 attention 换成带 reference 的滑窗,整个解码过程 KV cache 保持常数。号称单次 forward 转录几十页(32K max)。
🔍 推理代码里有个隐藏细节:默认就硬写了 no_repeat_ngram_size=35 配 ngram_window=128。做过长 OCR 的一看就懂,这是防"死循环复读"打的补丁。模型在某段重复表格或连续字符上一旦崩进 hallucination loop,没这俩参数根本停不下来。能正大光明写进默认配置,说明团队是真踩过坑。
⚠️ 但论文里那句"R-SWA 通用,OCR 之外 ASR、翻译都能用"我保留意见。OCR、ASR 是强对齐任务,输入输出顺序基本一致,滑窗当然吃得开;翻译跨语序,中文动词跑到句末、英文在句首,固定窗口怎么 cover 长距离依赖?等他们补个翻译 benchmark 再说。 baidu·Unlimited-OCR
发布于 日本
