【百度Unlimited-OCR:长文档解析的“暴力美学”】百度正式开源3B规模的Unlimited-OCR,主打单次处理超长、高分辨率的文档解析。它在DeepSeek-OCR基础上更进一步,支持32768个Token的上下文,能一口气吞下整份PDF并保持结构完整。模型提供了针对高精度和通用场景的不同模式,且已深度适配vLLM与SGLang推理框架。目前的AI文档处理正从“认字”转向“理解”,百度选择在长序列解析上发力,底层逻辑是利用Transformer的大窗口优势解决跨页布局和复杂排版的连贯性痛点。对用户而言,这弥补了开源界在超长文档一键解析上的空白,标志着文档数字化不再依赖繁琐的切图拼接逻辑,而是向更具全局观的端到端方案进化,处理复杂财报或法律文件将变得极度丝滑。 huggingface.co/baidu/Unlimited-OCR
发布于 北京
