挨踢牛魔王
26-07-14 16:15 微博认证:科技博主

腾讯开源了一个在消费级显卡上就能跑的HunyuanOCR-1.5,只有1B。
看来OCR是一个很重要的场景,大厂都投入精力在做,而且不需要太大参数。

项目简介:
HunyuanOCR-1.5是一款轻量级、端到端的专用OCR视觉语言模型。它针对一个 广泛的以文本为中心的视觉任务,统一文档解析、文本识别和信息 提取,单一文本-图像翻译 端到端VLM。

在经过验证的轻量化架构的 HunyuanOCR-1.0 基础上,HunyuanOCR-1.5 并未重新设计模型骨干。相反,它围绕两个目标进行系统性的升级—— 模型更快更好:

⚡ 更快——DFlash 推理加速。端到端OCR通常伴随着长时间的自回归解码,这成为主要的 密集文档、表格、公式及其他长结构化输出的瓶颈。 HunyuanOCR-1.5采用基于DFlash的推测-解码框架:轻量级 区块扩散草稿模型并行草拟多个候选令牌,然后对其进行验证 由目标模型一次性完成。这大大降低了长的解码延迟 结构化输出,同时保持目标模型的输出分布。

💻 通过llama.cpp进行PC端部署。🔧(正在开发中——准确性尚未确定)除了服务器级vLLM,HunyuanOCR-1.5还支持CPU/消费级GPU/笔记本部署 通过GGUF转换后的检查点llama.cpp 一个兼容OpenAI的。还提供了适配DFlash的分叉,因此 PC上也有同样的推测解码加速功能。请参见docs/llama_cpp.md。llama-serverllama.cpp

🧠 更好的——智能数据流+升级的训练配方。在数据方面,我们提出了代理数据流,一种由代理驱动的数据构建系统, 将模型弱点转化为可执行数据需求。代理人深度参与 材料搜索、基于工具的验证、样品清洗和数据流水线开发, 与算法工程师进行闭环迭代。在HunyuanOCR-1.5中,该系统用于 针对长尾功能,如低资源OCR、古文字OCR和多图像 以文本为中心的质量保证。 在训练方面,我们系统性地升级配方:预训练阶段3重新规划为 整合新生成的能力数据、多图像数据和历史OCR数据,且 最大图像分辨率扩展至4K,上下文窗口扩展至128K;培训后 精炼SFT数据,并进一步探索不同OCR任务中的强化学习,以放大从中获得的益处 强化学习。

整体而言,浑源OCR-1.5既实现了更快的推断速度和更广泛的OCR覆盖范围,又保留了轻量端端模型的部署优势。本仓库 开源了SFT / DFlash训练流水线和变换器/虚拟语言语言模型推理栈,因此 社区可以复制、微调和扩展专门的OCR专用VLM。

项目地址:github.com/Tencent-Hunyuan/HunyuanOCR

发布于 江苏