腾讯混元发布 HunyuanOCR-1.5:仅 1B 参数,OCR 推理速度提升 6.37 倍

腾讯混元正式发布轻量化端到端 OCR 专用视觉语言模型 HunyuanOCR-1.5。该模型规模仅为 1B 参数,围绕推理效率、复杂文档解析、低资源语言识别和本地部署等方向进行了系统升级。

HunyuanOCR-1.5 延续了上一版本的轻量化模型架构,没有重新设计模型主干,而是通过 DFlash 投机解码框架、Agentic Data Flow 智能体数据流以及新的训练方案,进一步提升 OCR 模型的处理速度和任务覆盖范围。

image.png

HunyuanOCR-1.5 是什么?

HunyuanOCR-1.5 是腾讯混元推出的一款端到端 OCR 视觉语言模型,主要用于处理以文字为中心的图像和文档任务。

与传统 OCR 系统需要分别调用文字检测、文字识别、版面分析和信息抽取模块不同,HunyuanOCR-1.5 可以在单一模型中完成:

文档解析
文字检测与识别
表格和公式解析
图表内容理解
关键信息抽取
图文翻译
多图文档理解
文字类视觉问答

Hugging Face 官方模型页面显示,HunyuanOCR-1.5 的模型规模为 1B 参数。较小的参数规模有助于降低显存、计算资源和部署成本,使其更适合企业内部系统、个人电脑及边缘设备等使用环境。

DFlash 投机解码:Transformer 推理提速 6.37 倍

端到端 OCR 在处理合同、论文、财务报表、表格和数学公式时,通常需要生成较长的结构化内容。传统自回归解码需要逐个生成 Token,在长文档场景下容易产生较高的推理延迟。

为解决这一问题,HunyuanOCR-1.5 引入了基于 DFlash 的投机解码方案。

DFlash 使用轻量级块扩散草稿模型,并行生成多个候选 Token,再由目标模型进行统一验证。该方式可以减少串行解码步骤,同时保持目标模型的输出分布不变。

根据 HunyuanOCR-1.5 技术论文披露的数据,在相关测试环境中:

Transformer 推理速度最高提升 6.37 倍
vLLM 环境下推理速度提升 2.14 倍
对稠密文档、表格和公式等长结构化输出任务的加速效果更加明显

这意味着开发者在处理大批量扫描文件、电子档案和复杂版式文档时,可以缩短等待时间,并提高 OCR 服务的并发处理能力。

Agentic Data Flow:用智能体完善训练数据

除了推理速度,HunyuanOCR-1.5 还加入了 Agentic Data Flow,即智能体驱动的数据构造系统。

该系统能够分析模型在实际任务中的不足,并将问题转化为可执行的数据需求。智能体可以参与素材检索、工具校验、样本清洗和数据流水线开发,再与算法工程师形成持续迭代流程。

这一方案主要用于增强模型在长尾 OCR 场景中的表现,包括:

古文字和历史文献识别
低资源语言文字识别
精细化图表与表格解析
多图片文字问答
文档幻觉评估
复杂版式内容提取

技术论文显示,HunyuanOCR-1.5 在 OmniDocBench v1.6 文档解析评测中进入端到端 OCR 模型的第一梯队,并在多项长尾任务中取得了新的性能进展。

支持 4K 图像与 128K 上下文

为了增强复杂文档处理能力,腾讯混元还调整了 HunyuanOCR-1.5 的预训练和后训练方案。

在预训练阶段,模型加入了新的能力数据、多图片数据和历史 OCR 数据。官方资料显示,其最大图像分辨率扩展至 4K,上下文窗口扩展至 128K

这些能力使模型更适合处理内容密集、页面较长或需要跨页理解的材料,例如:

学术论文与研究报告
合同和法律文件
财务报表与票据
产品说明书
历史档案
多页扫描文档
图表与公式混排页面

在后训练阶段,团队还优化了 SFT 数据,并针对不同 OCR 任务探索强化学习训练方案,以改善模型在特定场景中的稳定性和任务完成度。

开放训练、推理和模型资源

HunyuanOCR-1.5 已开放模型权重及相关工具。官方 GitHub 项目提供了完整的 SFT 和 DFlash 训练流水线,同时提供 Transformers、vLLM 和 llama.cpp 等推理方案。

开发者可以根据自身硬件环境选择不同的部署方式:

Transformers

适合模型测试、精度验证和原生 Hugging Face 推理。

vLLM

适合服务器部署、批量文档处理和 OpenAI 兼容 API 服务。其中,使用 DFlash 加速需要按照官方文档配置对应的 vLLM 环境。

llama.cpp

可用于 CPU、消费级 GPU 和笔记本电脑,并支持将模型转换为 GGUF 格式。不过,腾讯混元当前文档提示,PC 端 llama.cpp 路径的输出精度尚未与 vLLM、Transformers 完全对齐,现阶段更适合进行功能测试。

HunyuanOCR-1.5 可以应用在哪些场景?

凭借较小的模型规模、端到端处理方式和长文档能力,HunyuanOCR-1.5 可用于多种企业及个人应用。

企业文档数字化

将纸质合同、档案、申请表和业务单据转换为可检索、可编辑的结构化内容。

表格和财务数据提取

识别报表、发票、账单及复杂表格,并输出 HTML、Markdown 或其他结构化格式。

学术论文解析

提取论文中的正文、标题、公式、表格和参考信息,为知识库、检索系统及 AI 问答应用提供数据。

多语言内容识别

处理多语言或混合语言文档,并结合图文翻译能力完成文字提取和内容转换。

历史文献整理

应用于古籍、碑帖、手稿及历史档案的文字识别和数字化整理。

AI 知识库建设

把图片、PDF 和扫描件转换为结构化文本,为 RAG 知识库、企业搜索和智能客服系统提供数据基础。

轻量化 OCR 模型的实际价值

大型视觉语言模型通常具备较强的图像理解能力,但部署成本、推理延迟和硬件需求可能限制实际应用。

HunyuanOCR-1.5 将模型规模控制在 1B 参数,同时通过专门的 OCR 训练和 DFlash 推理加速提升处理效率。这种设计更关注真实部署条件,适合需要批量文档识别、私有化部署或本地运行的团队。

全套训练和推理资源的开放,也让开发者能够基于行业数据进行微调,构建面向金融、教育、制造、政务、出版和档案管理等领域的专用 OCR 系统。

总结

HunyuanOCR-1.5 是腾讯混元在轻量化端到端 OCR 方向推出的重要版本。

该模型仅有 1B 参数,通过 DFlash 投机解码实现最高 6.37 倍的 Transformer 推理加速,并利用 Agentic Data Flow 增强古文字识别、低资源语言解析、表格处理和多图文档理解能力。

对于需要进行文档数字化、结构化信息提取、AI 知识库建设或本地 OCR 部署的开发者而言,HunyuanOCR-1.5 提供了兼顾模型能力、运行效率和部署成本的新选择。

相关链接

© 版权声明

相关文章

暂无评论

none
暂无评论...