これは、エンドツーエンドのOCR大規模モデル分野で初めて完全オープンソースのトレーニング、推論、モデル重み付けを備えたエキスパートモデルです。 1Bパラメータだけで、8以上のテキスト中心のタスクをカバーしています。 DFlashの推測的復号フレームワークを導入し、トランスフォーマーで6.37×の加速、vLLMで2.14×の加速を実現し、エンドツーエンドの推論時間は1ページあたり1.408秒に達しました。 4K解像度と128Kコンテキストウィンドウをサポートし、Agentic Data Flowを通じて低リソースのOCR(331言語)、古代スクリプト認識、多画像Q&A機能を拡張します。 OmniDocBench v1.6では、94.74点でエンドツーエンドで1位にランクされました。
腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。
仅 1B 参数,覆盖 8 种以上 text-centric 任务。
引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。
支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。
在 OmniDocBench v1.6 上以 94.74 分居端到端第一。