أصدرت Tencent Hunyuan HyOCR-1.5، وهو أول نموذج خبير في مجال نماذج OCR الكبيرة من البداية إلى النهاية
يدعم التدريب مفتوح المصدر بالكامل، والاستدلال، ووزن النماذج. مع 1B معلمة فقط، تغطي أكثر من 8 مهام نصية. تم تقديم إطار فك الترميز التكهني DFlash، محققا تسارعا بنسبة 6.37× تحت المحولات وتسارع 2.14× تحت تقنية vLLM، مع استنتاج من طرف إلى طرف يصل إلى 1.408 ثانية لكل صفحة. يدعم دقة 4K ونوافذ سياق 128K، ويوسع إمكانيات OCR منخفضة الموارد (331 لغة)، والتعرف على السكريبتات القديمة، وإمكانية الأسئلة والأجوبة المتعددة من خلال تدفق البيانات الوكيلي. في OmniDocBench v1.6، احتل المركز الأول من البداية إلى النهاية بدرجة 94.74.
腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。
仅 1B 参数,覆盖 8 种以上 text-centric 任务。
引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。
支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。
在 OmniDocBench v1.6 上以 94.74 分居端到端第一。