Tencent Hunyuan, uçtan uca OCR büyük model alanında tamamen açık kaynak eğitim, çıkarım ve model
ağırlıklandırma sunan ilk uzman model olan HyOCR-1.5'i piyasaya sürdü. Sadece 1B parametreyle, 8'den fazla metin odaklı görevi kapsar. DFlash spekülatif kod çözme çerçevesini tanıttı; Transformers ile 6.37× hızlanma, vLLM'de ise 2.14× hızlanma elde etti ve uçtan uca çıkarım sayfa başına 1.408 saniyeye ulaştı. 4K çözünürlük ve 128K bağlam pencerelerini destekler, düşük kaynaklı OCR (331 dil), eski script tanıma ve çok görüntülü Soru-Cevap yeteneklerini Ajanic Data Flow ile genişletir. OmniDocBench v1.6'da uçtan uca 94.74 puanla birinci oldu.
腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。
仅 1B 参数,覆盖 8 种以上 text-centric 任务。
引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。
支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。
在 OmniDocBench v1.6 上以 94.74 分居端到端第一。