Tencent Hunyuan ने HyOCR-1.5 जारी किया, जो पूरी तरह से ओपन सोर्स प्रशिक्षण, अनुमान और मॉडल वेटिंग के
लिए एंड-टू-एंड OCR बड़े मॉडल क्षेत्र में पहला विशेषज्ञ मॉडल है। केवल 1B मापदंडों के साथ, यह 8 से अधिक पाठ-केंद्रित कार्यों को कवर करता है। DFlash सट्टा डिकोडिंग फ्रेमवर्क पेश किया, ट्रांसफॉर्मर के तहत 6.37× त्वरण और vLLM के तहत 2.14× त्वरण प्राप्त किया, जिसमें एंड-टू-एंड अनुमान प्रति पृष्ठ 1.408 सेकंड तक पहुंच गया। 4K रिज़ॉल्यूशन और 128K संदर्भ विंडो का समर्थन करता है, और Agentic डेटा प्रवाह के माध्यम से कम-संसाधन OCR (331 भाषाएँ), प्राचीन स्क्रिप्ट पहचान और बहु-छवि Q&A क्षमताओं का विस्तार करता है। OmniDocBench v1.6 पर, यह 94.74 के स्कोर के साथ एंड-टू-एंड पहले स्थान पर रहा।
腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。
仅 1B 参数,覆盖 8 种以上 text-centric 任务。
引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。
支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。
在 OmniDocBench v1.6 上以 94.74 分居端到端第一。