Tencent Hunyuan เปิดตัว HyOCR-1.5 ซึ่งเป็นโมเดลผู้เชี่ยวชาญรุ่นแรกในฟิลด์โมเดลขนาดใหญ่ OCR แบบ
end-to-end สําหรับการฝึกอบรมโอเพ่นซอร์ส การอนุมาน และการถ่วงน้ําหนักโมเดลอย่างเต็มรูปแบบ ด้วยพารามิเตอร์เพียง 1B จึงครอบคลุมงานที่เน้นข้อความเป็นศูนย์กลางมากกว่า 8 งาน เปิดตัวเฟรมเวิร์กการถอดรหัสการเก็งกําไร DFlash โดยบรรลุการเร่งความเร็ว 6.37× ภายใต้ Transformers และการเร่งความเร็ว 2.14× ภายใต้ vLLM โดยมีการอนุมานแบบ end-to-end ถึง 1.408 วินาทีต่อหน้า รองรับความละเอียด 4K และหน้าต่างบริบท 128K และขยาย OCR ทรัพยากรต่ํา (331 ภาษา) การจดจําสคริปต์แบบโบราณ และความสามารถในการถามตอบแบบหลายภาพผ่าน Agentic Data Flow ใน OmniDocBench v1.6 อยู่ในอันดับแรกแบบ end-to-end ด้วยคะแนน 94.74
腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。
仅 1B 参数,覆盖 8 种以上 text-centric 任务。
引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。
支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。
在 OmniDocBench v1.6 上以 94.74 分居端到端第一。