Tencent Hunyuan a publié HyOCR-1.5, le premier modèle expert dans le domaine des grands modèles OCR
de bout en bout pour l’entraînement, l’inférence et la pondération des modèles entièrement open source. Avec seulement 1B de paramètres, il couvre plus de 8 tâches centrées sur le texte. Introduction du cadre de décodage spéculatif DFlash, atteignant une accélération de 6,37 × sous Transformers et une accélération de 2,14 × sous vLLM, avec une inférence de bout en bout atteignant 1,408 seconde par page. Prend en charge la résolution 4K et les fenêtres contextuelles 128K, et étend l’OCR à faible ressources (331 langues), la reconnaissance des anciens scripts et les capacités de questions-réponses multi-images via Agentic Data Flow. Sur OmniDocBench v1.6, il s’est classé premier d’un bout à l’autre avec un score de 94,74.
腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。
仅 1B 参数,覆盖 8 种以上 text-centric 任务。
引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。
支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。
在 OmniDocBench v1.6 上以 94.74 分居端到端第一。
La source fournit un titre, un résumé, une attribution et un lien original. Aioga ne republie pas l’article intégral.