Tencent Hunyuan lanzó HyOCR-1.5, el primer modelo experto en el campo de grandes modelos OCR de
extremo a extremo para entrenamiento, inferencia y ponderación de modelos completamente open source. Con solo 1B parámetros, cubre más de 8 tareas centradas en texto. Se introdujo el marco de decodificación especulativa DFLASH, logrando una aceleración del 6,37× bajo Transformers y del 2,14× bajo vLLM, con una inferencia de extremo a extremo que alcanzó 1,408 segundos por página. Soporta resolución 4K y ventanas contextuales de 128K, y amplía OCR de bajo recurso (331 idiomas), reconocimiento de escrituras antiguas y capacidades de preguntas y respuestas multiimagen mediante Flujo de Datos Agente. En OmniDocBench v1.6, se situó en primer lugar de ida a cara con una puntuación de 94,74.
腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。
仅 1B 参数,覆盖 8 种以上 text-centric 任务。
引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。
支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。
在 OmniDocBench v1.6 上以 94.74 分居端到端第一。
La fuente proporciona título, resumen, atribución y enlace original. Aioga no republica el artículo completo.