Tencent Hunyuan veröffentlichte HyOCR-1.5, das erste Expertenmodell im End-to-End-Bereich der
OCR-Großmodelle, das vollständig als Open Source, Training, Inferenz und Modellgewichtung dient. Mit nur 1B-Parametern deckt er mehr als 8 textzentrierte Aufgaben ab. Einführung des spekulativen Dekodierungsrahmens DFlash, das eine Beschleunigung von 6,37× unter Transformers und eine Beschleunigung von 2,14× unter vLLM erreicht, wobei die End-to-End-Inferenz 1,408 Sekunden pro Seite erreicht. Unterstützt 4K-Auflösung und 128K-Kontextfenster und erweitert ressourcenarme OCR (331 Sprachen), antike Skripterkennung und Multi-Image-Q&A-Funktionen durch Agentic Data Flow. Auf OmniDocBench v1.6 belegte es mit 94,74 den ersten Platz von End-to-End.
腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。
仅 1B 参数,覆盖 8 种以上 text-centric 任务。
引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。
支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。
在 OmniDocBench v1.6 上以 94.74 分居端到端第一。