Tencent Hunyuan đã phát hành HyOCR-1.5, mô hình chuyên gia đầu tiên trong lĩnh vực mô hình lớn OCR
đầu cuối để đào tạo, suy luận và trọng số mô hình mã nguồn mở hoàn toàn. Chỉ với 1 tỷ tham số, nó bao gồm hơn 8 tác vụ tập trung vào văn bản. Giới thiệu khung giải mã suy đoán DFlash, đạt được gia tốc 6,37× trong Transformers và tăng tốc 2,14× trong vLLM, với suy luận đầu cuối đạt 1,408 giây mỗi trang. Hỗ trợ độ phân giải 4K và cửa sổ ngữ cảnh 128K, đồng thời mở rộng khả năng OCR tài nguyên thấp (331 ngôn ngữ), nhận dạng tập lệnh cũ và khả năng hỏi đáp nhiều hình ảnh thông qua Luồng dữ liệu tác nhân. Trên OmniDocBench v1.6, nó xếp hạng đầu tiên từ đầu đến cuối với số điểm 94.74.
腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。
仅 1B 参数,覆盖 8 种以上 text-centric 任务。
引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。
支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。
在 OmniDocBench v1.6 上以 94.74 分居端到端第一。