텐센트 훈위안은 완전 오픈 소스 학습, 추론, 모델 가중치를 갖춘 엔드 투 엔드 OCR 대형 모델 분야에서 최초의 전문가 모델인 HyOCR-1.5를 출시했습니다. 1B
매개변수만으로 8개 이상의 텍스트 중심 작업을 다룹니다. DFlash 추측적 디코딩 프레임워크를 도입하여 트랜스포머에서 6.37× 가속, vLLM에서 2.14× 가속을 달성했으며, 종단 간 추론은 페이지당 1.408초에 달합니다. 4K 해상도와 128K 컨텍스트 창을 지원하며, 에이전트 데이터 플로우를 통해 낮은 자원의 OCR(331개 언어), 고대 스크립트 인식, 다중 이미지 Q&A 기능을 확장합니다. OmniDocBench v1.6에서는 94.74점으로 엔드 투 엔드 1위를 차지했습니다.
腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。
仅 1B 参数,覆盖 8 种以上 text-centric 任务。
引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。
支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。
在 OmniDocBench v1.6 上以 94.74 分居端到端第一。
수집 피드는 제목, 요약, 출처와 원문 링크를 제공합니다. Aioga는 원문 전체를 재게시하지 않습니다.