{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-07-28T06:20:51.496Z","headline":"用百度 Unlimited-OCR 构建端到端高分辨率图像与多页 PDF 解析管线","description":"本教程构建了一套完整的 OCR 工作流，在 GPU 上加载百度 3B 参数的 Unlimited-OCR 视觉语言模型，支持 bfloat16/float16 自动选择。管线包含两种推理模式：Gundam 模式（分块高细节）和 Base 模式（单视图更快），并通过 PyMuPDF 和 infer_multi（） 扩展至多页 PDF 解析，全程保留长上下文生成、重复控制和结构化输出设置。","url":"https://www.aioga.com/news/cmryhzfdj01hjrolghw239asv/","mainEntityOfPage":"https://www.aioga.com/news/cmryhzfdj01hjrolghw239asv/","datePublished":"2026-07-24T05:16:28.000Z","dateModified":"2026-07-24T05:16:28.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://www.marktechpost.com/2026/07/23/how-to-build-an-end-to-end-ocr-pipeline-with-baidus-unlimited-ocr-for-high-resolution-images-and-multi-page-pdf-parsing","https://aihot.virxact.com/items/cmryhzfdj01hjrolghw239asv"],"canonicalUrl":"https://www.aioga.com/news/cmryhzfdj01hjrolghw239asv/","directAnswer":{"@type":"Answer","text":"教程展示在 GPU 环境加载百度 3B 参数 Unlimited-OCR 视觉语言模型，并自动选择 bfloat16 或 float16。工作流覆盖高分辨率单页图像、多页 PDF、两种推理模式及文本、Markdown、MMD、JSON 等结构化结果检查。","url":"https://www.aioga.com/news/cmryhzfdj01hjrolghw239asv/","dateCreated":"2026-07-24T05:16:28.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"marktechpost.com source article","url":"https://www.marktechpost.com/2026/07/23/how-to-build-an-end-to-end-ocr-pipeline-with-baidus-unlimited-ocr-for-high-resolution-images-and-multi-page-pdf-parsing","datePublished":"2026-07-24T05:16:28.000Z","provider":{"@type":"Organization","name":"marktechpost.com","url":"https://www.marktechpost.com/2026/07/23/how-to-build-an-end-to-end-ocr-pipeline-with-baidus-unlimited-ocr-for-high-resolution-images-and-multi-page-pdf-parsing"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmryhzfdj01hjrolghw239asv","datePublished":"2026-07-24T05:16:28.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmryhzfdj01hjrolghw239asv"}}],"aggregationSource":"MarkTechPost（RSS）","originalPublisher":{"name":"marktechpost.com","url":"https://www.marktechpost.com/2026/07/23/how-to-build-an-end-to-end-ocr-pipeline-with-baidus-unlimited-ocr-for-high-resolution-images-and-multi-page-pdf-parsing"},"article":{"id":"cmryhzfdj01hjrolghw239asv","slug":"cmryhzfdj01hjrolghw239asv","url":"https://www.aioga.com/news/cmryhzfdj01hjrolghw239asv/","title":"用百度 Unlimited-OCR 构建端到端高分辨率图像与多页 PDF 解析管线","title_en":"How to Build an End-to-End OCR Pipeline with Baidu's Unlimited-OCR for High-Resolution Images and Multi-Page PDF Parsing","summary":"本教程构建了一套完整的 OCR 工作流，在 GPU 上加载百度 3B 参数的 Unlimited-OCR 视觉语言模型，支持 bfloat16/float16 自动选择。管线包含两种推理模式：Gundam 模式（分块高细节）和 Base 模式（单视图更快），并通过 PyMuPDF 和 infer_multi（） 扩展至多页 PDF 解析，全程保留长上下文生成、重复控制和结构化输出设置。","source":"MarkTechPost（RSS）","sourceUrl":"https://www.marktechpost.com/2026/07/23/how-to-build-an-end-to-end-ocr-pipeline-with-baidus-unlimited-ocr-for-high-resolution-images-and-multi-page-pdf-parsing","aiHotUrl":"https://aihot.virxact.com/items/cmryhzfdj01hjrolghw239asv","publishedAt":"2026-07-24T05:16:28.000Z","category":"技巧观点","score":65,"selected":false,"articleBody":["In this tutorial, we build a complete workflow for running Baidu’s Unlimited-OCR ：https://huggingface.co/baidu/Unlimited-OCR model on document images and multi-page PDFs. We configure the GPU environment, install the required dependencies, load the 3B-parameter vision-language model with automatic selection of bfloat16 or float16, and generate structured sample documents for testing. We then evaluate both the tiled Gundam inference mode and the faster Base mode for single-page OCR before extending the pipeline to multi-page PDF parsing with PyMuPDF and infer_multi(). Throughout the workflow, we preserve long-context generation settings, repetition controls, and structured output handling to process dense layouts, tables, paragraphs, and cross-page content in a reproducible end-to-end pipeline.","We install the required libraries and prepare the Google Colab environment for Unlimited-OCR inference. We verify that a CUDA-enabled GPU is available and automatically choose bfloat16 or float16 based on hardware support. We then load the tokenizer and the 3B-parameter model from Hugging Face, switch them to evaluation mode, and move them to the GPU.","We create the required input and output directories and generate three realistic sample document pages with PIL. We add headings, paragraphs, tables, and footnotes to test the model on structured, layout-rich content. We also preview the first generated page with Matplotlib before sending it to the OCR pipeline.","We run single-image OCR using Gundam mode, which combines a global document view with tiled image crops. We enable crop_mode and use a smaller tile size to preserve fine text and improve recognition on dense document layouts. We also configure long-output generation and repetition controls to ensure the model produces stable, structured results.","We process the same document using Base mode with a single 1024-pixel image view. We turn off image cropping to reduce inference complexity and improve processing speed for clean, clearly printed pages. We retain the same output length and repetition-control settings to directly compare Base mode with Gundam mode.","We create a three-page PDF from the generated document images and rasterize each page of the PDF into a high-resolution PNG using PyMuPDF. We pass the resulting page-image sequence to infer_multi() so that the model can parse the complete document in a single long-horizon inference operation. We also widen the n-gram repetition window to maintain stable decoding across multiple pages.","We inspect the output directories created by the single-page and multi-page inference runs. We list every generated file and display previews of supported text, Markdown, MMD, and JSON artifacts. We conclude the workflow with a concise reference summarizing the recommended inference modes for dense images, clean pages, and multi-page PDFs.","In conclusion, we completed a practical OCR pipeline that handles both high-detail single-page documents and long multi-page PDFs within Google Colab. We compared Gundam and Base inference modes, rasterized PDFs into model-ready page images, ran long-horizon document parsing, and inspected the generated text, Markdown, and auxiliary artifacts directly from the output directories. We also configured the workflow to adapt to different GPU capabilities while retaining the generation parameters required for stable long-document decoding. It provides us with a reusable foundation for applying Unlimited-OCR to reports, scanned forms, technical documents, tables, and other layout-rich content without relying on a separate traditional OCR and layout-analysis stack.","Need to partner with us for promoting your GitHub Repo OR Hugging Face Page OR Product Release OR Webinar etc.? Connect with us ：https://forms.gle/wbash1wF6efRj8G58","Sana Hassan, a consulting intern at Marktechpost and dual-degree student at IIT Madras, is passionate about applying technology and AI to address real-world challenges. With a keen interest in solving practical problems, he brings a fresh perspective to the intersection of AI and real-life solutions."],"articleImages":[{"sourceUrl":"https://www.marktechpost.com/wp-content/uploads/2026/07/blog6171-1-100x70.png","alt":"Designing High-Performance GPU Kernels with TileLang: Tensor-Core GEMM, Fused Softmax, FlashAttention, and Autotuning","afterParagraph":9,"url":"/media/articles/cmryhzfdj01hjrolghw239asv/80925b48ffa65ad2.webp"}],"mediaStatus":"ok","articleBodyZh":["在本教程中，我们构建了一个完整的工作流程，用于在文档图像和多页 PDF 上运行百度的 Unlimited-OCR：https://huggingface.co/baidu/Unlimited-OCR 模型。我们配置 GPU 环境，安装所需的依赖项，加载 3B 参数的视觉-语言模型，自动选择 bfloat16 或 float16，并生成结构化的示例文档用于测试。然后，我们评估单页 OCR 的瓦片 Gundam 推理模式和更快速的 Base 模式，再将管道扩展到使用 PyMuPDF 和 infer_multi() 解析多页 PDF。在整个工作流程中，我们保留长上下文生成设置、重复控制和结构化输出处理，以在可复现的端到端管道中处理密集布局、表格、段落和跨页内容。","我们安装所需的库，并为 Unlimited-OCR 推理准备 Google Colab 环境。我们验证是否有支持 CUDA 的 GPU 可用，并根据硬件支持自动选择 bfloat16 或 float16。然后，我们从 Hugging Face 加载分词器和 3B 参数模型，将它们切换到评估模式，并移动到 GPU。","我们创建所需的输入和输出目录，并使用 PIL 生成三个真实的示例文档页面。我们添加标题、段落、表格和脚注，以测试模型在结构化、布局丰富的内容上的表现。在将文档发送到 OCR 管道之前，我们还用 Matplotlib 预览了生成的第一页。","我们使用 Gundam 模式运行单图像 OCR，该模式结合了全局文档视图和瓦片图像裁剪。我们启用 crop_mode 并使用较小的瓦片尺寸，以保留细小文本并提高密集文档布局的识别效果。我们还配置了长输出生成和重复控制，以确保模型生成稳定的结构化结果。","我们使用 Base 模式以单个 1024 像素图像视图处理相同文档。我们关闭图像裁剪，以降低推理复杂度并提高处理速度，适用于干净、打印清晰的页面。我们保留相同的输出长度和重复控制设置，以便直接比较 Base 模式和 Gundam 模式。","我们使用生成的文档图像创建一个三页的 PDF，并使用 PyMuPDF 将 PDF 的每一页栅格化为高分辨率 PNG。然后我们将生成的页面图像序列传递给 infer_multi()，以便模型可以在一次长时程推理操作中解析完整文档。我们还扩大了 n-gram 重复窗口，以在多页之间保持稳定的解码。","我们检查由单页和多页推理运行创建的输出目录。我们列出每个生成的文件，并显示支持的文本、Markdown、MMD 和 JSON 文件的预览。我们以一个简明的参考总结工作流程，推荐针对密集图像、干净页面和多页 PDF 的推理模式。","总之，我们完成了一个实用的 OCR 流程，能够处理高细节的单页文档和长多页 PDF，并在 Google Colab 中运行。我们比较了 Gundam 和 Base 推理模式，将 PDF 栅格化为模型可用的页面图像，执行长时程文档解析，并直接从输出目录检查生成的文本、Markdown 和辅助文件。我们还配置了工作流程，使其能够适应不同的 GPU 功能，同时保留稳定长文档解码所需的生成参数。它为我们提供了一个可重复使用的基础，使 Unlimited-OCR 能够应用于报告、扫描表格、技术文档、表格及其他布局丰富的内容，而无需依赖单独的传统 OCR 和布局分析栈。","需要与我们合作推广您的 GitHub 仓库 OR Hugging Face 页面 OR 产品发布 OR 网络研讨会等吗？请联系： https://forms.gle/wbash1wF6efRj8G58","Sana Hassan 是 Marktechpost 的咨询实习生，同时也是 IIT Madras 的双学位学生，他热衷于将技术和 AI 应用于解决现实世界问题。凭借对解决实际问题的浓厚兴趣，他为 AI 与现实生活解决方案的交汇点带来了新的视角。"],"translationStatus":"translated","bodyOrigin":"source-page","editorial":{"summary":"教程展示在 GPU 环境加载百度 3B 参数 Unlimited-OCR 视觉语言模型，并自动选择 bfloat16 或 float16。工作流覆盖高分辨率单页图像、多页 PDF、两种推理模式及文本、Markdown、MMD、JSON 等结构化结果检查。","background":"示例在 Google Colab 中安装依赖并确认 CUDA GPU，使用 PIL 生成含标题、段落、表格和脚注的三页测试文档。随后通过 PyMuPDF 将 PDF 页面栅格化为高分辨率 PNG，再交由 infer_multi() 处理。","viewpoint":"Aioga 判断，这份教程的重点不是单项识别指标，而是把环境配置、模型加载、页面预处理、单页与多页推理、重复控制和结果检查串成可复现流程。材料未提供准确率、速度或资源消耗数据，因此不能据此断言性能优势。","implications":"Gundam 模式结合全局视图与分块裁剪，面向密集版式和细小文字；Base 模式使用单个 1024 像素视图，关闭裁剪以降低推理复杂度，适合清晰印刷页面。多页方案则通过页面序列与长上下文设置处理跨页内容。","nextStep":"值得关注的是在真实扫描件、复杂表格和长篇 PDF 上补充可核验测试，包括识别质量、处理耗时、显存占用及结构化输出一致性。采用者也应分别比较 Gundam 与 Base 模式，并检查多页解码中的重复和跨页内容稳定性。","evidenceRefs":["title","summary","articleBody","source"],"status":"published","aiGenerated":true,"autoApproved":true,"generatedBy":"aioga-editorial:gpt-5.6-sol","reviewedBy":"aioga-editorial-review:gpt-5.6-sol","generatedAt":"2026-07-28T03:11:21.350Z","sourceHash":"5016e2e80208b13b","review":{"approved":true,"groundedness":97,"clarity":93,"duplicationRisk":18,"blockingIssues":[],"notes":["“Aioga 判断”明确标示为观点，且关于材料未提供准确率、速度或资源消耗数据的表述符合来源内容，不构成无来源事实断言。","nextStep 中的真实场景测试与模式比较属于合理建议，而非对现有性能的事实宣称。","可选措辞优化：文本本身不一定属于“结构化结果”，可将“文本、Markdown、MMD、JSON 等结构化结果”改为“文本、Markdown、MMD、JSON 等输出结果”，但不影响审核通过。"]},"validation":{"passed":true,"mode":"ai-auto","revisions":0,"checks":["schema","length","source-attribution","low-source-overlap","no-html","independent-ai-review"]}},"tags":["技巧观点","MarkTechPost（RSS）"],"translations":{"zh-CN":{"title":"用百度 Unlimited-OCR 构建端到端高分辨率图像与多页 PDF 解析管线","summary":"本教程构建了一套完整的 OCR 工作流，在 GPU 上加载百度 3B 参数的 Unlimited-OCR 视觉语言模型，支持 bfloat16/float16 自动选择。管线包含两种推理模式：Gundam 模式（分块高细节）和 Base 模式（单视图更快），并通过 PyMuPDF 和 infer_multi（） 扩展至多页 PDF 解析，全程保留长上下文生成、重复控制和结构化输出设置。","category":"技巧观点","source":"marktechpost.com","aggregationSource":"MarkTechPost（RSS）","pageTitle":"用百度 Unlimited-OCR 构建端到端高分辨率图像与多页 PDF 解析管线 - Aioga AI资讯","description":"本教程构建了一套完整的 OCR 工作流，在 GPU 上加载百度 3B 参数的 Unlimited-OCR 视觉语言模型，支持 bfloat16/float16 自动选择。管线包含两种推理模式：Gundam 模式（分块高细节）和 Base 模式（单视图更快），并通过 PyMuPDF 和 infer_multi（） 扩展至多页 PDF 解析，全程保留长上下文生成...","url":"https://www.aioga.com/news/cmryhzfdj01hjrolghw239asv/"},"en":{"title":"Building an End-to-End High-Resolution Image and Multi-Page PDF Parsing Pipeline with Baidu Unlimited-OCR","summary":"This tutorial builds a complete OCR workflow, loading Baidu's 3B-parameter Unlimited-OCR vision-language model on a GPU, supporting automatic selection between bfloat16/float16. The pipeline includes two inference modes: Gundam mode (block-wise high detail) and Base mode (single view faster), and extends to multi-page PDF parsing through PyMuPDF and infer_multi(), retaining long-context generation, duplication control, and structured output settings throughout.","category":"Insights","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Building an End-to-End High-Resolution Image and Multi-Page PDF Parsing Pipeline with Baidu Unlimited-OCR - Aioga AI News","description":"This tutorial builds a complete OCR workflow, loading Baidu's 3B-parameter Unlimited-OCR vision-language model on a GPU, supporting automatic selection between bfloat16/float16. Th...","url":"https://www.aioga.com/en/news/cmryhzfdj01hjrolghw239asv/","contentTranslated":true,"sourceHash":"2d90b18030e272f0","translatedAt":"2026-07-26T06:04:03.611Z"},"ja":{"title":"Baidu Unlimited-OCR を用いてエンドツーエンドの高解像度画像および複数ページ PDF 解析パイプラインを構築する","summary":"このチュートリアルは、GPU 上で百度の 3B パラメータを持つ Unlimited-OCR ビジュアル言語モデルをロードする完全な OCR ワークフローを構築し、bfloat16/float16 の自動選択をサポートします。パイプラインには 2 つの推論モードが含まれています：Gundam モード（分割高精細）と Base モード（単一ビューでより高速）であり、PyMuPDF と infer_multi（） を通じて複数ページ PDF の解析に拡張されます。長いコンテキスト生成、重複制御、および構造化出力の設定は全過程で保持されます。","category":"ヒントと視点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Baidu Unlimited-OCR を用いてエンドツーエンドの高解像度画像および複数ページ PDF 解析パイプラインを構築する - Aioga AIニュース","description":"このチュートリアルは、GPU 上で百度の 3B パラメータを持つ Unlimited-OCR ビジュアル言語モデルをロードする完全な OCR ワークフローを構築し、bfloat16/float16 の自動選択をサポートします。パイプラインには 2 つの推論モードが含まれています：Gundam モード（分割高精細）と Base モード（単一ビューでより高速）で...","url":"https://www.aioga.com/ja/news/cmryhzfdj01hjrolghw239asv/","contentTranslated":true,"sourceHash":"2d90b18030e272f0","translatedAt":"2026-07-26T06:04:19.498Z"},"ko":{"title":"바이두 Unlimited-OCR로 엔드투엔드 고해상도 이미지 및 다중 페이지 PDF 파싱 파이프라인 구축","summary":"이 튜토리얼은 GPU에서 바이두 3B 파라미터의 Unlimited-OCR 시각 언어 모델을 로드하여 완전한 OCR 워크플로를 구축하며, bfloat16/float16 자동 선택을 지원합니다. 파이프라인에는 두 가지 추론 모드가 포함되어 있습니다: Gundam 모드(블록 단위 고세부)와 Base 모드(단일 뷰 더 빠름)이며, PyMuPDF와 infer_multi()를 통해 다중 페이지 PDF 분석까지 확장하며, 전체 과정에서 긴 컨텍스트 생성, 중복 제어 및 구조화된 출력 설정을 유지합니다.","category":"인사이트","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"바이두 Unlimited-OCR로 엔드투엔드 고해상도 이미지 및 다중 페이지 PDF 파싱 파이프라인 구축 - Aioga AI 뉴스","description":"이 튜토리얼은 GPU에서 바이두 3B 파라미터의 Unlimited-OCR 시각 언어 모델을 로드하여 완전한 OCR 워크플로를 구축하며, bfloat16/float16 자동 선택을 지원합니다. 파이프라인에는 두 가지 추론 모드가 포함되어 있습니다: Gundam 모드(블록 단위 고세부)와 Base 모드(단일 뷰 더 빠름)이며...","url":"https://www.aioga.com/ko/news/cmryhzfdj01hjrolghw239asv/","contentTranslated":true,"sourceHash":"2d90b18030e272f0","translatedAt":"2026-07-26T06:05:02.285Z"},"es":{"title":"Construir una canalización de análisis de imágenes de alta resolución y PDF de varias páginas de extremo a extremo con Baidu Unlimited-OCR","summary":"Este tutorial construye un flujo de trabajo completo de OCR, cargando en GPU el modelo de lenguaje visual Unlimited-OCR de Baidu con 3B parámetros, compatible con selección automática entre bfloat16/float16. La tubería incluye dos modos de inferencia: modo Gundam (detalles altos por bloques) y modo Base (vista única más rápida), y se extiende al análisis de PDF de múltiples páginas mediante PyMuPDF e infer_multi(), conservando durante todo el proceso la generación de contexto largo, control de repetición y configuración de salida estructurada.","category":"Ideas","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Construir una canalización de análisis de imágenes de alta resolución y PDF de varias páginas de extremo a extremo con Baidu Unlimited-OCR - Aioga Noticias de IA","description":"Este tutorial construye un flujo de trabajo completo de OCR, cargando en GPU el modelo de lenguaje visual Unlimited-OCR de Baidu con 3B parámetros, compatible con selección automát...","url":"https://www.aioga.com/es/news/cmryhzfdj01hjrolghw239asv/","contentTranslated":true,"sourceHash":"2d90b18030e272f0","translatedAt":"2026-07-26T06:04:55.009Z"},"fr":{"title":"Construire un pipeline de parsing d'images haute résolution et de PDF multi-pages de bout en bout avec Baidu Unlimited-OCR","summary":"Ce tutoriel a construit un flux de travail OCR complet, chargeant sur GPU le modèle de vision-langage Unlimited-OCR de Baidu avec 3 milliards de paramètres, prenant en charge la sélection automatique entre bfloat16 et float16. Le pipeline comprend deux modes d'inférence : le mode Gundam (détails élevés par blocs) et le mode Base (vue unique plus rapide), et est étendu à l'analyse de PDF multi-pages via PyMuPDF et infer_multi(), en conservant tout au long le contexte long pour la génération, le contrôle des répétitions et les paramètres de sortie structurée.","category":"Analyses","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Construire un pipeline de parsing d'images haute résolution et de PDF multi-pages de bout en bout avec Baidu Unlimited-OCR - Aioga Actualités IA","description":"Ce tutoriel a construit un flux de travail OCR complet, chargeant sur GPU le modèle de vision-langage Unlimited-OCR de Baidu avec 3 milliards de paramètres, prenant en charge la sé...","url":"https://www.aioga.com/fr/news/cmryhzfdj01hjrolghw239asv/","contentTranslated":true,"sourceHash":"2d90b18030e272f0","translatedAt":"2026-07-26T06:05:45.461Z"},"de":{"title":"Mit Baidu Unlimited-OCR eine End-to-End-Pipeline zur Analyse hochauflösender Bilder und mehrseitiger PDFs erstellen","summary":"Dieses Tutorial entwickelt einen vollständigen OCR-Arbeitsablauf, lädt das Unlimited-OCR-Visuell-Sprachmodell von Baidu mit 3B Parametern auf der GPU und unterstützt die automatische Auswahl von bfloat16/float16. Die Pipeline enthält zwei Inferenzmodi: Gundam-Modus (Blockweise, hohe Details) und Basis-Modus (einzelne Ansicht, schneller), und wird durch PyMuPDF und infer_multi() für die Analyse mehrseitiger PDFs erweitert, wobei durchgehend die Erzeugung langer Kontexte, Duplikationskontrolle und strukturierte Ausgabe-Einstellungen beibehalten werden.","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Mit Baidu Unlimited-OCR eine End-to-End-Pipeline zur Analyse hochauflösender Bilder und mehrseitiger PDFs erstellen - Aioga KI-News","description":"Dieses Tutorial entwickelt einen vollständigen OCR-Arbeitsablauf, lädt das Unlimited-OCR-Visuell-Sprachmodell von Baidu mit 3B Parametern auf der GPU und unterstützt die automatisc...","url":"https://www.aioga.com/de/news/cmryhzfdj01hjrolghw239asv/","contentTranslated":true,"sourceHash":"2d90b18030e272f0","translatedAt":"2026-07-26T06:05:39.959Z"},"pt-BR":{"title":"Construir um pipeline de análise de imagens de alta resolução e PDFs de várias páginas de ponta a ponta usando o Baidu Unlimited-OCR","summary":"Este tutorial constrói um fluxo de trabalho completo de OCR, carregando no GPU o modelo de linguagem visual Unlimited-OCR da Baidu com 3 bilhões de parâmetros, com suporte para seleção automática entre bfloat16/float16. O pipeline inclui dois modos de inferência: modo Gundam (alta detalhamento por blocos) e modo Base (mais rápido em visão única), e é estendido para análise de PDFs de várias páginas através do PyMuPDF e infer_multi(), preservando todo o contexto longo, controle de repetição e configurações de saída estruturada.","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Construir um pipeline de análise de imagens de alta resolução e PDFs de várias páginas de ponta a ponta usando o Baidu Unlimited-OCR - Aioga Notícias de IA","description":"Este tutorial constrói um fluxo de trabalho completo de OCR, carregando no GPU o modelo de linguagem visual Unlimited-OCR da Baidu com 3 bilhões de parâmetros, com suporte para sel...","url":"https://www.aioga.com/pt-BR/news/cmryhzfdj01hjrolghw239asv/","contentTranslated":true,"sourceHash":"2d90b18030e272f0","translatedAt":"2026-07-26T06:06:23.238Z"},"ru":{"title":"Использование Baidu Unlimited-OCR для построения сквозного конвейера анализа изображений высокой четкости и многостраничных PDF","summary":"Этот учебник создает полный рабочий процесс OCR, загружая на GPU визуально-языковую модель Unlimited-OCR с параметрами Baidu 3B, поддерживающую автоматический выбор bfloat16/float16. Конвейер включает два режима вывода: режим Gundam (подробная обработка блоками) и режим Base (быстрее для одного вида), а также расширяется до анализа многостраничных PDF через PyMuPDF и infer_multi(), полностью сохраняя генерацию длинного контекста, контроль повторов и настройку структурированного вывода.","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Использование Baidu Unlimited-OCR для построения сквозного конвейера анализа изображений высокой четкости и многостраничных PDF - Aioga Новости ИИ","description":"Этот учебник создает полный рабочий процесс OCR, загружая на GPU визуально-языковую модель Unlimited-OCR с параметрами Baidu 3B, поддерживающую автоматический выбор bfloat16/float1...","url":"https://www.aioga.com/ru/news/cmryhzfdj01hjrolghw239asv/","contentTranslated":true,"sourceHash":"2d90b18030e272f0","translatedAt":"2026-07-26T06:06:28.415Z"},"ar":{"title":"بناء خط أنابيب لتحليل الصور عالية الدقة وملفات PDF متعددة الصفحات من البداية إلى النهاية باستخدام Baidu Unlimited-OCR","summary":"تقوم هذه الدورة التعليمية ببناء سير عمل OCR كامل، وتحميل نموذج اللغة البصرية Unlimited-OCR من Baidu بمعامل 3B على GPU، مع دعم الاختيار التلقائي بين bfloat16 وfloat16. تتضمن سلسلة العمليات وضعين للاستدلال: وضع Gundam (تفاصيل عالية مقسمة إلى أجزاء) ووضع Base (عرض واحد أسرع)، وتمتد لتحليل ملفات PDF متعددة الصفحات من خلال PyMuPDF و infer_multi()، مع الحفاظ الكامل على إنشاء السياق الطويل، والتحكم في التكرار، وإعدادات الإخراج المهيكل.","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"بناء خط أنابيب لتحليل الصور عالية الدقة وملفات PDF متعددة الصفحات من البداية إلى النهاية باستخدام Baidu Unlimited-OCR - Aioga أخبار الذكاء الاصطناعي","description":"تقوم هذه الدورة التعليمية ببناء سير عمل OCR كامل، وتحميل نموذج اللغة البصرية Unlimited-OCR من Baidu بمعامل 3B على GPU، مع دعم الاختيار التلقائي بين bfloat16 وfloat16. تتضمن سلسلة ا...","url":"https://www.aioga.com/ar/news/cmryhzfdj01hjrolghw239asv/","contentTranslated":true,"sourceHash":"2d90b18030e272f0","translatedAt":"2026-07-26T06:07:09.733Z"},"hi":{"title":"बाइडू Unlimited-OCR का उपयोग करके एंड-टू-एंड उच्च रिज़ॉल्यूशन इमेज और मल्टी-पेज PDF विश्लेषण पाइपलाइन बनाना","summary":"यह ट्यूटोरियल एक पूरी OCR वर्कफ़्लो तैयार करता है, जो GPU पर Baidu 3B पैरामीटर वाले Unlimited-OCR विज़ुअल-लैंग्वेज मॉडल को लोड करता है, और bfloat16/float16 स्वचालित चयन का समर्थन करता है। पाइपलाइन में दो इन्फ़रेंस मोड शामिल हैं: गंडम मोड (खंडों में उच्च विवरण) और बेस मोड (एकल दृश्य तेज़), और इसे PyMuPDF और infer_multi（） के माध्यम से बहुपृष्ठ PDF पार्सिंग तक विस्तारित किया गया है, पूरी प्रक्रिया में लंबा संदर्भ निर्माण, पुनरावृत्ति नियंत्रण और संरचित आउटपुट सेटिंग्स बनाए रखी जाती हैं।","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"बाइडू Unlimited-OCR का उपयोग करके एंड-टू-एंड उच्च रिज़ॉल्यूशन इमेज और मल्टी-पेज PDF विश्लेषण पाइपलाइन बनाना - Aioga AI समाचार","description":"यह ट्यूटोरियल एक पूरी OCR वर्कफ़्लो तैयार करता है, जो GPU पर Baidu 3B पैरामीटर वाले Unlimited-OCR विज़ुअल-लैंग्वेज मॉडल को लोड करता है, और bfloat16/float16 स्वचालित चयन का समर्थन क...","url":"https://www.aioga.com/hi/news/cmryhzfdj01hjrolghw239asv/","contentTranslated":true,"sourceHash":"2d90b18030e272f0","translatedAt":"2026-07-26T06:07:11.928Z"},"it":{"title":"Costruire una pipeline di analisi end-to-end per immagini ad alta risoluzione e PDF multipagina con Baidu Unlimited-OCR","summary":"Questo tutorial costruisce un flusso di lavoro OCR completo, caricando sul GPU il modello linguistico visivo Unlimited-OCR di Baidu con 3 miliardi di parametri, supportando la selezione automatica tra bfloat16 e float16. La pipeline include due modalità di inferenza: modalità Gundam (dettagli elevati a blocchi) e modalità Base (più veloce per singola vista), ed è estesa all'analisi di PDF multi-pagina tramite PyMuPDF e infer_multi(), mantenendo pienamente la generazione di contesto lungo, il controllo delle ripetizioni e le impostazioni di output strutturato.","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Costruire una pipeline di analisi end-to-end per immagini ad alta risoluzione e PDF multipagina con Baidu Unlimited-OCR - Aioga Notizie IA","description":"Questo tutorial costruisce un flusso di lavoro OCR completo, caricando sul GPU il modello linguistico visivo Unlimited-OCR di Baidu con 3 miliardi di parametri, supportando la sele...","url":"https://www.aioga.com/it/news/cmryhzfdj01hjrolghw239asv/","contentTranslated":true,"sourceHash":"2d90b18030e272f0","translatedAt":"2026-07-26T06:07:49.909Z"},"nl":{"title":"Bouw een end-to-end hoge-resolutie beeld- en multi-pagina PDF-analysepijplijn met Baidu Unlimited-OCR","summary":"Deze handleiding bouwt een complete OCR-workflow, laadt het Unlimited-OCR visuele taalmodel van Baidu met 3B parameters op de GPU en ondersteunt automatische selectie van bfloat16/float16. De pijplijn bevat twee inferentiemodi: Gundam-modus (gedeeld in hoge-detailblokken) en Base-modus (sneller met een enkel zicht), en wordt uitgebreid naar meervoudige PDF-pagina analyse via PyMuPDF en infer_multi(), waarbij de lange contextgeneratie, duplicatiecontrole en gestructureerde outputinstellingen volledig behouden blijven.","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Bouw een end-to-end hoge-resolutie beeld- en multi-pagina PDF-analysepijplijn met Baidu Unlimited-OCR - Aioga AI-nieuws","description":"Deze handleiding bouwt een complete OCR-workflow, laadt het Unlimited-OCR visuele taalmodel van Baidu met 3B parameters op de GPU en ondersteunt automatische selectie van bfloat16/...","url":"https://www.aioga.com/nl/news/cmryhzfdj01hjrolghw239asv/","contentTranslated":true,"sourceHash":"2d90b18030e272f0","translatedAt":"2026-07-26T06:07:52.576Z"},"tr":{"title":"Baidu Unlimited-OCR kullanarak uçtan uca yüksek çözünürlüklü görüntü ve çok sayfalı PDF çözümleme hattı oluşturma","summary":"Bu eğitim, GPU üzerinde Baidu'nun 3B parametreli Unlimited-OCR görsel dil modelini yükleyen eksiksiz bir OCR iş akışı oluşturdu ve bfloat16/float16 otomatik seçimi desteklemektedir. İşlem hattı iki çıkarım modu içerir: Gundam modu (blok bazlı yüksek detay) ve Base modu (tek görünüm daha hızlı) ve PyMuPDF ile infer_multi() aracılığıyla çok sayfalı PDF çözümlemeye kadar genişletilir; uzun bağlam oluşturma, tekrar kontrolü ve yapısal çıktı ayarları tamamen korunur.","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Baidu Unlimited-OCR kullanarak uçtan uca yüksek çözünürlüklü görüntü ve çok sayfalı PDF çözümleme hattı oluşturma - Aioga AI Haberleri","description":"Bu eğitim, GPU üzerinde Baidu'nun 3B parametreli Unlimited-OCR görsel dil modelini yükleyen eksiksiz bir OCR iş akışı oluşturdu ve bfloat16/float16 otomatik seçimi desteklemektedir...","url":"https://www.aioga.com/tr/news/cmryhzfdj01hjrolghw239asv/","contentTranslated":true,"sourceHash":"2d90b18030e272f0","translatedAt":"2026-07-26T06:08:33.090Z"},"vi":{"title":"Sử dụng Baidu Unlimited-OCR xây dựng chuỗi phân tích hình ảnh độ phân giải cao và PDF nhiều trang từ đầu đến cuối","summary":"Hướng dẫn này xây dựng một quy trình làm việc OCR hoàn chỉnh, tải mô hình ngôn ngữ thị giác Unlimited-OCR của Baidu với 3 tỷ tham số trên GPU, hỗ trợ tự động chọn bfloat16/float16. Quy trình bao gồm hai chế độ suy luận: chế độ Gundam (chia khối chi tiết cao) và chế độ Base (xem đơn nhanh hơn), và mở rộng phân tích PDF nhiều trang thông qua PyMuPDF và infer_multi(), toàn bộ quá trình giữ nguyên tạo ngữ cảnh dài, kiểm soát trùng lặp và cài đặt xuất theo cấu trúc.","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Sử dụng Baidu Unlimited-OCR xây dựng chuỗi phân tích hình ảnh độ phân giải cao và PDF nhiều trang từ đầu đến cuối - Tin tức AI Aioga","description":"Hướng dẫn này xây dựng một quy trình làm việc OCR hoàn chỉnh, tải mô hình ngôn ngữ thị giác Unlimited-OCR của Baidu với 3 tỷ tham số trên GPU, hỗ trợ tự động chọn bfloat16/float16....","url":"https://www.aioga.com/vi/news/cmryhzfdj01hjrolghw239asv/","contentTranslated":true,"sourceHash":"2d90b18030e272f0","translatedAt":"2026-07-26T06:08:33.097Z"},"id":{"title":"Membangun pipeline analisis gambar resolusi tinggi dan PDF multi-halaman dari ujung ke ujung menggunakan Baidu Unlimited-OCR","summary":"Tutorial ini membangun satu set lengkap alur kerja OCR, memuat model bahasa visual Unlimited-OCR Baidu 3B parameter di GPU, mendukung pemilihan otomatis bfloat16/float16. Alurnya mencakup dua mode inferensi: Mode Gundam (blok detail tinggi) dan Mode Base (tampilan tunggal lebih cepat), dan diperluas ke penguraian PDF multi-halaman melalui PyMuPDF dan infer_multi(), dengan mempertahankan pembuatan konteks panjang, kontrol duplikasi, dan pengaturan output terstruktur secara keseluruhan.","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Membangun pipeline analisis gambar resolusi tinggi dan PDF multi-halaman dari ujung ke ujung menggunakan Baidu Unlimited-OCR - Berita AI Aioga","description":"Tutorial ini membangun satu set lengkap alur kerja OCR, memuat model bahasa visual Unlimited-OCR Baidu 3B parameter di GPU, mendukung pemilihan otomatis bfloat16/float16. Alurnya m...","url":"https://www.aioga.com/id/news/cmryhzfdj01hjrolghw239asv/","contentTranslated":true,"sourceHash":"2d90b18030e272f0","translatedAt":"2026-07-26T06:09:16.921Z"},"th":{"title":"ใช้ Baidu Unlimited-OCR สร้างโพรเซสไลน์การวิเคราะห์ภาพความละเอียดสูงและ PDF หลายหน้าแบบครบวงจร","summary":"บทเรียนนี้สร้างเวิร์กโฟลว์ OCR ที่สมบูรณ์ โดยสามารถโหลดโมเดลภาพและภาษาของ Unlimited-OCR ขนาด 3B ของ Baidu บน GPU รองรับการเลือกอัตโนมัติระหว่าง bfloat16/float16 ท่อการประมวลผลมีโหมดการสืบค้น 2 แบบ: โหมด Gundam (รายละเอียดสูงแบบแบ่งบล็อก) และโหมด Base (มุมมองเดียว แต่เร็วกว่า) และยังขยายไปยังการวิเคราะห์ PDF หลายหน้าโดยใช้ PyMuPDF และ infer_multi() ตลอดกระบวนการเก็บบริบทยาว การควบคุมการซ้ำ และการตั้งค่าการส่งออกแบบมีโครงสร้าง","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"ใช้ Baidu Unlimited-OCR สร้างโพรเซสไลน์การวิเคราะห์ภาพความละเอียดสูงและ PDF หลายหน้าแบบครบวงจร - ข่าว AI Aioga","description":"บทเรียนนี้สร้างเวิร์กโฟลว์ OCR ที่สมบูรณ์ โดยสามารถโหลดโมเดลภาพและภาษาของ Unlimited-OCR ขนาด 3B ของ Baidu บน GPU รองรับการเลือกอัตโนมัติระหว่าง bfloat16/float16 ท่อการประมวลผลมีโหม...","url":"https://www.aioga.com/th/news/cmryhzfdj01hjrolghw239asv/","contentTranslated":true,"sourceHash":"2d90b18030e272f0","translatedAt":"2026-07-26T06:09:20.761Z"},"pl":{"title":"Budowanie end-to-end wysokorozdzielczej analizy obrazów i wielostronicowych plików PDF za pomocą Baidu Unlimited-OCR","summary":"Ten samouczek tworzy kompletny przepływ pracy OCR, ładując na GPU model językowo-wizualny Unlimited-OCR firmy Baidu o parametrach 3B, obsługujący automatyczny wybór bfloat16/float16. Pipeline zawiera dwa tryby inferencji: tryb Gundam (wysokie detale w blokach) i tryb Base (szybszy w pojedynczym widoku), a poprzez PyMuPDF i infer_multi() rozszerza się na analizę wielostronicowych plików PDF, zachowując pełną generację długiego kontekstu, kontrolę powtórzeń i ustawienia wyjścia strukturalnego.","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Budowanie end-to-end wysokorozdzielczej analizy obrazów i wielostronicowych plików PDF za pomocą Baidu Unlimited-OCR - Aioga Wiadomości AI","description":"Ten samouczek tworzy kompletny przepływ pracy OCR, ładując na GPU model językowo-wizualny Unlimited-OCR firmy Baidu o parametrach 3B, obsługujący automatyczny wybór bfloat16/float1...","url":"https://www.aioga.com/pl/news/cmryhzfdj01hjrolghw239asv/","contentTranslated":true,"sourceHash":"2d90b18030e272f0","translatedAt":"2026-07-26T06:10:02.289Z"}}}}