Aioga
AI资讯 / 模型更新
返回 AI资讯

阿里通义千问发布 Qwen-Image-3.0:单次生成可读十像素文字与复杂信息图

The Decoder:AI News(RSS)Aioga 编辑团队2026-07-21T15:55:09.000Z热度 59

阿里通义千问团队发布 Qwen-Image-3.0,该图像生成模型支持最长 4500 token 的输入,可单次生成包含可读十像素文字、数学公式及十二种语言的复杂排版,如 3×...

模型更新The Decoder:AI News(RSS)

今日 AI 情报摘要

阿里通义千问团队发布 Qwen-Image-3.0,该图像生成模型支持最长 4500 token 的输入,可单次生成包含可读十像素文字、数学公式及十二种语言的复杂排版,如 3×3 信息图网格和嵌套界面。

模型目前仅通过邀请制 API 开放,后续将集成至 Qwen Chat 等自有应用,但不太可能像初版 Qwen-Image 那样开源权重。

中文正文 · AI 翻译

Qwen-Image-3.0 可以一次渲染多面板信息图,生成最小十像素仍可辨认的文本,并支持十二种语言书写。AI 生成的学术论文和报纸页面作为静态图像是否有用仍是一个未解答的问题。

阿里巴巴的 Qwen 团队发布了 Qwen-Image-3.0,这是其图像生成器的第三个版本。据团队介绍,第一个版本侧重于“精确”,第二个版本的目标是“精确、多样、完整、美观和真实”。这次,Qwen 用一个词总结其目标——“真实”。该模型旨在处理实际工作,如报纸排版、分镜头脚本和考试试卷,而不仅仅是生成吸引人的图像。

Qwen-Image-3.0 接受最长 4500 个 token 的提示。据团队介绍,这为模型在一次处理过程中创建密集布局提供了足够空间,而不是通过多个图像拼凑而成。

一个示例将九个独立的信息图像装入 3 x 3 网格,每个面板都有自己的文本、公式和插图。面板内容涵盖隧道附近的安全跟车距离、垂直线、关于情感与理性的儒家课程以及从旋转圆筒上分离的弹丸速度。其他面板解释肝吸虫的生命周期、右侧胸痛、72 阶群的 Sylow 定理、银行内部控制以及动植物细胞中的 DNA。

Nine-panel grid with infographics covering tunnel safety, geometry, Confucian ethics, physics, medicine, math, banking oversight, and cell DNA.

团队还展示了模型如何处理嵌套界面。一个示例从一个包含 Qwen Chat 界面的 VSCode 窗口开始。在该界面内是一个微信对话,其中包含一个介绍如何制作手冲咖啡的海报。

VSCode window with an open image file nested_mockup.png showing a Qwen chat interface, which in turn contains a WeChat conversation thread with a four-step pour-over coffee brewing poster.

Qwen 表示该模型可以生成最小十像素仍清晰可辨的文本。其示例包括一张充满文字的鲸鲨信息图和一页虚构的代数几何论文。论文包含多行 LaTeX 方程,带下标、上标、大括号、分数、求和与连乘号。其他演示展示了模拟报纸页面及类似教师笔记的红色手写评论。

Two-column page of a simulated math paper with the header "Qwen-Image 3.0 Fake PDF," multi-line LaTeX formulas on Čech cohomology, and theorems and proofs on simplicial maps.

Qwen-Image-3.0 同样致力于在肖像和物体中实现摄影级细节,包括可见的毛孔、皮肤质感以及单根头发。在另一个编辑演示中,该模型修复了一幅受损的传统水墨画《斗鹰图》,在填补缺失部分的同时保持原有的笔触和墨色阴影。

Close-up of a young woman in sunlight with flower shadows on her cheek, a pink carnation in her hair, and multiple earrings; individual strands of hair and skin pores are visible.

Qwen 将第三个关注领域描述为“深度知识”。该模型原生支持十二种语言,包括日语、韩语和西班牙语。公开示例还展示了它在重建网站、游戏和直播界面。在一个编辑示例中,该模型将一张昆虫照片转化为完整的鉴定版,包括分类法、身体特征标签、放大的细节视图以及比例尺。Ad DEC_D_Incontent-2

Identification plate for the damselfly Ischnura senegalensis with a macro photo of a tandem pair on a leaf, taxonomic classification, labeled morphological features, four magnified detail circles, and scale bars.

据 Qwen 所述,该模型还可以获取实时互联网数据,并用它生成例如杭州的天气预报。另一个示例将中国水墨画家齐白石和文森特·梵高一起置入模拟的直播工作室中。Ad

阿里巴巴于今年五月发布了直接前身 Qwen-Image-2.0:https://the-decoder.com/alibabas-qwen-image-2-0-doubles-compression-and-cuts-generation-steps-from-40-to-4/。技术报告主要关注训练和推理效率的提升,包括一个仅需每张图片四步而非四十步的快速变体。在阿里巴巴自己的 Arena 平台测试中,Qwen-Image-2.0 排在 OpenAI 的 GPT-Image-2:https://the-decoder.com/openais-chatgpt-images-2-0-thinks-before-it-generates-adding-reasoning-and-web-search-to-image-creation/ 和谷歌的 Nano Banana Pro:https://the-decoder.com/googles-latest-image-model-nano-banana-pro-makes-image-generation-feel-truly-intentional/ 之后。

目前,Qwen-Image-3.0 似乎仅通过邀请制 API 访问提供。该模型应很快出现在一方应用程序中,如 Qwen Chat:https://the-decoder.com/alibaba-launches-free-web-interface-qwen-chat-for-qwen-ai-models/。该模型权重不太可能像原版 Qwen-Image:https://the-decoder.com/alibabas-new-qwen-image-model-generates-high-fidelity-text-inside-images/ 那样以开放许可方式发布。

一些演示的实际价值仍不清楚。研究人员通常使用 LaTeX 撰写和排版论文,而不是将其渲染为图像,所以 AI 生成的包含公式的页面可能更适合用于模型演示和视觉草稿,而不是最终论文。

类似的问题也适用于报纸页面和复杂的信息图表。现代图像模型可以编辑单个文本元素,但可搜索和可编辑的格式在生产工作中仍提供更多灵活性。即便如此,这些示例展示了文本渲染的进步,并可能指向超越此处演示的有用应用。

保持对 AI 的关注。清晰、有用,无废话。

关注 The Decoder 获取 AI 新闻、背景故事和专家分析。

The Decoder:https://the-decoder.com/

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:阿里通义千问团队发布 Qwen-Image-3.0,该图像生成模型支持最长 4500 token 的输入,可单次生成包含可读十像素文字、数学公式及十二种语言的复杂排版,如 3×3 信息图网格和嵌套界面。 Aioga 将其归入「模型更新」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-21T15:55:09.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

阿里通义千问团队发布 Qwen-Image-3.0,该图像生成模型支持最长 4500 token 的输入,可单次生成包含可读十像素文字、数学公式及十二种语言的复杂排版,如 3×...

The Decoder:AI News(RSS)2026-07-21T15:55:09.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。