Aioga
AI资讯 / 技巧观点
返回 AI资讯

用 GPT-5.6、Claude、Gemini 和 Grok "绘制"《蒙娜丽莎》--AI 图像生成能力实测

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-07-22T04:52:13.376Z热度 49

开发者使用 GPT-5.6、Claude、Gemini 和 Grok 分别尝试"绘制"《蒙娜丽莎》,对比各模型的图像生成效果。测试展示了不同 AI 在艺术风格还原、细节处理上的...

技巧观点Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

开发者使用 GPT-5.6、Claude、Gemini 和 Grok 分别尝试"绘制"《蒙娜丽莎》,对比各模型的图像生成效果。

测试展示了不同 AI 在艺术风格还原、细节处理上的差异,GPT-5.6 在构图准确性上表现突出,而 Claude 和 Gemini 各有侧重。 该实验为评估多模态模型的视觉创作能力提供了直观参考。

中文正文 · AI 翻译

四个前沿模型、一块空白画布和彩色铅笔。我们追踪了他们在尝试画《蒙娜丽莎》时的每一笔、每一美元以及每一份输出。

我们搭建了一个绘画竞技场:把一块空白白画布和一套彩色铅笔工具交给模型,然后退到一旁。模型设置颜色、笔尖宽度和压力,画出一批批笔触,进行涂抹以混合,擦掉,并调用 view_canvas 查看自己的作品并决定修改什么。它可以复现目标图像,也可以根据文本提示进行绘画。

我们运行了四个视觉模型,GPT-5.6 Sol:/models/gpt-5.6-sol、Claude Fable 5:/models/claude-fable-5、Grok 4.5:/models/grok-4.5 和 Gemini 3.6 Flash:/models/gemini-3.6-flash,针对两个目标(《蒙娜丽莎》和梵高的《星夜》,均进行客观评分)以及五个开放式提示,总共完成 28 幅画作。我们将涵盖工具使用、成本、输出,以及模型是否实际改善了作品,并在最后给出我们的观点。

说明一下我们为什么要做这个,因为我们上一次的类似尝试:/blog/ai-music-video-arena-claude-vs-gpt-5.6(模型制作音乐视频)引发了一个很好的讨论:https://news.ycombinator.com/item?id=48939524,有些人认为这是在推广模型的创造力或艺术能力。这些并不是模型能力的客观测试。它们是故意设置的开放式、模糊任务。我们个人持续进行这些测试的原因如下:

每个模型都使用完全相同的彩色铅笔工具集:

整个框架是开源的,地址在 github.com/hershalb/canvas-arena:https://github.com/hershalb/canvas-arena。您可以将任何目标图像或文本提示导入并自行运行。

模型可以全程看到目标图像,并根据结构相似性(SSIM)评分。下面我们展示了 SSIM 分数。

Mona Lisa target
Mona Lisa by GPT-5.6 Sol
Mona Lisa by Claude Fable 5
Mona Lisa by Grok 4.5
Mona Lisa by Gemini 3.6 Flash

完整对话记录:GPT-5.6 Sol:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/mona-lisa-sol.txt · Claude Fable 5:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/mona-lisa-fable.txt · Grok 4.5:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/mona-lisa-grok.txt · Gemini 3.6 Flash:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/mona-lisa-gemini.txt

完整记录:GPT-5.6 Sol:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/starry-night-sol.txt · Claude Fable 5:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/starry-night-fable.txt · Grok 4.5:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/starry-night-grok.txt · Gemini 3.6 Flash:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/starry-night-gemini.txt

没有目标,没有评分,只有文字简介和一张空白页。

“一位年长渔夫风化的面庞,温暖的傍晚阳光,深深的皱纹和胡茬”

完整记录:GPT-5.6 Sol:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/fisherman-sol.txt · Claude Fable 5:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/fisherman-fable.txt · Grok 4.5:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/fisherman-grok.txt · Gemini 3.6 Flash:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/fisherman-gemini.txt

“平静海洋上的美丽日落,橙色到紫色的天空,剪影般的地平线”

完整记录:GPT-5.6 Sol:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/sunset-sol.txt · Claude Fable 5:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/sunset-fable.txt · Grok 4.5:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/sunset-grok.txt · Gemini 3.6 Flash:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/sunset-gemini.txt

“一支红玫瑰插在玻璃花瓶中,黑暗背景,具有戏剧性的伦勃朗光效”

完整记录:GPT-5.6 Sol:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/rose-sol.txt · Claude Fable 5:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/rose-fable.txt · Grok 4.5:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/rose-grok.txt · Gemini 3.6 Flash:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/rose-gemini.txt

“一只虎斑猫蜷缩在窗台上,在午后阳光下熟睡”

完整转录:GPT-5.6 Sol:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/cat-sol.txt · Claude Fable 5:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/cat-fable.txt · Grok 4.5:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/cat-grok.txt · Gemini 3.6 Flash:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/cat-gemini.txt

“一个舒适的小木屋内部,有点燃的壁炉,温暖的琥珀色灯光和柔和的阴影”

完整转录:GPT-5.6 Sol:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/cabin-sol.txt · Claude Fable 5:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/cabin-fable.txt · Grok 4.5:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/cabin-grok.txt · Gemini 3.6 Flash:https://d1md4c6gq9re9p.cloudfront.net/blog/canvas-arena/transcripts/cabin-gemini.txt

各模型七幅画作的平均值和总数。

四个模型使用了完全相同的工具集,但方式完全不同。

GPT-5.6 Sol 从未调用过 set_color、set_brush 或 set_pressure,它在每次绘制调用时直接内联设置这些参数,因此它的调用几乎全是 draw、smudge 和 view_canvas。Grok 4.5 则相反:它 1,349 次工具调用中有 65% 是 set_color / set_brush / set_pressure,这就是它每幅画平均 99 步的原因。Claude Fable 5 倾向使用 smudge(123 次调用)并不断审核。Gemini 3.6 Flash 是最反复审核的模型,它几乎三分之一的调用是 view_canvas(每幅画约 23 次自我审核),且像 Sol 一样从未触碰 set_* 工具。

Claude Fable 5 七幅画作的估算成本为 160 美元左右,大约是 GPT-5.6 Sol(7.74 美元)、Grok 4.5(9.21 美元)或 Gemini 3.6 Flash(12.87 美元)的 20 倍。到现在,这其实不算意外。Grok 使用的 token 数量远高于其他(3400 万),但成本低廉,因为约 98% 是缓存读取,只需极低的输入费率,而且 Grok 的费率是四者中最低的。Gemini 也大量依赖缓存读取,因此即便 2770 万 token,也保持了适中的成本。

每次 view_canvas 都会将画布重新评分并与目标对比,所以我们可以观察整个过程的进展。两个模式在两个目标中都保持一致:

首先,它们早期就会达到平台期。Claude Fable 5 对其蒙娜丽莎进行了 27 次审查,但在大约第五次审查后,相似度基本上就持平了。其次,在所有八次目标运行中,最终绘图的评分都低于模型在运行中期达到的最佳水平。GPT-5.6 Sol 的蒙娜丽莎最高达到 0.352 SSIM,最终得分为 0.325;星夜达到最高 0.179,最终为 0.130。Gemini 3.6 Flash 审查次数最多(每幅画约 23 次),并达到了整个批次的最高峰值,蒙娜丽莎为 0.449,但最终滑回到 0.337。更多的审查并没有转化为更好的最终效果。模型不断在超过自己最佳表现的情况下进行编辑。

SSIM 范围为 0 到 1,数值越高表示越接近目标。RMSE 范围为 0 到 255,数值越低表示越接近目标。

在原始 SSIM 上,Gemini 3.6 Flash 在两种目标上都得分最高,无论是最终得分还是峰值得分,尽管它在最佳帧和最终帧之间的波动也最大。Gemini 3.6 Flash 看起来不错,但绝对不是最接近目标输出的。非常有趣的是,原始得分竟然更高。如往常一样,SSIM 测量的是结构接近度,而不是绘图在人眼中的观感(下文有我们的看法)。

GPT-5.6 Sol 是遥遥领先者。其星夜和玫瑰是整个批次中我们最喜欢的作品,这很惊人,因为它是空白画布上逐笔绘制的。几乎在每幅画的细节上,它也都超越了另外两个模型,唯一的例外是老渔夫。

Grok 4.5 在这里基本上是垃圾。它很少生成可用作品,尽管它使用工具非常频繁,我仍然不相信它能可靠地理解或评估视觉输出。

Gemini 3.6 Flash 确实比 Grok 好,代价略高,但将 Flash 模型与前沿版本比较似乎有点不公平。我非常期待看到 Gemini 4 的表现。我们也已经知道,token 输出速度实在令人印象深刻。

Claude Fable 5 在质量上排名第二,但在成本和时间上处于最不理想的位置。对于这项任务来说,它是三者中最不吸引人的选择:速度慢得多,成本高得多(约为其他模型的 20 倍),但输出效果却赶不上 Sol。

这里提到的每个模型都可以在 TryAI 上通过一个账户使用,按需付费,无需订阅。

将所有前沿的 AI 模型汇聚一处。聊天、图像、视频和音乐——只为你使用的部分付费。

为那些想要尝试每一个 AI 模型的人而建。

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:开发者使用 GPT-5.6、Claude、Gemini 和 Grok 分别尝试"绘制"《蒙娜丽莎》,对比各模型的图像生成效果。 Aioga 将其归入「技巧观点」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:实践类内容的价值在于是否能被复现、是否有明确边界,以及它能否转化为稳定的开发或工作流方法。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察示例是否可复现、工具版本变化、社区反馈和实际成本。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: tryai.dev

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-22T04:52:13.376Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

开发者使用 GPT-5.6、Claude、Gemini 和 Grok 分别尝试"绘制"《蒙娜丽莎》,对比各模型的图像生成效果。测试展示了不同 AI 在艺术风格还原、细节处理上的...

Hacker News 热门(buzzing.cc 中文翻译)2026-07-22T04:52:13.376Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。