GPT-5.6 在 Tracking AI 离线 IQ 测试中拿下 136 分,成为首个突破 130 分"天才线"的 LLM,超过 99% 人类。

其 SOL、TERRA 及视觉版等多个变体均达到 136 分,领先于 Claude-5 Fable 的 130 分。

开发者实测显示,GPT-5.6 能通过单条 prompt 完成粒子流体模拟、RAG 客服工单系统等复杂任务,且成本远低于竞品。
GPT-5.6 在 Tracking AI 离线 IQ 测试中拿下 136 分,成为首个突破 130 分"天才线"的 LLM,超过 99% 人类。其 SOL、TERRA 及视觉...
GPT-5.6 在 Tracking AI 离线 IQ 测试中拿下 136 分,成为首个突破 130 分"天才线"的 LLM,超过 99% 人类。
其 SOL、TERRA 及视觉版等多个变体均达到 136 分,领先于 Claude-5 Fable 的 130 分。 开发者实测显示,GPT-5.6 能通过单条 prompt 完成粒子流体模拟、RAG 客服工单系统等复杂任务,且成本远低于竞品。
GPT-5.6 在 Tracking AI 离线 IQ 测试中拿下 136 分,成为首个突破 130 分"天才线"的 LLM,超过 99% 人类。

其 SOL、TERRA 及视觉版等多个变体均达到 136 分,领先于 Claude-5 Fable 的 130 分。

开发者实测显示,GPT-5.6 能通过单条 prompt 完成粒子流体模拟、RAG 客服工单系统等复杂任务,且成本远低于竞品。
见证历史!如今,全世界 99% 的人类,在 IQ 这方面竟拼不过一个 AI。在 Tracking AI 最新离线 IQ 测试中,GPT-5.6「全家桶」多个版本,齐刷刷地飙到了 136 分。

这是 LLM 第一次,把 IQ 推过了 130 这道坎。在人类的智商分布里,130 分是「天才」的起跑线,全球仅有大约 1% 的人能站上去。换言之,GPT-5.6 要比 99% 的人类还聪明。

一套是公开的 Mensa Norway 风格测试,网上人人能做,模型早就刷到 140 多分了。
另一套,是它自己攒的「离线题库」。不公开、防泄题,专门用来堵住「模型提前背过答案」的漏洞。
GPT-5.6 这次拿下 136 分,破的正是这套最难、最防作弊的离线题。

在这份离线排行榜上,GPT-5.6 的一众变体(连视觉版都算上)集体冲到 136 分,把身后所有对手甩开了一大截。
再往下,GPT-5.6 LUNA Max、Claude-4.8 Opus 这些名字,还在 117 到 123 分之间打转。
过去一年里,从 o3 到各家旗舰,一茬又一茬的模型冲上来,全卡在 130 的门口,谁也没能真正踏进「天才区间」。
而且它不是单枪匹马上分,SOL、TERRA 一整个家族集体飙到 136,连视觉版都没掉队。
在 Reddit 上,一位开发者亲自下场测试,最终体感 GPT-5.6 明显要比 GPT-5.5 的智商更高。



一个分数可能难以令人信服,那么,GPT-5.6 离开考场、真刀真枪干活时是什么样?
开发者 Amir Bohlooli 拿同一个物理模拟 prompt,同时喂给 Fable 5 和 GPT-5.6 Sol,本以为会被 Fable 碾压,结果反被 GPT 惊到。
它选了粒子流体模拟,物理按真实时间推进而非每帧盲跑固定运算,CSS、界面、渲染全塞进一个 HTML 文件,还自动托管成可分享网页。一句话,一个成品。
Ramanpal Singh 同样用了一句 prompt,造出一个基于 RAG 的客服工单系统。
这样的 app 它一口气造了 5 个,成本只有 Fable 5 的零头。
几天前,她卡在一个 bug 上,以为是自己代码写崩了,换到 GPT-5.6 Sol 后只甩下一句「我就是不信搞不定」。
她的评价一针见血,Fable 死磕技术上的绝对精确,反而作茧自缚,Sol 的务实却把活干成了。
冷静下来看,这 136 分,是 Tracking AI 一个特定的离线 / Mensa Norway 风格测试跑出来的。
一张 Mensa 卷子,测不出一个模型的事实可靠性,测不出它的工具调用能力,也测不出它在真实职业场景里到底靠不靠谱。
不过,人们上手后的实测,恰恰给出了另一半答案:GPT-5.6 好像,正在把「会做题」和「会做事」这两件事,慢慢拧到一起。
标准化测试里的题目,模型多半在训练数据里见过千百遍;真正见功夫的,是那些它从没遇到、也无处抄答案的新问题。
《OpenAI 最强 AI 模型:GPT-5.6 系列登场,编程跑分超 Claude Mythos 5:https://www.ithome.com/0/969/272.htm》
Aioga 编辑摘要:GPT-5.6 在 Tracking AI 离线 IQ 测试中拿下 136 分,成为首个突破 130 分"天才线"的 LLM,超过 99% 人类。 Aioga 将其归入「技巧观点」方向,重点关注它对真实使用和行业竞争的影响。
背景分析:实践类内容的价值在于是否能被复现、是否有明确边界,以及它能否转化为稳定的开发或工作流方法。
Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。
影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察示例是否可复现、工具版本变化、社区反馈和实际成本。
本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。
抓取通道: RSS · 原始域名: ithome.com
来源: IT之家(RSS)
原文链接: 打开原始来源
Aioga 归档: 查看情报页
Content record: source-page · Updated: 2026-07-16T02:51:14.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。