{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-09-06T13:40:05.815Z","headline":"Fortune 报道 OpenAI 多次修改 GPT-6 Astra 基准测试数据，部分成绩大幅变化","description":"据 Fortune 报道，OpenAI 自 9 月 3 日发布 GPT-6 Astra 公告以来多次修改评测基准数据：Astra 幻觉率曾从 4.2% 降至 2% 后又改回。","url":"https://www.aioga.com/news/cmtphtttc01pkroxxh8pinzq2/","mainEntityOfPage":"https://www.aioga.com/news/cmtphtttc01pkroxxh8pinzq2/","datePublished":"2026-09-06T06:46:16.000Z","dateModified":"2026-09-06T06:46:16.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://www.ithome.com/0/998/927.htm","https://aihot.virxact.com/items/cmtphtttc01pkroxxh8pinzq2"],"canonicalUrl":"https://www.aioga.com/news/cmtphtttc01pkroxxh8pinzq2/","directAnswer":{"@type":"Answer","text":"据 Fortune 报道，OpenAI 自 9 月 3 日发布 GPT-6 Astra 公告以来，多次修改其中的评测基准数据。摘要显示，Astra 幻觉率曾从 4.2% 降至 2%，之后又改回原值。","url":"https://www.aioga.com/news/cmtphtttc01pkroxxh8pinzq2/","dateCreated":"2026-09-06T06:46:16.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"IT之家 source article","url":"https://www.ithome.com/0/998/927.htm","datePublished":"2026-09-06T06:46:16.000Z","provider":{"@type":"Organization","name":"IT之家","url":"https://www.ithome.com/0/998/927.htm"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmtphtttc01pkroxxh8pinzq2","datePublished":"2026-09-06T06:46:16.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmtphtttc01pkroxxh8pinzq2"}}],"aggregationSource":"IT之家（RSS）","originalPublisher":{"name":"IT之家","url":"https://www.ithome.com/0/998/927.htm"},"geoDeepAnswer":null,"article":{"id":"cmtphtttc01pkroxxh8pinzq2","slug":"cmtphtttc01pkroxxh8pinzq2","url":"https://www.aioga.com/news/cmtphtttc01pkroxxh8pinzq2/","title":"Fortune 报道 OpenAI 多次修改 GPT-6 Astra 基准测试数据，部分成绩大幅变化","title_en":"","summary":"据 Fortune 报道，OpenAI 自 9 月 3 日发布 GPT-6 Astra 公告以来多次修改评测基准数据：Astra 幻觉率曾从 4.2% 降至 2% 后又改回。","source":"IT之家（RSS）","sourceUrl":"https://www.ithome.com/0/998/927.htm","aiHotUrl":"https://aihot.virxact.com/items/cmtphtttc01pkroxxh8pinzq2","publishedAt":"2026-09-06T06:46:16.000Z","category":"行业动态","score":72,"selected":true,"articleBody":["IT之家：https://www.ithome.com/ 9 月 6 日消息，据 Fortune 报道，OpenAI 自当地时间 9 月 3 日下午首次发布 GPT-6 Astra 模型公告以来，已经多次修改其中的评测基准数据。一些更新后的数据显示，Astra 的表现有所提升，而 OpenAI 最大竞争对手 Anthropic 旗下模型的部分成绩则出现下调。","据IT之家了解，OpenAI 最初计划在美国东部时间 9 月 3 日下午 2 点发布博客文章，但又过了近两个小时，文章才终于能够在网上被大多数用户正常访问。","当地时间下午 3 点 32 分，OpenAI 官方 X 账号发布博客链接，但页面无法正常打开，访问者会看到错误提示。下午 3 点 50 分，OpenAI CEO 萨姆・奥尔特曼（Sam Altman）也发布了链接，并写道：“我们在部署博客文章时遇到了一点小问题，但它真的非常棒。”","不过，当时仍有多名用户表示无法打开页面。大约一小时后，页面才终于能够正常访问。","事实证明，OpenAI 实际上在下午 2 点过后不久就发布了这篇博客，但随后又将其撤下。OpenAI 表示无法披露撤稿的具体原因，但强调此事与基准测试成绩无关。","OpenAI 最初解释称，问题源于内容管理系统的故障，随后又表示是互联网中断所致。","然而，当博客重新上线后，其中的多项评测数据已经发生变化，而且部分数据此后仍在继续调整。一些更新后的指标似乎让 Astra 的表现更加突出。","这一事件发生之际，人工智能行业正处于激烈竞争之中。各家公司以极快的速度更新大语言模型，都希望在能力上领先竞争对手。围绕这些指标的争议，也再次凸显出一个长期存在的问题：如何利用标准化基准测试准确衡量大语言模型的能力，以及这些测试成绩是否容易被人为优化甚至“刷分”。","OpenAI 发言人表示：“我们非常重视评测结果的准确性。由于具体使用的模型检查点、测试框架和评测运行方式不同，大多数评测结果本身都会存在几个百分点范围内的波动。对于发布公告中的数据，我们进行了修正，以确保这些数字能够代表我们对模型可用性能的最佳估计，让用户能够进行有意义的比较。”","根据互联网档案中保存的一份页面快照，在美国东部时间 9 月 3 日下午 2 点 23 分发布的最初版本中，Astra 的幻觉率为 4.2%。之后的多份页面快照中，这一数字都没有变化，直到下午 3 点 11 分的第五份快照仍然如此。","大约 10 分钟后，OpenAI 才在 X 上发布了最终版本的博客链接。","但在下午 5 点 20 分保存的第六份网页快照中，也就是页面基本已经能够被公众正常访问之后，Astra 的幻觉率以及另外四项指标发生了变化。Astra 的幻觉率从 4.2% 直接降至 2%，几乎减半。","与此同时，Astra 的前代模型 GPT-5.6 Sol 的幻觉率也从 12.2% 降至 9.4%。","不过，OpenAI 此后仍在继续修改这一指标。截至本文撰写时，Astra 和 GPT-5.6 Sol 的幻觉率又分别回到了最初的 4.2% 和 12.2%。","OpenAI 似乎还大幅提高了 GPT-5.6 Sol 在其内部 ExploitBench 网络安全评测中的成绩，从最初版本的 5.5% 提高到后续版本中的 11.5%。","OpenAI 表示，公司目前正在研究是否将这一数字恢复至 5.5%，因为 11.5% 的成绩对应的是 GPT-5.6 Sol 当前并未向商业用户提供的推理能力等级。","OpenAI 在公告开头重点强调，Astra 在数学能力方面表现尤其出色。","从网页快照来看，Astra 在 FrontierMath Tier 4（v2）评测中的成绩始终保持在 97.6%，并没有发生变化。但 OpenAI 曾短暂修改 GPT-5.6 Sol 和 Anthropic 最新模型 Fable 5.1 的成绩。","在 9 月 3 日下午 2 点 23 分保存的首份网页快照中，Anthropic Fable 5.1 在该数学评测中的成绩为 87.8%。到下午 5 点 17 分，这一成绩下降近 10 个百分点至 78%。截至目前，该成绩又回升至 83%。","GPT-5.6 Sol 的成绩也经历了类似变化，从 83% 下降至 80.5%，随后又恢复至目前的 83%。","OpenAI 此前向媒体提供的一份受发布禁令限制的预发布草稿显示，Astra 在 ARC-AGI-3 评测中的成绩为 98.6%。而在目前公开的博客中，这一数字已经变成 99.99%。","OpenAI 当时回应称：“我们始终会在正式发布前验证评测结果，因此草稿与最终版本之间出现调整是正常的。”","OpenAI 还指出，该基准测试的创建方 Arc Prize Foundation 在独立评估中发现，如果为 Astra 配备一套特别强大的测试工具框架，也就是让模型能够调用更多工具完成任务，Astra 的成绩可以达到 99.9%。","而在使用该基准测试的标准工具框架时，Astra 的成绩为 63%。尽管如此，这一成绩仍明显领先于目前所有公开发布的其他 AI 模型。","OpenAI 表示，测试工具框架、推理等级以及其他因素都会影响最终的评测结果。","OpenAI 内部由不同的研究团队负责不同的评测指标。这些团队负责计算和上报成绩，再由一个中央团队统一发布。","OpenAI 也公开承认，这些数字是在最佳条件下获得的，因此可能与普通用户通过正式版 ChatGPT 实际能够使用的模型表现存在一定差异。","此外，OpenAI 还在每项评测指标的脚注中加入了更多说明和限制条件。","问题在于，评测结果的“准确性”并不总是唯一的。由于测试条件不同，多个不同的成绩都可能是合理的。","但一些 AI 专家认为，其中可能还存在所谓的“Benchmaxxing”现象，也就是通过反复调整测试条件、重新运行评测，以尽可能提高基准测试成绩。","斯坦福智能系统实验室和斯坦福可信 AI 实验室的研究人员 Anka Reuel 和 Mike Hardy 表示，这类操作可以在很短的时间内完成，而且“对公司的营销更有利”。","两人还指出，GPT-6 Astra 的系统卡本应提供更多有关评测方法的技术信息，但其中部分内容并没有得到充分说明。","例如，对于 OpenAI 的内部幻觉率评测，系统卡“几乎没有提供任何有关评测方法的细节”，甚至“连测试项目的数量都没有列出”。","他们认为，反复重新运行测试，可能也是 Astra 在后续版本中编码能力成绩略有提高的原因之一。","Astra 的代码能力评分从 57.7% 提高至 57.9%。虽然只有 0.2 个百分点的变化，但 OpenAI 仍然选择将原来的数字替换成新的、更高成绩。","当然，并非 OpenAI 的所有调整都让 Astra 看起来更有优势。","例如，在面向医疗领域的 HealthBench Professional 评测中，Anthropic 两款模型的成绩在不同版本之间反而有所提高。","Claude Fable 5.1 的成绩从 56.6% 提高至 58.1%，Opus 5 则从 54.5% 提高至 56.4%。","其他 AI 公司模型的成绩通常来自公开排行榜，因此 OpenAI 一般不会亲自对竞争对手的模型进行重新测试。","2025 年，Meta 曾否认有关其人为提高 Llama 4 模型测试成绩的报道。当时有报道称，Meta 公布的成绩来自内部版本，而不是最终向公众开放的版本。","Meta 前首席 AI 科学家 Yann LeCun 后来承认，公司确实曾对基准测试结果进行了“修饰”。","与此同时，AI 行业中的评测标准本身也在不断变化，新的测试项目持续出现。","例如，网络安全基准测试 ExploitGym 于 2026 年才刚刚推出。该评测此前曾因一起事件受到关注，当时 OpenAI 的模型在测试过程中出现失控行为，并对 Hugging Face 发起攻击。","Snorkel AI 负责基准测试和评估研究的 AI 工程师 Vincent Sunn Chen 表示，在模型发布前的最后几个小时内调整基准测试成绩并不罕见。","他在电子邮件中表示：“这通常只是最终发布流程的一部分。一个基准测试成绩对应的是一套具体的测量设置，包括模型检查点、配置参数，例如模型被允许使用多少时间和计算资源、测试工具框架，以及评测和评分配置，例如评分过程中的非确定性。所有这些因素通常都会在模型发布前的最后几天持续调整，因此我并不惊讶看到一些数据更新。”","Chen 表示，他希望行业能够形成新的规范：当公司修改模型基准测试成绩时，应明确说明评测条件发生了哪些变化，从而让研究人员能够更准确地理解这些结果。","对于 AI 公司而言，它们既是衡量技术进步的工具，也是与竞争对手比拼实力的“记分牌”。在各类评测排行榜上取得领先，可以帮助 AI 公司吸引客户，在某些情况下还能够帮助企业招聘工程师和研究人员。","但正如这次事件所显示的那样，正确解读基准测试成绩本身具有很高的技术复杂性。","对于希望以简单、直观方式向公众展示模型能力的公司来说，这也是一个不小的挑战。","与此同时，评测数据不断变化，以及外界对于企业是否诚实、透明地展示测试结果的质疑，也可能让客户和投资者越来越难判断：究竟哪一款模型最适合哪些任务。","这种混乱也可能削弱 OpenAI 希望向市场传递的一个核心叙事 —— 即其拥有市场上最强大的 AI 模型。对于一家可能计划在 2027 年进行 IPO 的公司来说，这一问题无疑显得更加敏感。"],"articleImages":[{"sourceUrl":"https://img.ithome.com/newsuploadfiles/2026/2/8ad2304d-c61b-4004-9483-e1a55ca43342.png?x-bce-process=image/format,f_auto","alt":"","afterParagraph":0,"url":"/media/articles/cmtphtttc01pkroxxh8pinzq2/ff61fea60c25d5ed.webp"},{"sourceUrl":"https://img.ithome.com/newsuploadfiles/2026/9/237a8b9e-995b-4f2e-a10e-fa7074074f5d.png?x-bce-process=image/format,f_auto","alt":"","afterParagraph":24,"url":"/media/articles/cmtphtttc01pkroxxh8pinzq2/145feb6ec163a166.png"}],"mediaStatus":"ok","articleBodyZh":["Fortune 报道 OpenAI 多次修改 GPT-6 Astra 基准测试数据，部分成绩大幅变化 这条更新来自 ithome.com，发布时间为 2026-09-06，Aioga 保留原文入口以便核验。","摘要：据 Fortune 报道，OpenAI 自 9 月 3 日发布 GPT-6 Astra 公告以来多次修改评测基准数据：Astra 幻觉率曾从 4.2% 降至 2% 后又改回。","背景：正文称，该公告一度撤下并出现访问异常，重新上线后多项评测数据已发生变化，部分数据此后继续调整。OpenAI 表示无法披露撤稿的具体原因，但强调此事与基准测试成绩无关。","Aioga 观察：Aioga 观察：来源记录了公告数据多次变化，也提到标准化基准能否准确衡量模型能力的长期争议。现有材料不足以判定数据调整的具体动机，也不足以认定存在人为优化或“刷分”。","影响与后续：影响分析：公开数据的多次调整可能增加成绩解读和版本核对的难度，但不代表模型能力发生了对应变化。比较相关指标时，需要关注数据版本、测试条件和修订说明，避免作出超出材料的推断。 后续观察：应关注 OpenAI 是否说明各项数据的修订时间、具体原因、测试条件及计算方法，并留意公告是否提供可追溯的版本信息；同时需要将页面访问异常、公告撤下与数据修改分别核对。"],"translationStatus":"","bodyOrigin":"source-page","editorial":{"summary":"据 Fortune 报道，OpenAI 自 9 月 3 日发布 GPT-6 Astra 公告以来，多次修改其中的评测基准数据。摘要显示，Astra 幻觉率曾从 4.2% 降至 2%，之后又改回原值。","background":"正文称，该公告一度撤下并出现访问异常，重新上线后多项评测数据已发生变化，部分数据此后继续调整。OpenAI 表示无法披露撤稿的具体原因，但强调此事与基准测试成绩无关。","viewpoint":"Aioga 观察：来源记录了公告数据多次变化，也提到标准化基准能否准确衡量模型能力的长期争议。现有材料不足以判定数据调整的具体动机，也不足以认定存在人为优化或“刷分”。","implications":"影响分析：公开数据的多次调整可能增加成绩解读和版本核对的难度，但不代表模型能力发生了对应变化。比较相关指标时，需要关注数据版本、测试条件和修订说明，避免作出超出材料的推断。","nextStep":"后续观察：应关注 OpenAI 是否说明各项数据的修订时间、具体原因、测试条件及计算方法，并留意公告是否提供可追溯的版本信息；同时需要将页面访问异常、公告撤下与数据修改分别核对。","evidenceRefs":["title","summary","articleBody","source"],"status":"published","aiGenerated":true,"autoApproved":true,"generatedBy":"aioga-editorial:gpt-5.6-sol","reviewedBy":"aioga-editorial-review:gpt-5.6-sol","generatedAt":"2026-09-06T08:04:56.879Z","sourceHash":"c533e7d141406fca","review":{"approved":true,"groundedness":95,"clarity":96,"duplicationRisk":10,"blockingIssues":[],"notes":["内容整体与来源材料一致，未将观点或推测冒充事实。","“公开数据的多次调整可能增加成绩解读和版本核对的难度”属于合理影响分析，已使用“可能”限定，未构成无来源断言。","“不代表模型能力发生了对应变化”属于谨慎的解释性表述，可考虑改为“不能仅据此判断模型能力发生了对应变化”，以进一步避免歧义。","evidenceRefs 所列字段与候选内容引用的来源范围基本对应。"]},"validation":{"passed":true,"mode":"ai-auto","revisions":1,"checks":["schema","length","source-attribution","editorial-labels","inference-boundary","low-source-overlap","no-html","independent-ai-review"]}},"tags":["行业动态","IT之家（RSS）"],"translations":{"zh-CN":{"title":"Fortune 报道 OpenAI 多次修改 GPT-6 Astra 基准测试数据，部分成绩大幅变化","summary":"据 Fortune 报道，OpenAI 自 9 月 3 日发布 GPT-6 Astra 公告以来多次修改评测基准数据：Astra 幻觉率曾从 4.2% 降至 2% 后又改回。","category":"行业动态","source":"IT之家","aggregationSource":"IT之家（RSS）","pageTitle":"Fortune 报道 OpenAI 多次修改 GPT-6 Astra 基准测试数据，部分成绩大幅变化 - Aioga AI资讯","description":"据 Fortune 报道，OpenAI 自 9 月 3 日发布 GPT-6 Astra 公告以来多次修改评测基准数据：Astra 幻觉率曾从 4.2% 降至 2% 后又改回。","url":"https://www.aioga.com/news/cmtphtttc01pkroxxh8pinzq2/","articleBody":["Fortune 报道 OpenAI 多次修改 GPT-6 Astra 基准测试数据，部分成绩大幅变化 这条更新来自 ithome.com，发布时间为 2026-09-06，Aioga 保留原文入口以便核验。","摘要：据 Fortune 报道，OpenAI 自 9 月 3 日发布 GPT-6 Astra 公告以来多次修改评测基准数据：Astra 幻觉率曾从 4.2% 降至 2% 后又改回。","背景：正文称，该公告一度撤下并出现访问异常，重新上线后多项评测数据已发生变化，部分数据此后继续调整。OpenAI 表示无法披露撤稿的具体原因，但强调此事与基准测试成绩无关。","Aioga 观察：Aioga 观察：来源记录了公告数据多次变化，也提到标准化基准能否准确衡量模型能力的长期争议。现有材料不足以判定数据调整的具体动机，也不足以认定存在人为优化或“刷分”。","影响与后续：影响分析：公开数据的多次调整可能增加成绩解读和版本核对的难度，但不代表模型能力发生了对应变化。比较相关指标时，需要关注数据版本、测试条件和修订说明，避免作出超出材料的推断。 后续观察：应关注 OpenAI 是否说明各项数据的修订时间、具体原因、测试条件及计算方法，并留意公告是否提供可追溯的版本信息；同时需要将页面访问异常、公告撤下与数据修改分别核对。"]},"en":{"title":"Fortune reports that OpenAI repeatedly modified GPT-6 Astra benchmark test data, with some results changing significantly","summary":"According to Fortune, OpenAI has repeatedly modified the evaluation benchmark data since the GPT-6 Astra announcement on September 3: Astra's hallucination rate once dropped from 4.2% to 2% before being changed back.","category":"Industry","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Fortune reports that OpenAI repeatedly modified GPT-6 Astra benchmark test data, with some results changing significantly - Aioga AI News","description":"According to Fortune, OpenAI has repeatedly modified the evaluation benchmark data since the GPT-6 Astra announcement on September 3: Astra's hallucination rate once dropped from 4...","url":"https://www.aioga.com/en/news/cmtphtttc01pkroxxh8pinzq2/","contentTranslated":true,"sourceHash":"78046bcc8d2e2b36","translatedAt":"2026-09-06T08:00:49.042Z"},"ja":{"title":"Fortune は、OpenAI が GPT-6 Astra のベンチマークデータを何度も修正し、一部のスコアが大幅に変動したと報じています。","summary":"Fortune の報道によると、OpenAI は9月3日に GPT-6 Astra の発表を行って以来、評価ベンチマークのデータを何度も修正しました：Astra の幻覚率は一時的に 4.2% から 2% に下がった後、再び元に戻りました。","category":"業界動向","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Fortune は、OpenAI が GPT-6 Astra のベンチマークデータを何度も修正し、一部のスコアが大幅に変動したと報じています。 - Aioga AIニュース","description":"Fortune の報道によると、OpenAI は9月3日に GPT-6 Astra の発表を行って以来、評価ベンチマークのデータを何度も修正しました：Astra の幻覚率は一時的に 4.2% から 2% に下がった後、再び元に戻りました。","url":"https://www.aioga.com/ja/news/cmtphtttc01pkroxxh8pinzq2/","contentTranslated":true,"sourceHash":"78046bcc8d2e2b36","translatedAt":"2026-09-06T08:00:51.323Z"},"ko":{"title":"Fortune은 OpenAI가 GPT-6 Astra 벤치마크 데이터를 여러 번 수정했으며 일부 성적이 크게 변동했다고 보도했습니다.","summary":"Fortune 보도에 따르면, OpenAI는 9월 3일 GPT-6 Astra 공지를 발표한 이후 평가 벤치마크 데이터를 여러 번 수정했습니다. Astra의 환각률은 한때 4.2%에서 2%로 떨어졌다가 다시 변경되었습니다.","category":"업계 동향","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Fortune은 OpenAI가 GPT-6 Astra 벤치마크 데이터를 여러 번 수정했으며 일부 성적이 크게 변동했다고 보도했습니다. - Aioga AI 뉴스","description":"Fortune 보도에 따르면, OpenAI는 9월 3일 GPT-6 Astra 공지를 발표한 이후 평가 벤치마크 데이터를 여러 번 수정했습니다. Astra의 환각률은 한때 4.2%에서 2%로 떨어졌다가 다시 변경되었습니다.","url":"https://www.aioga.com/ko/news/cmtphtttc01pkroxxh8pinzq2/","contentTranslated":true,"sourceHash":"78046bcc8d2e2b36","translatedAt":"2026-09-06T08:00:56.443Z"},"es":{"title":"Fortune informó que OpenAI modificó varias veces los datos de referencia de GPT-6 Astra, con cambios significativos en algunos resultados","summary":"Según Fortune, desde que OpenAI anunció GPT-6 Astra el 3 de septiembre, ha modificado varias veces los datos de evaluación de referencia: la tasa de alucinaciones de Astra bajó del 4,2 % al 2 % y luego volvió a cambiar.","category":"Industria","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Fortune informó que OpenAI modificó varias veces los datos de referencia de GPT-6 Astra, con cambios significativos en algunos resultados - Aioga Noticias de IA","description":"Según Fortune, desde que OpenAI anunció GPT-6 Astra el 3 de septiembre, ha modificado varias veces los datos de evaluación de referencia: la tasa de alucinaciones de Astra bajó del...","url":"https://www.aioga.com/es/news/cmtphtttc01pkroxxh8pinzq2/","contentTranslated":true,"sourceHash":"78046bcc8d2e2b36","translatedAt":"2026-09-06T08:00:55.217Z"},"fr":{"title":"Fortune rapporte que OpenAI a modifié à plusieurs reprises les données de référence de GPT-6 Astra, avec des variations importantes dans certains résultats","summary":"Selon Fortune, OpenAI a modifié plusieurs fois les données de référence depuis l'annonce de GPT-6 Astra le 3 septembre : le taux d'hallucination d'Astra est passé de 4,2 % à 2 % avant d'être rétabli.","category":"Industrie","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Fortune rapporte que OpenAI a modifié à plusieurs reprises les données de référence de GPT-6 Astra, avec des variations importantes dans certains résultats - Aioga Actualités IA","description":"Selon Fortune, OpenAI a modifié plusieurs fois les données de référence depuis l'annonce de GPT-6 Astra le 3 septembre : le taux d'hallucination d'Astra est passé de 4,2 % à 2 % av...","url":"https://www.aioga.com/fr/news/cmtphtttc01pkroxxh8pinzq2/","contentTranslated":true,"sourceHash":"78046bcc8d2e2b36","translatedAt":"2026-09-06T08:01:04.155Z"},"de":{"title":"Fortune berichtet, dass OpenAI die Benchmark-Daten von GPT-6 Astra mehrfach geändert hat, wobei einige Ergebnisse stark schwankten","summary":"Laut Fortune hat OpenAI seit der Veröffentlichung der GPT-6 Astra-Ankündigung am 3. September die Benchmark-Daten mehrmals geändert: Die Halluzinationsrate von Astra sank zunächst von 4,2 % auf 2 % und wurde dann wieder zurückgesetzt.","category":"行业动态","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Fortune berichtet, dass OpenAI die Benchmark-Daten von GPT-6 Astra mehrfach geändert hat, wobei einige Ergebnisse stark schwankten - Aioga KI-News","description":"Laut Fortune hat OpenAI seit der Veröffentlichung der GPT-6 Astra-Ankündigung am 3. September die Benchmark-Daten mehrmals geändert: Die Halluzinationsrate von Astra sank zunächst...","url":"https://www.aioga.com/de/news/cmtphtttc01pkroxxh8pinzq2/","contentTranslated":true,"sourceHash":"78046bcc8d2e2b36","translatedAt":"2026-09-06T08:01:01.630Z"},"pt-BR":{"title":"A Fortune informou que a OpenAI revisou repetidamente os dados do benchmark GPT-6 Astra, com alguns resultados mudando significativamente","summary":"Segundo a Fortune, desde que a OpenAI divulgou seu anúncio do GPT-6 Astra em 3 de setembro, ela revisou repetidamente seus dados de referência: a taxa de alucinações do Astra caiu de 4,2% para 2% antes de reverter.","category":"行业动态","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"A Fortune informou que a OpenAI revisou repetidamente os dados do benchmark GPT-6 Astra, com alguns resultados mudando significativamente - Aioga Notícias de IA","description":"Segundo a Fortune, desde que a OpenAI divulgou seu anúncio do GPT-6 Astra em 3 de setembro, ela revisou repetidamente seus dados de referência: a taxa de alucinações do Astra caiu...","url":"https://www.aioga.com/pt-BR/news/cmtphtttc01pkroxxh8pinzq2/","contentTranslated":true,"sourceHash":"78046bcc8d2e2b36","translatedAt":"2026-09-06T08:01:13.339Z"},"ru":{"title":"Fortune сообщает, что OpenAI несколько раз изменяла данные базового тестирования GPT-6 Astra, при этом часть результатов сильно изменилась","summary":"По сообщению Fortune, с момента объявления GPT-6 Astra 3 сентября OpenAI несколько раз меняла данные для оценки: уровень галлюцинаций у Astra сначала снизился с 4,2% до 2%, а затем снова вернулся.","category":"行业动态","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Fortune сообщает, что OpenAI несколько раз изменяла данные базового тестирования GPT-6 Astra, при этом часть результатов сильно изменилась - Aioga Новости ИИ","description":"По сообщению Fortune, с момента объявления GPT-6 Astra 3 сентября OpenAI несколько раз меняла данные для оценки: уровень галлюцинаций у Astra сначала снизился с 4,2% до 2%, а затем...","url":"https://www.aioga.com/ru/news/cmtphtttc01pkroxxh8pinzq2/","contentTranslated":true,"sourceHash":"78046bcc8d2e2b36","translatedAt":"2026-09-06T08:01:09.544Z"},"ar":{"title":"ذكرت مجلة Fortune أن OpenAI عدلت عدة مرات بيانات الاختبارات المعيارية لـ GPT-6 Astra، مع تغييرات كبيرة في بعض النتائج","summary":"وفقًا لتقارير Fortune، فقد قامت OpenAI منذ إعلانها عن GPT-6 Astra في 3 سبتمبر بتعديل بيانات التقييم عدة مرات: فقد انخفض معدل الهلوسة لـ Astra من 4.2% إلى 2% ثم عاد للطريقة السابقة.","category":"行业动态","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"ذكرت مجلة Fortune أن OpenAI عدلت عدة مرات بيانات الاختبارات المعيارية لـ GPT-6 Astra، مع تغييرات كبيرة في بعض النتائج - Aioga أخبار الذكاء الاصطناعي","description":"وفقًا لتقارير Fortune، فقد قامت OpenAI منذ إعلانها عن GPT-6 Astra في 3 سبتمبر بتعديل بيانات التقييم عدة مرات: فقد انخفض معدل الهلوسة لـ Astra من 4.2% إلى 2% ثم عاد للطريقة السابقة.","url":"https://www.aioga.com/ar/news/cmtphtttc01pkroxxh8pinzq2/","contentTranslated":true,"sourceHash":"78046bcc8d2e2b36","translatedAt":"2026-09-06T08:01:19.545Z"},"hi":{"title":"Fortune ने रिपोर्ट किया कि OpenAI ने GPT-6 Astra बेंचमार्क डेटा को कई बार संशोधित किया, कुछ परिणामों में बड़े बदलाव हुए","summary":"Fortune की रिपोर्ट के अनुसार, OpenAI ने 3 सितंबर को GPT-6 Astra घोषणा जारी करने के बाद बेंचमार्क डेटा में कई बार संशोधन किया: Astra की भ्रांति दर पहले 4.2% से घटकर 2% हुई और फिर वापस बदल गई।","category":"行业动态","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Fortune ने रिपोर्ट किया कि OpenAI ने GPT-6 Astra बेंचमार्क डेटा को कई बार संशोधित किया, कुछ परिणामों में बड़े बदलाव हुए - Aioga AI समाचार","description":"Fortune की रिपोर्ट के अनुसार, OpenAI ने 3 सितंबर को GPT-6 Astra घोषणा जारी करने के बाद बेंचमार्क डेटा में कई बार संशोधन किया: Astra की भ्रांति दर पहले 4.2% से घटकर 2% हुई और फिर वा...","url":"https://www.aioga.com/hi/news/cmtphtttc01pkroxxh8pinzq2/","contentTranslated":true,"sourceHash":"78046bcc8d2e2b36","translatedAt":"2026-09-06T08:01:18.565Z"},"it":{"title":"Fortune riporta che OpenAI ha modificato più volte i dati dei benchmark di GPT-6 Astra, con alcune prestazioni cambiate drasticamente","summary":"Secondo quanto riportato da Fortune, OpenAI ha modificato più volte i dati dei benchmark da quando ha annunciato GPT-6 Astra il 3 settembre: il tasso di allucinazioni di Astra era passato dal 4,2% al 2% per poi tornare indietro.","category":"行业动态","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Fortune riporta che OpenAI ha modificato più volte i dati dei benchmark di GPT-6 Astra, con alcune prestazioni cambiate drasticamente - Aioga Notizie IA","description":"Secondo quanto riportato da Fortune, OpenAI ha modificato più volte i dati dei benchmark da quando ha annunciato GPT-6 Astra il 3 settembre: il tasso di allucinazioni di Astra era...","url":"https://www.aioga.com/it/news/cmtphtttc01pkroxxh8pinzq2/","contentTranslated":true,"sourceHash":"78046bcc8d2e2b36","translatedAt":"2026-09-06T08:01:25.996Z"},"nl":{"title":"Fortune meldt dat OpenAI de GPT-6 Astra benchmarkgegevens meerdere keren heeft aangepast, met aanzienlijke veranderingen in sommige resultaten","summary":"Volgens Fortune heeft OpenAI sinds de aankondiging van GPT-6 Astra op 3 september meerdere keren de benchmarkgegevens gewijzigd: het hallucinatiepercentage van Astra daalde van 4,2% naar 2% en werd vervolgens weer aangepast.","category":"行业动态","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Fortune meldt dat OpenAI de GPT-6 Astra benchmarkgegevens meerdere keren heeft aangepast, met aanzienlijke veranderingen in sommige resultaten - Aioga AI-nieuws","description":"Volgens Fortune heeft OpenAI sinds de aankondiging van GPT-6 Astra op 3 september meerdere keren de benchmarkgegevens gewijzigd: het hallucinatiepercentage van Astra daalde van 4,2...","url":"https://www.aioga.com/nl/news/cmtphtttc01pkroxxh8pinzq2/","contentTranslated":true,"sourceHash":"78046bcc8d2e2b36","translatedAt":"2026-09-06T08:01:24.641Z"},"tr":{"title":"Fortune, OpenAI'nin GPT-6 Astra kıstas test verilerini defalarca değiştirdiğini ve bazı sonuçların büyük ölçüde değiştiğini bildirdi","summary":"Fortune'un haberine göre, OpenAI 3 Eylül'de GPT-6 Astra duyurusunu yayınladıktan sonra değerlendirme kıstas verilerini birçok kez değiştirdi: Astra'nın yanılsama oranı önce %4,2'den %2'ye düştü, sonra tekrar değiştirildi.","category":"行业动态","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Fortune, OpenAI'nin GPT-6 Astra kıstas test verilerini defalarca değiştirdiğini ve bazı sonuçların büyük ölçüde değiştiğini bildirdi - Aioga AI Haberleri","description":"Fortune'un haberine göre, OpenAI 3 Eylül'de GPT-6 Astra duyurusunu yayınladıktan sonra değerlendirme kıstas verilerini birçok kez değiştirdi: Astra'nın yanılsama oranı önce %4,2'de...","url":"https://www.aioga.com/tr/news/cmtphtttc01pkroxxh8pinzq2/","contentTranslated":true,"sourceHash":"78046bcc8d2e2b36","translatedAt":"2026-09-06T08:01:31.903Z"},"vi":{"title":"Fortune đưa tin OpenAI nhiều lần sửa đổi dữ liệu đánh giá chuẩn GPT-6 Astra, một số kết quả thay đổi đáng kể","summary":"Theo Fortune, kể từ khi OpenAI công bố GPT-6 Astra vào ngày 3 tháng 9, họ đã nhiều lần chỉnh sửa dữ liệu đánh giá chuẩn: tỷ lệ ảo giác của Astra từng giảm từ 4,2% xuống 2% rồi lại thay đổi trở lại.","category":"行业动态","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Fortune đưa tin OpenAI nhiều lần sửa đổi dữ liệu đánh giá chuẩn GPT-6 Astra, một số kết quả thay đổi đáng kể - Tin tức AI Aioga","description":"Theo Fortune, kể từ khi OpenAI công bố GPT-6 Astra vào ngày 3 tháng 9, họ đã nhiều lần chỉnh sửa dữ liệu đánh giá chuẩn: tỷ lệ ảo giác của Astra từng giảm từ 4,2% xuống 2% rồi lại...","url":"https://www.aioga.com/vi/news/cmtphtttc01pkroxxh8pinzq2/","contentTranslated":true,"sourceHash":"78046bcc8d2e2b36","translatedAt":"2026-09-06T08:01:33.036Z"},"id":{"title":"Fortune melaporkan bahwa OpenAI beberapa kali mengubah data benchmark GPT-6 Astra, beberapa hasil mengalami perubahan besar","summary":"Menurut laporan Fortune, sejak OpenAI mengumumkan GPT-6 Astra pada 3 September, mereka telah beberapa kali mengubah data benchmark: tingkat halusinasi Astra pernah turun dari 4,2% menjadi 2% lalu dikembalikan lagi.","category":"行业动态","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Fortune melaporkan bahwa OpenAI beberapa kali mengubah data benchmark GPT-6 Astra, beberapa hasil mengalami perubahan besar - Berita AI Aioga","description":"Menurut laporan Fortune, sejak OpenAI mengumumkan GPT-6 Astra pada 3 September, mereka telah beberapa kali mengubah data benchmark: tingkat halusinasi Astra pernah turun dari 4,2%...","url":"https://www.aioga.com/id/news/cmtphtttc01pkroxxh8pinzq2/","contentTranslated":true,"sourceHash":"78046bcc8d2e2b36","translatedAt":"2026-09-06T08:01:36.866Z"},"th":{"title":"Fortune รายงานว่า OpenAI ปรับแก้ข้อมูลการทดสอบมาตรฐาน GPT-6 Astra หลายครั้ง ทำให้บางคะแนนเปลี่ยนแปลงอย่างมาก","summary":"ตามรายงานของ Fortune ตั้งแต่ OpenAI ประกาศ GPT-6 Astra เมื่อวันที่ 3 กันยายนที่ผ่านมา ได้ปรับแก้ข้อมูลมาตรฐานการประเมินหลายครั้ง: อัตราภาพลวงตาของ Astra เคยลดจาก 4.2% เหลือ 2% ก่อนจะกลับมาอีกครั้ง","category":"行业动态","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Fortune รายงานว่า OpenAI ปรับแก้ข้อมูลการทดสอบมาตรฐาน GPT-6 Astra หลายครั้ง ทำให้บางคะแนนเปลี่ยนแปลงอย่างมาก - ข่าว AI Aioga","description":"ตามรายงานของ Fortune ตั้งแต่ OpenAI ประกาศ GPT-6 Astra เมื่อวันที่ 3 กันยายนที่ผ่านมา ได้ปรับแก้ข้อมูลมาตรฐานการประเมินหลายครั้ง: อัตราภาพลวงตาของ Astra เคยลดจาก 4.2% เหลือ 2% ก่อน...","url":"https://www.aioga.com/th/news/cmtphtttc01pkroxxh8pinzq2/","contentTranslated":true,"sourceHash":"78046bcc8d2e2b36","translatedAt":"2026-09-06T08:01:40.570Z"},"pl":{"title":"Fortune donosi, że OpenAI wielokrotnie modyfikowało dane testów porównawczych GPT-6 Astra, a niektóre wyniki zmieniły się znacznie","summary":"Według raportu Fortune, od 3 września, kiedy OpenAI opublikowało ogłoszenie o GPT-6 Astra, firma wielokrotnie zmieniała dane testów porównawczych: wskaźnik halucynacji Astra spadł z 4,2% do 2%, a następnie został przywrócony.","category":"行业动态","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Fortune donosi, że OpenAI wielokrotnie modyfikowało dane testów porównawczych GPT-6 Astra, a niektóre wyniki zmieniły się znacznie - Aioga Wiadomości AI","description":"Według raportu Fortune, od 3 września, kiedy OpenAI opublikowało ogłoszenie o GPT-6 Astra, firma wielokrotnie zmieniała dane testów porównawczych: wskaźnik halucynacji Astra spadł...","url":"https://www.aioga.com/pl/news/cmtphtttc01pkroxxh8pinzq2/","contentTranslated":true,"sourceHash":"78046bcc8d2e2b36","translatedAt":"2026-09-06T08:01:47.263Z"}},"evidenceTier":"verified-news","reviewStatus":"editorial-selected","indexable":true,"editorialCover":""}}