Aioga
AI资讯 / 行业动态
返回 AI资讯

推理预填充实验显示 Qwen3.8 与 GPT-5.5 Pro 重合度提升 18.18 个百分点

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-09-09T20:46:59.000Z热度 58

作者以 GPT-5.5 Pro 为教师模型重跑推理预填充实验,将教师推理的前 1% 注入目标模型推理通道,在 45 个问题上测量可见答案重合度。

行业动态Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

作者以 GPT-5.5 Pro 为教师模型重跑推理预填充实验,将教师推理的前 1% 注入目标模型推理通道,在 45 个问题上测量可见答案重合度。

中文正文 · AI 翻译

对几个开放模型上的推理预填充进行的后续研究:https://gist.github.com/wsxiaoys/102e8654c14d5d27b7b77532026ebfa5 以及 Stolen Thoughts:https://stolen-thoughts.com/

这个 v1.1 版本使用 GPT-5.5 Pro 作为教师重新运行了推理预填充实验。

对于每个问题,我为每个目标模型生成了两个回答:

可见答案仍然是自由生成的。然后我测量了教师的可见答案在目标模型回答的前 100 个标记中出现的程度。如上一篇文章所述,每个分数是单字、双字和三字源召回率的平均值。变化量为绝对百分点变化。

评估包含 45 个问题:15 个 STEM、15 个非 STEM 和 15 个合成谜题。

在之前的实验中,Qwen 几乎没有向 Opus 4.8 移动,但在这里相对于 GPT-5.5 Pro 移动了 +18.18 分,包括在私有合成谜题上的大幅效果。数据表明 Qwen 可能是从 GPT-5.5 Pro 或与之密切相关的 GPT 模型中学习的,而不是从 Opus 学习的。

Kimi K3 与 GPT-5.5 Pro 的重叠度最高,无论是否使用预填充(31.11% 和 35.65%),尽管预填充仅增加了 +4.54 分。

情报判断

Aioga 编辑摘要

一项推理预填充实验以 GPT-5.5 Pro 为教师模型,将其推理前 1% 注入目标模型推理通道,并在 45 个问题上测量可见答案重合度。材料称,Qwen3.8 的重合度向 GPT-5.5 Pro 提升 18.18 个百分点。

背景分析

实验覆盖 15 个 STEM、15 个非 STEM 和 15 个合成谜题。研究者比较目标模型在预填充前后的答案,并统计教师可见答案出现在目标答案前 100 个词元中的比例;文中还报告了 Kimi K3 的相关重合度。

Aioga 观点

Aioga 判断:该结果说明,在这组问题和该测量方法下,预填充可能显著改变 Qwen 的可见答案重合表现,但重合度本身不足以证明模型学习了特定教师模型,也不能单独说明推理过程相同。

影响与后续

可能影响:研究为比较不同模型输出相似性的实验提供了一个案例,但样本仅含 45 个问题,且指标关注前 100 个词元的答案重合,因此不足以外推到更广泛任务或确定模型来源。解读时需要保留边界。 后续观察:建议关注作者是否公开更完整的实验数据、问题构成与复现实验,并比较不同教师模型、预填充比例和评价指标的结果;在这些信息出现前,不应将该发现视为确定的训练来源证据。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: gist.github.com

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-09T20:46:59.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

作者以 GPT-5.5 Pro 为教师模型重跑推理预填充实验,将教师推理的前 1% 注入目标模型推理通道,在 45 个问题上测量可见答案重合度。

Hacker News 热门(buzzing.cc 中文翻译)2026-09-09T20:46:59.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。