arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。
有一个可以为 arXiv 社区增加价值的项目想法吗?了解更多关于 arXivLabs 的信息:https://info.arxiv.org/labs/index.html。


研究发现自然语言自编码器(NLA)的重建分数无法验证逐声明的忠实性,模型可能依赖"私密代码"而非真实依据。作者提出RECAP方法,在目标模型上联合训练线性头以保持指定内容可解码...
研究发现自然语言自编码器(NLA)的重建分数无法验证逐声明的忠实性,模型可能依赖"私密代码"而非真实依据。
作者提出RECAP方法,在目标模型上联合训练线性头以保持指定内容可解码。 在Pythia-160M上,独立探针能可靠区分真假声明(AUC 0.96),并在对抗编辑下仍能标记谎言(AUC 0.95)。
arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。
有一个可以为 arXiv 社区增加价值的项目想法吗?了解更多关于 arXivLabs 的信息:https://info.arxiv.org/labs/index.html。


arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.


论文提出RECAP,通过在目标模型上联合训练线性头,监督指定内容保持可解码,以检验激活解释是否逐声明忠实。摘要称其在Pythia-160M上取得较高真假声明区分效果。
研究指出,自然语言自编码器的重建分数不能验证逐声明忠实性,模型可能依赖“私密代码”而不是真实依据。RECAP试图以内容可解码性补充这一验证路径。
Aioga判断,RECAP的重点不只是提高重建表现,而是把“指定内容能否被独立解码”作为可检验标准。摘要中的结果显示,该思路值得关注,但材料未说明其适用范围。
若相关方法在更多模型和任务中成立,激活解释评估可能从整体重建分数转向逐声明核验。当前材料仅报告Pythia-160M结果,不能据此推断普遍有效性。 值得关注后续研究是否报告更大规模模型、不同数据与更多对抗编辑设置下的表现,并进一步说明独立探针如何区分真实依据、私密代码与其他可解码信号。
本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。
抓取通道: 摘要聚合 · 原始域名: arxiv.org
来源: HuggingFace Daily Papers(社区热门论文)
原文链接: 打开原始来源
Aioga 归档: 查看情报页
Content record: source-page · Updated: 2026-07-22T00:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。