{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-07-23T08:41:12.271Z","headline":"RECAP：通过可解码性监督训练可验证的激活解释","description":"研究发现自然语言自编码器（NLA）的重建分数无法验证逐声明的忠实性，模型可能依赖\"私密代码\"而非真实依据。作者提出RECAP方法，在目标模型上联合训练线性头以保持指定内容可解码。在Pythia-160M上，独立探针能可靠区分真假声明（AUC 0.96），并在对抗编辑下仍能标记谎言（AUC 0.95）。","url":"https://www.aioga.com/news/cmrx3dmt7001nro69xdxeq8dd/","mainEntityOfPage":"https://www.aioga.com/news/cmrx3dmt7001nro69xdxeq8dd/","datePublished":"2026-07-22T00:00:00.000Z","dateModified":"2026-07-22T00:00:00.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://arxiv.org/abs/2607.20379","https://aihot.virxact.com/items/cmrx3dmt7001nro69xdxeq8dd"],"canonicalUrl":"https://www.aioga.com/news/cmrx3dmt7001nro69xdxeq8dd/","directAnswer":{"@type":"Answer","text":"论文提出RECAP，通过在目标模型上联合训练线性头，监督指定内容保持可解码，以检验激活解释是否逐声明忠实。摘要称其在Pythia-160M上取得较高真假声明区分效果。","url":"https://www.aioga.com/news/cmrx3dmt7001nro69xdxeq8dd/","dateCreated":"2026-07-22T00:00:00.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"arXiv source article","url":"https://arxiv.org/abs/2607.20379","datePublished":"2026-07-22T00:00:00.000Z","provider":{"@type":"Organization","name":"arXiv","url":"https://arxiv.org/abs/2607.20379"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmrx3dmt7001nro69xdxeq8dd","datePublished":"2026-07-22T00:00:00.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmrx3dmt7001nro69xdxeq8dd"}}],"aggregationSource":"HuggingFace Daily Papers（社区热门论文）","originalPublisher":{"name":"arXiv","url":"https://arxiv.org/abs/2607.20379"},"article":{"id":"cmrx3dmt7001nro69xdxeq8dd","slug":"cmrx3dmt7001nro69xdxeq8dd","url":"https://www.aioga.com/news/cmrx3dmt7001nro69xdxeq8dd/","title":"RECAP：通过可解码性监督训练可验证的激活解释","title_en":"Train the Model， Not the Reader： Decodability Supervision for Verifiable Activation Explanations","summary":"研究发现自然语言自编码器（NLA）的重建分数无法验证逐声明的忠实性，模型可能依赖\"私密代码\"而非真实依据。作者提出RECAP方法，在目标模型上联合训练线性头以保持指定内容可解码。在Pythia-160M上，独立探针能可靠区分真假声明（AUC 0.96），并在对抗编辑下仍能标记谎言（AUC 0.95）。","source":"HuggingFace Daily Papers（社区热门论文）","sourceUrl":"https://arxiv.org/abs/2607.20379","aiHotUrl":"https://aihot.virxact.com/items/cmrx3dmt7001nro69xdxeq8dd","publishedAt":"2026-07-22T00:00:00.000Z","category":"论文研究","score":70,"selected":true,"articleBody":["arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.","Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs ：https://info.arxiv.org/labs/index.html."],"articleImages":[{"sourceUrl":"https://arxiv.org/static/base/1.0.1/images/funders/simons-foundation.png","alt":"Simons Foundation","afterParagraph":1,"url":"/media/articles/cmrx3dmt7001nro69xdxeq8dd/e2d7f38d62f5ca91.png"},{"sourceUrl":"https://arxiv.org/static/base/1.0.1/images/funders/simons-foundation-international.png","alt":"Simons Foundation International","afterParagraph":1,"url":"/media/articles/cmrx3dmt7001nro69xdxeq8dd/1d56e29c5557cbdc.png"}],"mediaStatus":"ok","articleBodyZh":["arXivLabs 是一个框架，允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。","有一个可以为 arXiv 社区增加价值的项目想法吗？了解更多关于 arXivLabs 的信息：https://info.arxiv.org/labs/index.html。"],"translationStatus":"translated","bodyOrigin":"source-page","editorial":{"summary":"论文提出RECAP，通过在目标模型上联合训练线性头，监督指定内容保持可解码，以检验激活解释是否逐声明忠实。摘要称其在Pythia-160M上取得较高真假声明区分效果。","background":"研究指出，自然语言自编码器的重建分数不能验证逐声明忠实性，模型可能依赖“私密代码”而不是真实依据。RECAP试图以内容可解码性补充这一验证路径。","viewpoint":"Aioga判断，RECAP的重点不只是提高重建表现，而是把“指定内容能否被独立解码”作为可检验标准。摘要中的结果显示，该思路值得关注，但材料未说明其适用范围。","implications":"若相关方法在更多模型和任务中成立，激活解释评估可能从整体重建分数转向逐声明核验。当前材料仅报告Pythia-160M结果，不能据此推断普遍有效性。","nextStep":"值得关注后续研究是否报告更大规模模型、不同数据与更多对抗编辑设置下的表现，并进一步说明独立探针如何区分真实依据、私密代码与其他可解码信号。","evidenceRefs":["title","summary","source"],"status":"published","aiGenerated":true,"autoApproved":true,"generatedBy":"aioga-editorial:gpt-5.6-sol","reviewedBy":"aioga-editorial-review:gpt-5.6-sol","generatedAt":"2026-07-23T07:31:02.900Z","sourceHash":"a821f616086e20fb","review":{"approved":true,"groundedness":95,"clarity":93,"duplicationRisk":18,"blockingIssues":[],"notes":["候选内容准确区分了来源事实、条件性推论与编辑判断，并明确提醒现有结果仅来自Pythia-160M，未作普遍有效性推断。","可选补充摘要报告的具体指标：独立探针区分真假声明AUC为0.96，对抗编辑下标记谎言AUC为0.95；当前未列数值不构成事实问题。","“把指定内容能否被独立解码作为可检验标准”属于对方法重点的概括，已放在viewpoint并标明为判断，处理恰当。"]},"validation":{"passed":true,"mode":"ai-auto","revisions":0,"checks":["schema","length","source-attribution","low-source-overlap","no-html","independent-ai-review"]}},"tags":["论文研究","HuggingFace Daily Papers（社区热门论文）"],"translations":{"zh-CN":{"title":"RECAP：通过可解码性监督训练可验证的激活解释","summary":"研究发现自然语言自编码器（NLA）的重建分数无法验证逐声明的忠实性，模型可能依赖\"私密代码\"而非真实依据。作者提出RECAP方法，在目标模型上联合训练线性头以保持指定内容可解码。在Pythia-160M上，独立探针能可靠区分真假声明（AUC 0.96），并在对抗编辑下仍能标记谎言（AUC 0.95）。","category":"论文研究","source":"arXiv","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"RECAP：通过可解码性监督训练可验证的激活解释 - Aioga AI资讯","description":"研究发现自然语言自编码器（NLA）的重建分数无法验证逐声明的忠实性，模型可能依赖\"私密代码\"而非真实依据。作者提出RECAP方法，在目标模型上联合训练线性头以保持指定内容可解码。在Pythia-160M上，独立探针能可靠区分真假声明（AUC 0.96），并在对抗编辑下仍能标记谎言（AUC 0.95）。","url":"https://www.aioga.com/news/cmrx3dmt7001nro69xdxeq8dd/"},"en":{"title":"RECAP: Verifiable Activation Explanations Trained via Decodability Supervision","summary":"Research has found that the reconstruction scores of natural language autoencoders (NLA) cannot verify the truthfulness of individual statements; the model may rely on 'private codes' rather than actual evidence. The authors propose the RECAP method, which jointly trains a linear head on the target model to keep the specified content decodable. On Pythia-160M, independent probes can reliably distinguish true and false statements (AUC 0.96) and still mark lies under adversarial edits (AUC 0.95).","category":"Research","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"RECAP: Verifiable Activation Explanations Trained via Decodability Supervision - Aioga AI News","description":"Research has found that the reconstruction scores of natural language autoencoders (NLA) cannot verify the truthfulness of individual statements; the model may rely on 'private cod...","url":"https://www.aioga.com/en/news/cmrx3dmt7001nro69xdxeq8dd/","contentTranslated":true,"sourceHash":"350e5bdceef7e7b9","translatedAt":"2026-07-23T06:42:37.783Z"},"ja":{"title":"RECAP：デコーダブル性の監督学習を通じて検証可能な活性化説明","summary":"研究は、自然言語自己符号化器（NLA）の再構成スコアでは逐条の忠実性を検証できず、モデルが実際の根拠ではなく「秘密コード」に依存する可能性があることを発見した。著者はRECAP手法を提案し、ターゲットモデル上で線形ヘッドを共同で訓練して指定された内容が復号可能であることを維持する。Pythia-160Mでは、独立プローブが真偽の声明を信頼性高く区別でき（AUC 0.96）、対抗編集においても嘘を識別できる（AUC 0.95）。","category":"論文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"RECAP：デコーダブル性の監督学習を通じて検証可能な活性化説明 - Aioga AIニュース","description":"研究は、自然言語自己符号化器（NLA）の再構成スコアでは逐条の忠実性を検証できず、モデルが実際の根拠ではなく「秘密コード」に依存する可能性があることを発見した。著者はRECAP手法を提案し、ターゲットモデル上で線形ヘッドを共同で訓練して指定された内容が復号可能であることを維持する。Pythia-160Mでは、独立プローブが真偽の声明を信頼性高く区別でき（AU...","url":"https://www.aioga.com/ja/news/cmrx3dmt7001nro69xdxeq8dd/","contentTranslated":true,"sourceHash":"350e5bdceef7e7b9","translatedAt":"2026-07-23T06:42:46.686Z"},"ko":{"title":"요약: 디코딩 가능성 감독 학습을 통해 검증 가능한 활성화 설명","summary":"연구에 따르면 자연어 오토인코더(NLA)의 재구성 점수는 각 진술의 충실성을 검증할 수 없으며, 모델은 실제 근거가 아닌 '비밀 코드'에 의존할 수 있습니다. 저자는 RECAP 방법을 제안하여, 목표 모델에서 지정된 내용을 디코딩할 수 있도록 선형 헤드를 공동 학습합니다. Pythia-160M에서 독립적인 프로브는 진위 여부 진술을 신뢰성 있게 구분할 수 있으며(AUC 0.96), 대항 편집 상황에서도 거짓을 표시할 수 있습니다(AUC 0.95).","category":"연구","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"요약: 디코딩 가능성 감독 학습을 통해 검증 가능한 활성화 설명 - Aioga AI 뉴스","description":"연구에 따르면 자연어 오토인코더(NLA)의 재구성 점수는 각 진술의 충실성을 검증할 수 없으며, 모델은 실제 근거가 아닌 '비밀 코드'에 의존할 수 있습니다. 저자는 RECAP 방법을 제안하여, 목표 모델에서 지정된 내용을 디코딩할 수 있도록 선형 헤드를 공동 학습합니다. Pythia-160M에서 독립적인 프로브는 진위...","url":"https://www.aioga.com/ko/news/cmrx3dmt7001nro69xdxeq8dd/","contentTranslated":true,"sourceHash":"350e5bdceef7e7b9","translatedAt":"2026-07-23T06:43:32.541Z"},"es":{"title":"RECAP: Explicación de la activación verificable entrenada mediante supervisión de decodificabilidad","summary":"La investigación encontró que las puntuaciones de reconstrucción del codificador de lenguaje natural (NLA) no pueden verificar la fidelidad de cada declaración, y el modelo podría depender de \"códigos privados\" en lugar de bases reales. Los autores propusieron el método RECAP, que entrena conjuntamente una cabeza lineal en el modelo objetivo para mantener el contenido especificado decodificable. En Pythia-160M, una sonda independiente puede distinguir de manera fiable entre declaraciones verdaderas y falsas (AUC 0,96), y todavía puede marcar mentiras bajo ediciones adversarias (AUC 0,95).","category":"Investigación","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"RECAP: Explicación de la activación verificable entrenada mediante supervisión de decodificabilidad - Aioga Noticias de IA","description":"La investigación encontró que las puntuaciones de reconstrucción del codificador de lenguaje natural (NLA) no pueden verificar la fidelidad de cada declaración, y el modelo podría...","url":"https://www.aioga.com/es/news/cmrx3dmt7001nro69xdxeq8dd/","contentTranslated":true,"sourceHash":"350e5bdceef7e7b9","translatedAt":"2026-07-23T06:43:35.113Z"},"fr":{"title":"RECAP : interprétation des activations vérifiable entraînée par supervision décodable","summary":"Des recherches ont révélé que les scores de reconstruction des autoencodeurs de langage naturel (NLA) ne peuvent pas vérifier la fidélité déclaration par déclaration, le modèle pouvant s'appuyer sur un « code privé » plutôt que sur des preuves réelles. Les auteurs proposent la méthode RECAP, qui entraîne conjointement une tête linéaire sur le modèle cible afin de conserver le contenu spécifié décodable. Sur Pythia-160M, la sonde indépendante peut distinguer de manière fiable les déclarations vraies et fausses (AUC 0,96) et peut encore signaler les mensonges sous des modifications adverses (AUC 0,95).","category":"Recherche","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"RECAP : interprétation des activations vérifiable entraînée par supervision décodable - Aioga Actualités IA","description":"Des recherches ont révélé que les scores de reconstruction des autoencodeurs de langage naturel (NLA) ne peuvent pas vérifier la fidélité déclaration par déclaration, le modèle pou...","url":"https://www.aioga.com/fr/news/cmrx3dmt7001nro69xdxeq8dd/","contentTranslated":true,"sourceHash":"350e5bdceef7e7b9","translatedAt":"2026-07-23T06:44:26.848Z"},"de":{"title":"RECAP: Verifizierbare Aktivierungsinterpretation durch überwachtes Training mit Decodierbarkeit","summary":"Studien haben ergeben, dass die Rekonstruktionswerte von Natural Language Autoencoders (NLA) die Treue zu einzelnen Aussagen nicht überprüfen können, da das Modell möglicherweise auf \"private Codes\" statt auf echte Belege zurückgreift. Die Autoren schlagen die RECAP-Methode vor, bei der auf dem Zielmodell ein linearer Kopf gemeinsam trainiert wird, um sicherzustellen, dass bestimmte Inhalte dekodierbar bleiben. Auf Pythia-160M können unabhängige Sonden zuverlässig zwischen wahren und falschen Aussagen unterscheiden (AUC 0,96) und markieren weiterhin Lügen unter adversarialen Veränderungen (AUC 0,95).","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"RECAP: Verifizierbare Aktivierungsinterpretation durch überwachtes Training mit Decodierbarkeit - Aioga KI-News","description":"Studien haben ergeben, dass die Rekonstruktionswerte von Natural Language Autoencoders (NLA) die Treue zu einzelnen Aussagen nicht überprüfen können, da das Modell möglicherweise a...","url":"https://www.aioga.com/de/news/cmrx3dmt7001nro69xdxeq8dd/","contentTranslated":true,"sourceHash":"350e5bdceef7e7b9","translatedAt":"2026-07-23T06:44:21.406Z"},"pt-BR":{"title":"RECAP: Explicação de ativação verificável treinada por supervisão de decodabilidade","summary":"Pesquisas descobriram que a pontuação de reconstrução de codificadores de linguagem natural (NLA) não consegue verificar a fidelidade declaração por declaração, podendo o modelo depender de \"códigos privados\" em vez de fundamentos reais. Os autores propõem o método RECAP, que treina conjuntamente uma cabeça linear no modelo-alvo para manter o conteúdo especificado decodificável. No Pythia-160M, sondas independentes conseguem diferenciar de forma confiável declarações verdadeiras de falsas (AUC 0,96) e ainda podem marcar mentiras sob edições adversariais (AUC 0,95).","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"RECAP: Explicação de ativação verificável treinada por supervisão de decodabilidade - Aioga Notícias de IA","description":"Pesquisas descobriram que a pontuação de reconstrução de codificadores de linguagem natural (NLA) não consegue verificar a fidelidade declaração por declaração, podendo o modelo de...","url":"https://www.aioga.com/pt-BR/news/cmrx3dmt7001nro69xdxeq8dd/","contentTranslated":true,"sourceHash":"350e5bdceef7e7b9","translatedAt":"2026-07-23T06:45:10.669Z"},"ru":{"title":"RECAP: проверяемые объяснения активации, обучаемые с помощью контроля декодируемости","summary":"Исследование показало, что баллы восстановления естественного языкового автоэнкодера (NLA) не могут проверить достоверность отдельных утверждений, модель может опираться на \"приватный код\" вместо реальных оснований. Авторы предложили метод RECAP, совместно обучая линейную голову на целевой модели для сохранения возможности декодирования указанного содержания. На Pythia-160M независимые пробники могут надежно различать истинные и ложные утверждения (AUC 0,96) и отмечать ложь даже при противодействующих правках (AUC 0,95).","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"RECAP: проверяемые объяснения активации, обучаемые с помощью контроля декодируемости - Aioga Новости ИИ","description":"Исследование показало, что баллы восстановления естественного языкового автоэнкодера (NLA) не могут проверить достоверность отдельных утверждений, модель может опираться на \"приват...","url":"https://www.aioga.com/ru/news/cmrx3dmt7001nro69xdxeq8dd/","contentTranslated":true,"sourceHash":"350e5bdceef7e7b9","translatedAt":"2026-07-23T06:45:12.434Z"},"ar":{"title":"ملخص: شرح التفعيل القابل للتحقق من خلال التدريب تحت إشراف قابل للفك الترميز","summary":"توصلت الدراسة إلى أن درجات إعادة البناء لمشفّر اللغة الطبيعية (NLA) لا يمكنها التحقق من وفاء كل بيان على حدة، وقد يعتمد النموذج على \"رموز سرية\" بدلاً من الأدلة الحقيقية. اقترح المؤلفون طريقة RECAP، التي تدرب رأسًا خطيًا بشكل مشترك على النموذج الهدف للحفاظ على قابلية فك التشفير للمحتوى المحدد. على نموذج Pythia-160M، يمكن للمسبار المستقل التمييز بين البيانات الحقيقية والكاذبة بشكل موثوق (AUC 0.96)، ولا يزال قادرًا على وسم الأكاذيب تحت التعديلات العدائية (AUC 0.95).","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"ملخص: شرح التفعيل القابل للتحقق من خلال التدريب تحت إشراف قابل للفك الترميز - Aioga أخبار الذكاء الاصطناعي","description":"توصلت الدراسة إلى أن درجات إعادة البناء لمشفّر اللغة الطبيعية (NLA) لا يمكنها التحقق من وفاء كل بيان على حدة، وقد يعتمد النموذج على \"رموز سرية\" بدلاً من الأدلة الحقيقية. اقترح المؤ...","url":"https://www.aioga.com/ar/news/cmrx3dmt7001nro69xdxeq8dd/","contentTranslated":true,"sourceHash":"350e5bdceef7e7b9","translatedAt":"2026-07-23T06:46:01.263Z"},"hi":{"title":"सारांश: डिकोड करने योग्य पर्यवेक्षण प्रशिक्षण के माध्यम से सत्यापनीय सक्रियण व्याख्या","summary":"अध्ययन में पाया गया कि प्राकृतिक भाषा स्वयं-एनकोडर (NLA) के पुनर्निर्माण स्कोर से कथनों की सटीकता को सत्यापित नहीं किया जा सकता है, मॉडल वास्तविक आधार के बजाय \"गुप्त कोड\" पर निर्भर हो सकता है। लेखक ने RECAP विधि का प्रस्ताव किया, जो लक्षित मॉडल पर रैखिक हेड का संयुक्त प्रशिक्षण करती है ताकि निर्दिष्ट सामग्री को डिकोडेबल रखा जा सके। Pythia-160M पर, स्वतंत्र प्रॉब विश्वसनीय रूप से सत्य और झूठे कथनों को अलग कर सकते हैं (AUC 0.96), और विरोधी संपादन के तहत भी झूठ को चिह्नित कर सकते हैं (AUC 0.95)।","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"सारांश: डिकोड करने योग्य पर्यवेक्षण प्रशिक्षण के माध्यम से सत्यापनीय सक्रियण व्याख्या - Aioga AI समाचार","description":"अध्ययन में पाया गया कि प्राकृतिक भाषा स्वयं-एनकोडर (NLA) के पुनर्निर्माण स्कोर से कथनों की सटीकता को सत्यापित नहीं किया जा सकता है, मॉडल वास्तविक आधार के बजाय \"गुप्त कोड\" पर निर्भर...","url":"https://www.aioga.com/hi/news/cmrx3dmt7001nro69xdxeq8dd/","contentTranslated":true,"sourceHash":"350e5bdceef7e7b9","translatedAt":"2026-07-23T06:46:03.658Z"},"it":{"title":"RECAP: spiegazioni attivabili verificabili tramite formazione supervisionata sulla decodificabilità","summary":"La ricerca ha rilevato che i punteggi di ricostruzione degli autoencoder di linguaggio naturale (NLA) non possono verificare la fedeltà di ogni affermazione, poiché il modello potrebbe fare affidamento su \"codici privati\" piuttosto che su prove reali. Gli autori propongono il metodo RECAP, che addestra congiuntamente una testa lineare sul modello target per mantenere decodificabile il contenuto specificato. Su Pythia-160M, sonde indipendenti possono distinguere in modo affidabile tra affermazioni vere e false (AUC 0,96) e, anche sotto modifiche avversarie, riescono ancora a segnalare le bugie (AUC 0,95).","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"RECAP: spiegazioni attivabili verificabili tramite formazione supervisionata sulla decodificabilità - Aioga Notizie IA","description":"La ricerca ha rilevato che i punteggi di ricostruzione degli autoencoder di linguaggio naturale (NLA) non possono verificare la fedeltà di ogni affermazione, poiché il modello potr...","url":"https://www.aioga.com/it/news/cmrx3dmt7001nro69xdxeq8dd/","contentTranslated":true,"sourceHash":"350e5bdceef7e7b9","translatedAt":"2026-07-23T06:46:49.121Z"},"nl":{"title":"RECAP: Verklaarbare activatieverklaringen trainen via decodeerbare supervisie","summary":"Onderzoek heeft aangetoond dat de reconstructiescores van natuurlijke taal auto-encoders (NLA) de trouw van afzonderlijke beweringen niet kunnen verifiëren; het model kan afhankelijk zijn van 'privécodes' in plaats van echte bewijzen. De auteurs stellen de RECAP-methode voor, waarbij gezamenlijk een lineaire kop wordt getraind op het doelmodel om ervoor te zorgen dat de opgegeven inhoud decodeerbaar blijft. Op Pythia-160M kunnen onafhankelijke probes betrouwbaar echte en valse beweringen onderscheiden (AUC 0,96) en kunnen ze ook bij tegenbewerkingen leugens markeren (AUC 0,95).","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"RECAP: Verklaarbare activatieverklaringen trainen via decodeerbare supervisie - Aioga AI-nieuws","description":"Onderzoek heeft aangetoond dat de reconstructiescores van natuurlijke taal auto-encoders (NLA) de trouw van afzonderlijke beweringen niet kunnen verifiëren; het model kan afhankeli...","url":"https://www.aioga.com/nl/news/cmrx3dmt7001nro69xdxeq8dd/","contentTranslated":true,"sourceHash":"350e5bdceef7e7b9","translatedAt":"2026-07-23T06:46:49.862Z"},"tr":{"title":"ÖZET: Kodlanabilirlik denetimi ile doğrulanabilir aktivasyon açıklamalarının eğitimi","summary":"Araştırmalar, Doğal Dil Otomatik Kodlayıcıları'nın (NLA) yeniden oluşturma puanlarının her beyanın doğruluğunu doğrulamak için kullanılamadığını ve modelin gerçek dayanaklar yerine 'gizli kodlara' dayanabileceğini ortaya koydu. Yazarlar, hedef model üzerinde, belirli içeriğin çözülebilirliğini korumak için doğrusal başlığı birlikte eğiten RECAP yöntemini öneriyor. Pythia-160M üzerinde, bağımsız prob gerçek ve sahte beyanları güvenilir bir şekilde ayırt edebiliyor (AUC 0,96) ve düşmanca düzenlemeler altında bile yalanları işaretleyebiliyor (AUC 0,95).","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"ÖZET: Kodlanabilirlik denetimi ile doğrulanabilir aktivasyon açıklamalarının eğitimi - Aioga AI Haberleri","description":"Araştırmalar, Doğal Dil Otomatik Kodlayıcıları'nın (NLA) yeniden oluşturma puanlarının her beyanın doğruluğunu doğrulamak için kullanılamadığını ve modelin gerçek dayanaklar yerine...","url":"https://www.aioga.com/tr/news/cmrx3dmt7001nro69xdxeq8dd/","contentTranslated":true,"sourceHash":"350e5bdceef7e7b9","translatedAt":"2026-07-23T06:47:37.266Z"},"vi":{"title":"TÓM TẮT: Giải thích kích hoạt có thể xác minh được thông qua huấn luyện giám sát có thể giải mã","summary":"Nghiên cứu phát hiện rằng điểm tái tạo của bộ mã hóa ngôn ngữ tự nhiên (NLA) không thể xác thực độ trung thực từng tuyên bố, mô hình có thể dựa vào \"mã bí mật\" thay vì cơ sở thực sự. Tác giả đề xuất phương pháp RECAP, huấn luyện đồng thời một đầu tuyến tính trên mô hình mục tiêu để giữ nội dung được chỉ định có thể giải mã. Trên Pythia-160M, các đầu dò độc lập có thể phân biệt đáng tin cậy các tuyên bố đúng sai (AUC 0,96) và vẫn có thể đánh dấu lời nói dối dưới các chỉnh sửa đối kháng (AUC 0,95).","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"TÓM TẮT: Giải thích kích hoạt có thể xác minh được thông qua huấn luyện giám sát có thể giải mã - Tin tức AI Aioga","description":"Nghiên cứu phát hiện rằng điểm tái tạo của bộ mã hóa ngôn ngữ tự nhiên (NLA) không thể xác thực độ trung thực từng tuyên bố, mô hình có thể dựa vào \"mã bí mật\" thay vì cơ sở thực s...","url":"https://www.aioga.com/vi/news/cmrx3dmt7001nro69xdxeq8dd/","contentTranslated":true,"sourceHash":"350e5bdceef7e7b9","translatedAt":"2026-07-23T06:47:33.090Z"},"id":{"title":"RECAP: Penjelasan Aktivasi yang Dapat Diverifikasi Dilatih melalui Supervisi Keterbacaan","summary":"Penelitian menemukan bahwa skor rekonstruksi dari pengkode bahasa alami (NLA) tidak dapat memverifikasi kesetiaan per pernyataan, model mungkin bergantung pada \"kode rahasia\" alih-alih bukti nyata. Penulis mengusulkan metode RECAP, melatih kepala linier secara bersama pada model target untuk menjaga konten yang ditentukan tetap dapat didekode. Pada Pythia-160M, probe independen dapat membedakan pernyataan benar dan palsu secara andal (AUC 0,96), dan masih dapat menandai kebohongan di bawah penyuntingan adversarial (AUC 0,95).","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"RECAP: Penjelasan Aktivasi yang Dapat Diverifikasi Dilatih melalui Supervisi Keterbacaan - Berita AI Aioga","description":"Penelitian menemukan bahwa skor rekonstruksi dari pengkode bahasa alami (NLA) tidak dapat memverifikasi kesetiaan per pernyataan, model mungkin bergantung pada \"kode rahasia\" alih-...","url":"https://www.aioga.com/id/news/cmrx3dmt7001nro69xdxeq8dd/","contentTranslated":true,"sourceHash":"350e5bdceef7e7b9","translatedAt":"2026-07-23T06:48:25.748Z"},"th":{"title":"สรุป: การอธิบายการเปิดใช้งานที่สามารถตรวจสอบได้โดยการฝึกด้วยการควบคุมการถอดรหัส","summary":"การวิจัยพบว่าคะแนนการสร้างใหม่ของตัวเข้ารหัสภาษาแบบธรรมชาติ (NLA) ไม่สามารถยืนยันความซื่อสัตย์ต่อคำกล่าวทีละข้อได้ โมเดลอาจพึ่งพา 'รหัสลับ' แทนที่จะเป็นหลักฐานที่แท้จริง ผู้เขียนเสนอวิธี RECAP โดยฝึกหัวเชิงเส้นร่วมบนโมเดลเป้าหมายเพื่อให้สามารถถอดรหัสเนื้อหาที่ระบุไว้ได้ บน Pythia-160M โพรบอิสระสามารถแยกความจริงและคำกล่าวเท็จได้อย่างเชื่อถือได้ (AUC 0.96) และยังสามารถติดป้ายคำโกหกภายใต้การปรับแก้เชิงรุก (AUC 0.95)","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"สรุป: การอธิบายการเปิดใช้งานที่สามารถตรวจสอบได้โดยการฝึกด้วยการควบคุมการถอดรหัส - ข่าว AI Aioga","description":"การวิจัยพบว่าคะแนนการสร้างใหม่ของตัวเข้ารหัสภาษาแบบธรรมชาติ (NLA) ไม่สามารถยืนยันความซื่อสัตย์ต่อคำกล่าวทีละข้อได้ โมเดลอาจพึ่งพา 'รหัสลับ' แทนที่จะเป็นหลักฐานที่แท้จริง ผู้เขียนเส...","url":"https://www.aioga.com/th/news/cmrx3dmt7001nro69xdxeq8dd/","contentTranslated":true,"sourceHash":"350e5bdceef7e7b9","translatedAt":"2026-07-23T06:48:26.283Z"},"pl":{"title":"PODSUMOWANIE: Wyjaśnienia aktywacji weryfikowalne poprzez trening nadzorowany z możliwością dekodowania","summary":"Badania wykazały, że wyniki rekonstrukcji w naturalnych językowych autoenkoderach (NLA) nie mogą weryfikować wierności poszczególnych twierdzeń; model może polegać na „tajnym kodzie” zamiast na rzeczywistych podstawach. Autorzy zaproponowali metodę RECAP, która polega na wspólnym trenowaniu liniowej głowy na docelowym modelu w celu zachowania możliwości dekodowania określonych treści. Na Pythia-160M niezależny detektor był w stanie niezawodnie rozróżniać prawdziwe i fałszywe twierdzenia (AUC 0,96) i nadal oznaczać kłamstwa w obliczu modyfikacji adwersarialnych (AUC 0,95).","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"PODSUMOWANIE: Wyjaśnienia aktywacji weryfikowalne poprzez trening nadzorowany z możliwością dekodowania - Aioga Wiadomości AI","description":"Badania wykazały, że wyniki rekonstrukcji w naturalnych językowych autoenkoderach (NLA) nie mogą weryfikować wierności poszczególnych twierdzeń; model może polegać na „tajnym kodzi...","url":"https://www.aioga.com/pl/news/cmrx3dmt7001nro69xdxeq8dd/","contentTranslated":true,"sourceHash":"350e5bdceef7e7b9","translatedAt":"2026-07-23T06:49:15.313Z"}}}}