Studien haben ergeben, dass die Rekonstruktionswerte von Natural Language Autoencoders (NLA) die Treue zu einzelnen Aussagen nicht überprüfen können, da da...
论文研究HuggingFace Daily Papers(社区热门论文)
KI-Informationsbrief des Tages
Studien haben ergeben, dass die Rekonstruktionswerte von Natural Language Autoencoders (NLA) die
Treue zu einzelnen Aussagen nicht überprüfen können, da das Modell möglicherweise auf "private Codes" statt auf echte Belege zurückgreift. Die Autoren schlagen die RECAP-Methode vor, bei der auf dem Zielmodell ein linearer Kopf gemeinsam trainiert wird, um sicherzustellen, dass bestimmte Inhalte dekodierbar bleiben. Auf Pythia-160M können unabhängige Sonden zuverlässig zwischen wahren und falschen Aussagen unterscheiden (AUC 0,96) und markieren weiterhin Lügen unter adversarialen Veränderungen (AUC 0,95).
Originaler Artikelauszug
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Studien haben ergeben, dass die Rekonstruktionswerte von Natural Language Autoencoders (NLA) die Treue zu einzelnen Aussagen nicht überprüfen können, da da...