Des recherches ont révélé que les scores de reconstruction des autoencodeurs de langage naturel (NLA) ne peuvent pas vérifier la fidélité déclaration par d...
论文研究HuggingFace Daily Papers(社区热门论文)
Brief IA du jour
Des recherches ont révélé que les scores de reconstruction des autoencodeurs de langage naturel
(NLA) ne peuvent pas vérifier la fidélité déclaration par déclaration, le modèle pouvant s'appuyer sur un « code privé » plutôt que sur des preuves réelles. Les auteurs proposent la méthode RECAP, qui entraîne conjointement une tête linéaire sur le modèle cible afin de conserver le contenu spécifié décodable. Sur Pythia-160M, la sonde indépendante peut distinguer de manière fiable les déclarations vraies et fausses (AUC 0,96) et peut encore signaler les mensonges sous des modifications adverses (AUC 0,95).
Article et notes de source
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Des recherches ont révélé que les scores de reconstruction des autoencodeurs de langage naturel (NLA) ne peuvent pas vérifier la fidélité déclaration par d...