La ricerca ha rilevato che i punteggi di ricostruzione degli autoencoder di linguaggio naturale (NLA) non possono verificare la fedeltà di ogni affermazion...
论文研究HuggingFace Daily Papers(社区热门论文)
Brief quotidiano sull’IA
La ricerca ha rilevato che i punteggi di ricostruzione degli autoencoder di linguaggio naturale
(NLA) non possono verificare la fedeltà di ogni affermazione, poiché il modello potrebbe fare affidamento su "codici privati" piuttosto che su prove reali. Gli autori propongono il metodo RECAP, che addestra congiuntamente una testa lineare sul modello target per mantenere decodificabile il contenuto specificato. Su Pythia-160M, sonde indipendenti possono distinguere in modo affidabile tra affermazioni vere e false (AUC 0,96) e, anche sotto modifiche avversarie, riescono ancora a segnalare le bugie (AUC 0,95).
Estratto dell’articolo originale
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
La ricerca ha rilevato che i punteggi di ricostruzione degli autoencoder di linguaggio naturale (NLA) non possono verificare la fedeltà di ogni affermazion...