Araştırmalar, Doğal Dil Otomatik Kodlayıcıları'nın (NLA) yeniden oluşturma puanlarının her beyanın doğruluğunu doğrulamak için kullanılamadığını ve modelin...
论文研究HuggingFace Daily Papers(社区热门论文)
Bugünün AI bilgi özeti
Araştırmalar, Doğal Dil Otomatik Kodlayıcıları'nın (NLA) yeniden oluşturma puanlarının her beyanın
doğruluğunu doğrulamak için kullanılamadığını ve modelin gerçek dayanaklar yerine 'gizli kodlara' dayanabileceğini ortaya koydu. Yazarlar, hedef model üzerinde, belirli içeriğin çözülebilirliğini korumak için doğrusal başlığı birlikte eğiten RECAP yöntemini öneriyor. Pythia-160M üzerinde, bağımsız prob gerçek ve sahte beyanları güvenilir bir şekilde ayırt edebiliyor (AUC 0,96) ve düşmanca düzenlemeler altında bile yalanları işaretleyebiliyor (AUC 0,95).
Orijinal makale alıntısı
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Araştırmalar, Doğal Dil Otomatik Kodlayıcıları'nın (NLA) yeniden oluşturma puanlarının her beyanın doğruluğunu doğrulamak için kullanılamadığını ve modelin...