Penelitian menemukan bahwa skor rekonstruksi dari pengkode bahasa alami (NLA) tidak dapat memverifikasi kesetiaan per pernyataan, model mungkin bergantung...
论文研究HuggingFace Daily Papers(社区热门论文)
Ringkasan intelijen AI hari ini
Penelitian menemukan bahwa skor rekonstruksi dari pengkode bahasa alami (NLA) tidak dapat
memverifikasi kesetiaan per pernyataan, model mungkin bergantung pada "kode rahasia" alih-alih bukti nyata. Penulis mengusulkan metode RECAP, melatih kepala linier secara bersama pada model target untuk menjaga konten yang ditentukan tetap dapat didekode. Pada Pythia-160M, probe independen dapat membedakan pernyataan benar dan palsu secara andal (AUC 0,96), dan masih dapat menandai kebohongan di bawah penyuntingan adversarial (AUC 0,95).
Kutipan artikel asli
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Penelitian menemukan bahwa skor rekonstruksi dari pengkode bahasa alami (NLA) tidak dapat memverifikasi kesetiaan per pernyataan, model mungkin bergantung...