ไม่สามารถยืนยันความซื่อสัตย์ต่อคำกล่าวทีละข้อได้ โมเดลอาจพึ่งพา 'รหัสลับ' แทนที่จะเป็นหลักฐานที่แท้จริง ผู้เขียนเสนอวิธี RECAP โดยฝึกหัวเชิงเส้นร่วมบนโมเดลเป้าหมายเพื่อให้สามารถถอดรหัสเนื้อหาที่ระบุไว้ได้ บน Pythia-160M โพรบอิสระสามารถแยกความจริงและคำกล่าวเท็จได้อย่างเชื่อถือได้ (AUC 0.96) และยังสามารถติดป้ายคำโกหกภายใต้การปรับแก้เชิงรุก (AUC 0.95)
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.

