Nghiên cứu phát hiện rằng điểm tái tạo của bộ mã hóa ngôn ngữ tự nhiên (NLA) không thể xác thực độ trung thực từng tuyên bố, mô hình có thể dựa vào "mã bí...
论文研究HuggingFace Daily Papers(社区热门论文)
Tóm tắt thông tin AI hôm nay
Nghiên cứu phát hiện rằng điểm tái tạo của bộ mã hóa ngôn ngữ tự nhiên (NLA) không thể xác thực độ
trung thực từng tuyên bố, mô hình có thể dựa vào "mã bí mật" thay vì cơ sở thực sự. Tác giả đề xuất phương pháp RECAP, huấn luyện đồng thời một đầu tuyến tính trên mô hình mục tiêu để giữ nội dung được chỉ định có thể giải mã. Trên Pythia-160M, các đầu dò độc lập có thể phân biệt đáng tin cậy các tuyên bố đúng sai (AUC 0,96) và vẫn có thể đánh dấu lời nói dối dưới các chỉnh sửa đối kháng (AUC 0,95).
Trích đoạn bài viết gốc
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Nghiên cứu phát hiện rằng điểm tái tạo của bộ mã hóa ngôn ngữ tự nhiên (NLA) không thể xác thực độ trung thực từng tuyên bố, mô hình có thể dựa vào "mã bí...