연구에 따르면 자연어 오토인코더(NLA)의 재구성 점수는 각 진술의 충실성을 검증할 수 없으며, 모델은 실제 근거가 아닌 '비밀 코드'에 의존할 수 있습니다. 저자는 RECAP 방법을 제안하여, 목표 모델에서 지정된 내용을 디코딩할 수 있도록 선형 헤드를 공동 학습합니다. Py...
论文研究HuggingFace Daily Papers(社区热门论文)
오늘의 AI 정보 요약
연구에 따르면 자연어 오토인코더(NLA)의 재구성 점수는 각 진술의 충실성을 검증할 수 없으며, 모델은 실제 근거가 아닌 '비밀 코드'에 의존할 수 있습니다. 저자는 RECAP
방법을 제안하여, 목표 모델에서 지정된 내용을 디코딩할 수 있도록 선형 헤드를 공동 학습합니다. Pythia-160M에서 독립적인 프로브는 진위 여부 진술을 신뢰성 있게 구분할 수 있으며(AUC 0.96), 대항 편집 상황에서도 거짓을 표시할 수 있습니다(AUC 0.95).
본문 및 출처 설명
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
연구에 따르면 자연어 오토인코더(NLA)의 재구성 점수는 각 진술의 충실성을 검증할 수 없으며, 모델은 실제 근거가 아닌 '비밀 코드'에 의존할 수 있습니다. 저자는 RECAP 방법을 제안하여, 목표 모델에서 지정된 내용을 디코딩할 수 있도록 선형 헤드를 공동 학습합니다. Py...