Badania wykazały, że wyniki rekonstrukcji w naturalnych językowych autoenkoderach (NLA) nie mogą weryfikować wierności poszczególnych twierdzeń; model może...
论文研究HuggingFace Daily Papers(社区热门论文)
Dzisiejszy biuletyn AI
Badania wykazały, że wyniki rekonstrukcji w naturalnych językowych autoenkoderach (NLA) nie mogą
weryfikować wierności poszczególnych twierdzeń; model może polegać na „tajnym kodzie” zamiast na rzeczywistych podstawach. Autorzy zaproponowali metodę RECAP, która polega na wspólnym trenowaniu liniowej głowy na docelowym modelu w celu zachowania możliwości dekodowania określonych treści. Na Pythia-160M niezależny detektor był w stanie niezawodnie rozróżniać prawdziwe i fałszywe twierdzenia (AUC 0,96) i nadal oznaczać kłamstwa w obliczu modyfikacji adwersarialnych (AUC 0,95).
Fragment oryginalnego artykułu
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Badania wykazały, że wyniki rekonstrukcji w naturalnych językowych autoenkoderach (NLA) nie mogą weryfikować wierności poszczególnych twierdzeń; model może...