L'Université de Nankin et l'équipe d'Alibaba ont proposé un cadre d'interprétabilité causale et ont découvert que dans le Transformer de diffusion (DiT), l...
论文研究HuggingFace Daily Papers(社区热门论文)
Brief IA du jour
L'Université de Nankin et l'équipe d'Alibaba ont proposé un cadre d'interprétabilité causale et ont
découvert que dans le Transformer de diffusion (DiT), les tokens structurels provenant des modèles de chat, bien qu'ils ne contiennent pas de sémantique directive, deviennent des points de convergence d'attention de l'image vers le texte et maintiennent de manière causale l'identité de l'objet, servant de registre sémantique implicite.
Article et notes de source
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
L'Université de Nankin et l'équipe d'Alibaba ont proposé un cadre d'interprétabilité causale et ont découvert que dans le Transformer de diffusion (DiT), l...