A Universidade de Nanjing e a equipe da Alibaba propuseram uma estrutura de interpretabilidade causal, descobrindo que, no Transformer de difusão (DiT), os...
论文研究HuggingFace Daily Papers(社区热门论文)
Resumo diário de inteligência em IA
A Universidade de Nanjing e a equipe da Alibaba propuseram uma estrutura de interpretabilidade
causal, descobrindo que, no Transformer de difusão (DiT), os tokens estruturais provenientes de templates de chat, embora não contenham a semântica do prompt, tornam-se pontos de convergência de atenção de imagem para texto e, de forma causal, mantêm a identidade dos objetos, funcionando como um registrador semântico implícito.
Trecho do artigo original
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
A Universidade de Nanjing e a equipe da Alibaba propuseram uma estrutura de interpretabilidade causal, descobrindo que, no Transformer de difusão (DiT), os...