Aioga
AI资讯 / 行业动态
返回 AI资讯

Show HN:LLM 注意力可视化

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-09-08T22:55:57.000Z热度 58

一个基于 Transformers.js 的 React 应用,可点击或悬停生成的 token,查看影响其生成的历史 token 的注意力权重。可视化通过缩放值向量幅度并跨所有...

行业动态Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

一个基于 Transformers.js 的 React 应用,可点击或悬停生成的 token,查看影响其生成的历史 token 的注意力权重。

可视化通过缩放值向量幅度并跨所有注意力头和层聚合实现,能展示模型从原文复制信息及组合多短语语义的过程。 应用使用 6 亿参数模型,并预生成提示词以便即时加载。

中文正文 · AI 翻译

大型语言模型中注意力机制的可视化。

基于 Transformer 的大型语言模型有一个有趣的特点:在生成阶段,它能够从之前的任意一个 token 中提取信息。但它需要有选择性;如果每个 token 对生成都有相等影响,效果就不会很好。这个过程需要一个机制来决定某个 token 对下一个 token 的影响程度。

事实证明,我们可以把这个机制可视化!

你可以点击或悬停在任何生成的 token 上,查看影响*该生成的过去 token。

*“影响”可能不完全准确,因为这个可视化被高度简化。它计算注意力权重,再乘以值向量的大小,聚合所有注意力头,并在所有层中求和。然后用它来控制前面 token 的透明度。最大值的透明度始终为 1,其余的则进行插值处理。

为了将可视化限制为每个过去 token 仅一个数值,许多信息必须被舍弃。正因为如此,当我开始实现这个功能时,我实际上认为它可能不易理解。但它实际上可以产生一些有趣的模式!

例如,在默认的“办公室搬迁总结”提示中,你可以悬停在像地址和日期这样的逐字复制的文本上。你会发现原始数据非常突出,因为生成的 token 从源数据中获取了很多信息。

这解释了我之前觉得大型语言模型不直观的一点。如果它们通过概率预测下一个 token 来工作,为什么它们在复制粘贴内容方面表现得如此出色?难道它们最终不会仅凭随机机会而犯错吗?

但通过这个机制,你可以看到它并不是从一些有限的内部状态预测整个序列。由于它可以访问所有过去的标记,它可以决定从过去的哪些标记中复制,因此错误的概率可以非常低。在“调试平均函数”示例中,你可以看到这个相当小的模型(6亿参数)可以轻松复现整个 JS 函数,除了预期的修改部分。(虽然它实际上无法自己找到问题,所以需要一些提示。)

另一个有趣的部分是,当你将鼠标悬停在“办公室搬迁总结”提示中的“remain”的时候,你会看到它从“Existing employee access cards will work”中的“work”和“company phone numbers will stay the same”中的“stay the same”中提取信息。所以它有点像是将两个短语中的信息结合起来,我觉得这非常酷。

可视化本身是一个相当基础的 React 应用,使用 Transformers.js 来生成文本。但是,由于我们需要从模型中提取更多数据以进行可视化,它无法使用常规的生成循环。我不得不在应用中自定义编写生成循环,这样我们才能真正跟踪数值以进行可视化。

尽管使用了较小的模型,它仍然有数百兆字节,等待它下载完再显示任何内容是不行的。因此,我预生成了一些提示,可以立即加载和查看。

另一个棘手的问题是,可视化中的一些内容实际上并不打算被读取,因此它们未被定义为输出。我想如果你使用 Python ML 库实现它,仍然很容易访问这些内容。但 Transformers.js 使用包含完整计算图的 .onnx 文件。模型加载和计算逻辑是在 wasm 中实现的,所以据我所知,除了预定义的输出之外,没有简单的方法可以访问其他内容。

最后,我使用了一个小脚本来修改 onnx 文件,仅足以暴露那些内部值。但这意味着我不能仅使用常规的 .onnx 模型。由于我想要一个基于浏览器的生成功能,我必须将一个单独的插装模型上传到我自己的 Hugging Face 仓库:https://huggingface.co/ishamf/Qwen3-0.6B-ONNX-Instrumented,并在应用中指向那里。

您可以在 GitHub 存储库中找到代码:https://github.com/ishamf/llm-visualizer。

情报判断

Aioga 编辑摘要

该项目是一个基于 Transformers.js 的 React 应用,用于可视化大语言模型生成阶段的注意力机制。用户点击或悬停生成的 token,可查看影响其生成的历史 token 及相应可视化结果。

背景分析

应用使用一个 6 亿参数模型,并预生成提示词以实现即时加载。可视化将注意力权重按值向量幅度缩放,再跨所有注意力头和层聚合,最终以历史 token 的透明度呈现相对数值。

Aioga 观点

Aioga 判断:该工具把抽象的注意力权重转化为可交互的视觉线索,有助于观察模型在示例中提取原文信息或组合短语语义的模式,但不应将其简化结果直接等同于完整的生成因果解释。

影响与后续

可能影响:这类可视化可能辅助研究者和用户形成对复制文本现象的直观理解;但由于信息被压缩为每个历史 token 一个数值,且结果聚合了多层与多头,不足以单独证明某个 token 对输出的确定性因果作用。 后续观察:需要关注该工具在不同提示词和生成内容中的表现,并核对可视化结果与原始模型计算之间的差异。建议将其作为探索性观察工具,而非完整的模型解释或准确性验证方法。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: ishamf.dev

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-08T22:55:57.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

一个基于 Transformers.js 的 React 应用,可点击或悬停生成的 token,查看影响其生成的历史 token 的注意力权重。可视化通过缩放值向量幅度并跨所有...

Hacker News 热门(buzzing.cc 中文翻译)2026-09-08T22:55:57.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。