Aioga
AI资讯 / 论文研究
返回 AI资讯

Induction Labs 发布 Photon-1:无动作标签视频预训练学会隐式策略

MarkTechPost(RSS)Aioga 编辑团队2026-07-26T09:14:22.000Z热度 35

Induction Labs 发布 Photon-1,一个 106B-A5B 参数的稀疏 MoE Transformer,仅通过无动作标签的原始视频预训练,学会了隐式策略。在内...

论文研究MarkTechPost(RSS)

今日 AI 情报摘要

Induction Labs 发布 Photon-1,一个 106B-A5B 参数的稀疏 MoE Transformer,仅通过无动作标签的原始视频预训练,学会了隐式策略。

在内部计算机使用基准上,Photon-1 以约 27 倍更少的预训练算力和约 3 倍更低的推理成本击败 Gemini 3.1 Flash-Lite。 该模型目前仅作为研究结果发布,无权重、无 API、无许可证。

中文正文 · AI 翻译

大多数从视频中学习的智能体需要知道每一帧产生的动作。Induction Labs(https://www.inductionlabs.com/)认为这一要求是瓶颈。上周,他们发布了想象模型,一种基础模型架构,可以在完全没有动作标签的原始视频上进行预训练。

他们的测试系统是 Photon-1,一种稀疏 106B-A5B 专家混合(MoE)变换器,在 18 年的计算机演示视频上训练。在内部计算机使用基准测试中,Induction Labs 报告称 Photon-1 在预训练计算量远低于 Gemini 3.1 Flash-Lite(https://www.inductionlabs.com/news/scaling-video-pretraining)的情况下表现更佳,服务成本大约低 3 倍。

想象模型使用下一潜变量标记预测目标自回归地预测未来帧。在预训练期间它不生成像素。一切都在学习到的表示空间中建模。

关键声明是:预测未来状态会教模型完成任务,即使预训练期间从未看到动作。Induction Labs 将其称为隐式策略。模型学习的是人的行为概念,而不是每次鼠标点击的标签。

该架构依赖于使用有限标量量化(FSQ)的视觉编码器。每帧压缩为 960 个离散标记。每个标记是 8 维向量,每个维度取五个值之一:−1, −1/2, 0, 1/2, 1。这给出了 5⁸ 个可能代码的码本。

生成的编码大约每帧 2.2 KB。Induction Labs 报告称与现有的 OCR 和多模态模型表示相比,压缩效果提高超过 100 倍,同时保留文本、布局和状态变化。

为了达到这一速率,Photon-1 使用差分潜变量编码器。它将视频帧编码为对,因此潜变量描述的是帧之间的差异,而不是帧的内容。

语料库起始于内部索引的 20 亿个公开可用视频。筛选后减少到约 200 万个计算机屏幕录制。内部关键帧检测模型去除了冗余帧。

最终数据集为 5.75 亿帧,采样率为每秒 1 帧。这相当于 5520 亿个标记,约 18 年的视频。Photon-1 从零开始预训练了一个单一的 epoch。

在 32K 上下文下训练 106B-A5B MoE 大约消耗了 30,000 H200 GPU 小时,或 4.4×10²² 次训练 FLOPs。研究团队在 PyTorch 中实现了训练,并针对视觉编码器和 MoE 层使用了自定义融合内核,保持了 40% 的端到端 MFU。这三个数字是相互一致的:30,000 H200 小时在 40% MFU 下几乎正好对应 4.3×10²² 次。

Induction Labs 在不到 35,000 次计算机使用轨迹上微调了 Photon-1,以教模型动作和指令格式。特殊的计算机使用标记允许模型输出动作。在推理时,Photon-1 首先预测下一帧的状态,然后输出可以达到该状态的动作。

随后是在线强化学习。Rollout 在规模化的虚拟机上实时运行,结果通过编程方式验证以生成奖励。Linux 虚拟机运行五个桌面环境(LXQt、Xfce、MATE、GNOME 和 Plasma),每个环境都有一个 Google 帐号用于登录受限的网络应用,以及一个内部 ChatGPT 克隆,没有速率限制。

*按 10:1 的输入到输出标记比加权,Induction Labs 表示这与其计算机使用测试相匹配。

该表旁应有两个注意事项。首先,Gemini 的数字是 Induction Labs 自己的保守估计,假设 8B 活跃参数和 25T 预训练标记。按表面价值计算,比率约为 27×,而非 30× 头条;Induction Labs 表示“至少 30×”,基于 Gemini 的真实数字可能更高,并且模型可能经过蒸馏。其次,该基准是内部未发布的,因此结果目前无法独立复现。

Photon-1 在 Induction Labs 硬件上的自身盈亏成本是每 1M 输入标记 $0.06,每 1M 输出标记 $0.60,没有投机性解码。

这是更有趣的测试,因为 Photon-1 只看过计算机使用视频。研究团队在预训练中没有涉及的领域上微调了它,并与两个基线进行了比较:一个具有相同架构和规模但没有想象力预训练的视觉编码器基线,和一个 LLM 基线 (Ling-flash-2.0:https://huggingface.co/inclusionAI/Ling-flash-2.0,由 Inclusion AI 提供,预训练 20T 标记)。

在来自开放跳棋档案 2.0(Open Checkers Archive 2.0:https://fierz.ch/download.php/checkers.htm)的 20,000 场锦标赛跳棋游戏中,Photon-1 在世界模拟和移动质量方面都击败了两个基线。在以 5 帧/秒模拟的 10,000 场合成台球游戏中,它相对于真实物理引擎的平均绝对误差为 0.47,而 LLM 基线为 1.15,视觉编码器基线为 1.44。

Photon-1 还从预训练视频中学习到了人类先验知识。经过强化学习(RL)后,它学会了使用虚拟机内的 ChatGPT 克隆来起草工件和回答知识问题,以类似人的方式引导 LLM。

请查看 Induction Labs 的完整技术报告:https://www.inductionlabs.com/news/scaling-video-pretraining 以及 X 上的公告帖:https://x.com/induction_labs/status/2080322704973160760。对此研究的所有功劳归属于该项目的研究人员。

Induction Labs 发布 Photon-1:无动作标签视频预训练学会隐式策略

Michal Sutter 是一名数据科学专业人员,拥有帕多瓦大学(University of Padova)的数据科学硕士学位。凭借在统计分析、机器学习和数据工程方面的坚实基础,Michal 擅长将复杂的数据集转化为可操作的洞察。

FAIRChem v2 UMA for Multidomain Atomistic Simulation across Molecules, Catalysts, Materials, Vibrations, and Molecular Dynamics
Designing High-Performance GPU Kernels with TileLang: Tensor-Core GEMM, Fused Softmax, FlashAttention, and Autotuning

构建一个智能事件场地运营代理 [完整代码]:https://pxllnk.co/twdn5

谢谢!我们的团队将很快与您联系 🙌

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Induction Labs 发布 Photon-1,一个 106B-A5B 参数的稀疏 MoE Transformer,仅通过无动作标签的原始视频预训练,学会了隐式策略。 Aioga 将其归入「论文研究」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-26T09:14:22.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Induction Labs 发布 Photon-1,一个 106B-A5B 参数的稀疏 MoE Transformer,仅通过无动作标签的原始视频预训练,学会了隐式策略。在内...

MarkTechPost(RSS)2026-07-26T09:14:22.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。