Aioga
AI资讯 / 行业动态
返回 AI资讯

Google DeepMind 为 Gemini 推出 agentic 视频理解功能

Google DeepMind:Blog(RSS)Aioga 编辑团队2026-09-01T17:08:51.000Z热度 72

Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 agentic video understan...

行业动态Google DeepMind:Blog(RSS)

今日 AI 情报摘要

Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 agentic video

understanding,模型动态扫描视频片段,相比固定帧率处理 token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。

中文正文 · AI 翻译

今天,我们推出了自主视频理解(Agentic Video Understanding):https://ai.google.dev/gemini-api/docs/video-understanding#agentic-video-understanding,适用于我们最新的模型:Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。这一新功能在显著降低视频分析的 token 使用量和成本的同时,提升了准确性。类似于自主视觉(Agentic Vision):https://blog.google/innovation-and-ai/technology/developers-tools/agentic-vision-gemini-3-flash/,该技术将代码执行与 Gemini 模型的原生图像理解结合,自主视频理解使用 Gemini 的原生视频工具来提升性能,并为视频处理解锁新功能,例如亚秒级片段检索、更准确的异常检测、精确计数等。

该功能现已通过 Google AI Studio 和 Gemini 企业代理平台的 Gemini API 对视频上传和 YouTube 视频开放。

与当前的“静态”处理不同,静态处理模式下模型以固定帧率(默认 1 FPS,可通过 API 调整)摄取视频,自主视频理解将模型的核心推理与原生视频工具相结合,动态搜索、扫描和检查目标视频片段的视觉帧、音频和转录文本。在标准视频分析基准测试中,配备自主视频理解的 Gemini 模型可将分析成本降低高达 66%,token 消耗降低高达 88%,同时准确率提升高达 7%。

这些效率提升在长视频上尤其明显(从 10 分钟的操作指南到 90 分钟的讲座以及数小时的录制),因为静态处理迫使开发者在高 token 成本和可能丢失关键细节的处理技术之间做出选择。

启用自主视频理解后,使用 Gemini 3.7 Flash 的 token 消耗可降低高达 88%,准确率提升可达 7%。

虽然这些提升适用于所有三种支持的模型,但配备自主理解的 Gemini 3.7 Flash 提供了整体最佳质量及最佳质量与成本效率的组合,使其在视频理解的测试模型中处于准确率与成本的帕累托前沿。

使用自主视频理解使 Gemini 3.7 Flash 在视频分析中达到了准确率与成本的帕累托前沿。

与模型以固定帧率静态处理媒体流不同,智能视频理解使 Gemini 能够主动、目标导向地决定观看内容的方式、速度以及通过哪种模态(帧、音频或文字记录)观看,只提取所需的时刻和信号。虽然开发者以前可以手动完成此操作,但通过智能视频理解,Gemini 可以通过智能循环调用内部工具加载视频文件的相关部分,从而显著减少开发开销。

智能视频理解改变了开发者在各种高要求应用中处理长视频内容的方式。

高效令牌长视频分析

看看 Gemini 3.7 Flash 在 LongVideoBench(长视频理解基准)上有无智能视频理解的表现。注意令牌的大幅减少以及准确性的提升。

动态帧速下的快速动作精准分析

通过智能视频理解,3.7 Flash 可以通过按需扫描和重放不同帧率的视频,准确统计快速动作的次数。

高效令牌中的大海捞针搜索

使用智能视频理解,Gemini 3.7 能够基于视频内容准确回答复杂问题,同时相比静态分析消耗的令牌显著减少。

我们的许多早期访问合作伙伴在测试智能视频理解时看到了强劲的性能表现。他们这样说:

智能视频理解可通过 Google AI Studio 的 Gemini API 间接访问:https://ai.google.dev/gemini-api/docs/video-understanding#agentic-video-understanding 以及 Gemini 企业代理平台:https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/capabilities/video-understanding,已在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出。它使用标准的 Gemini API 令牌计费,无额外功能费用。

启用方法简单,只需在 API 配置中将处理模式设置为“agentic”。阅读我们的开发者指南:http://ai.dev/learn/agentic-video-understanding-with-gemini 以获取功能更多见解及入门方法。

我们还将代理视频理解的效率和质量提升带给谷歌产品中的数十亿用户。该功能将很快在 Gemini 应用的 Flash 和 Flash-Lite 模型中向所有用户推出。在接下来的几个月中,代理视频理解还将为 YouTube 的“Ask YouTube”: https://support.google.com/youtube/answer/14110396?hl=en&co=GENIE.Platform%3DAndroid 功能提供支持,该功能位于视频观看页面,利用 Gemini 提供基于视觉内容的更高质量答案。

感谢以下人员对这项工作的贡献:Sergi Caelles、Filip Pavetić、Ahmet Iscen、Suhas Yogin 以及代理视觉团队。

请检查您的收件箱以确认您的订阅。

情报判断

Aioga 编辑摘要

Google DeepMind 宣布为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 agentic video understanding。该能力可动态搜索、扫描并检查视频片段,结合画面、音频与字幕进行分析。

背景分析

该功能面向 Gemini API 中的视频上传和 YouTube 视频,并可在 Google AI Studio 与 Gemini Enterprise Agent Platform 使用。相较固定帧率处理,官方称其最高可减少 88% 的 token 消耗、降低 66% 的分析成本,并提升 7% 的准确率。

Aioga 观点

Aioga 判断:这项更新的核心变化是把视频分析从固定采样转向目标导向的动态检索。来源显示,模型可通过内部工具选择观看时段、速度和信息模态,但实际效果仍取决于具体视频与任务。

影响与后续

可能影响:长视频分析的成本与细节取舍可能得到改善,但最高幅度指标不足以代表所有场景的实际结果。开发者需要评估模型版本、视频类型和任务目标,不能仅依据基准数据推断上线收益。 后续观察:应关注 Gemini API 文档对调用方式、支持范围和计费口径的进一步说明,并观察不同长度、模态组合及异常检测、精确计数等任务中的实际表现。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: deepmind.google

来源: Google DeepMind:Blog(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-01T17:08:51.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 agentic video understan...

Google DeepMind:Blog(RSS)2026-09-01T17:08:51.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。