Aioga
AI资讯 / 行业动态
返回 AI资讯

Google Gemini 推出智能体式视频分析,token 用量最多降 88%

The Decoder:AI News(RSS)Aioga 编辑团队2026-09-02T08:21:38.000Z热度 58

Google 为 Gemini Flash 系列模型(Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite)推出智能体式视频分析,模型自主决定...

行业动态The Decoder:AI News(RSS)

今日 AI 情报摘要

Google 为 Gemini Flash 系列模型(Gemini 3.7 Flash、3.6 Flash 和 3.5

Flash-Lite)推出智能体式视频分析,模型自主决定查看哪些片段、以何种帧率和模态获取信息,取代原来每秒固定采样一帧的静态处理。

中文正文 · AI 翻译

谷歌正在将基于代理的视频分析功能添加到多个Gemini模型中。与以固定速率逐帧扫描视频不同,该模型会自行搜索相关片段,谷歌表示,这大大减少了令牌使用量和成本。

Image description

最新的模型 Gemini 3.7 Flash:https://the-decoder.com/gemini-3-7-flash-lands-with-coding-gains-and-undercuts-its-three-week-old-predecessors-price-by-50/、3.6 Flash 和 3.5 Flash-Lite:https://the-decoder.com/googles-gemini-3-5-flash-follows-anthropic-and-openai-in-making-newer-ai-models-significantly-pricier/,能够捕捉短于一秒的瞬间,包括以每秒一帧的方式会漏掉的状态变化或镜头切换。Google 表示,这使自动化视频编辑的精度大幅提高。

该系统还可以在数小时的录像中找到各个场景,而无需消耗数百万个令牌。它通过以更高帧率重新采样可疑时间窗口来发现异常,并准确统计重复动作和随时间变化的各个对象。广告

Zwei Balkendiagramme vergleichen Gemini 3.7 Flash mit und ohne agentische Verarbeitung auf Minerva, 1H-VideoQA und LVBench, links Tokens pro Anfrage, rechts Genauigkeit.

直到现在,Gemini依赖静态处理,默认以每秒一帧的固定帧率对视频进行采样,并可通过API进行调整。自2025年本地视频分析推出以来:https://the-decoder.com/googles-gemini-models-add-native-video-understanding/,Gemini一直在对音轨进行转录,并按每秒分析视频帧。广告

谷歌表示,基于代理的变体将模型的推理直接与本地视频工具关联起来。模型自行决定查看哪些片段、以何种速度以及通过哪种模式,无论是帧、音频还是转录。它只提取完成特定任务实际需要的瞬间和信号。

Gemini现在使用内部工具仅抓取视频文件的相关部分。开发人员以前也可以手动构建这种选择性方法,但现在模型可以自行处理。广告

Ablaufdiagramm einer Gemini-Schleife aus Query, Think, Observation und Output mit den Werkzeugen get_transcript, get_frames(start, end, fps) und get_audio(start, end).

该方法基于“能动视觉”(agentic vision),Google 已于一月为 Gemini 3 Flash 推出了这一功能:https://the-decoder.com/google-deepmind-gives-gemini-3-flash-the-ability-to-actively-explore-images-through-code/。该功能允许模型编写并运行 Python 代码来缩放、裁剪和标注图像,在响应前通过“思考-行动-观察”循环检查每个结果。发布时并非在每种情况下都能自动工作,但基础已经建立。当 Google 今年十二月宣布 Gemini 3 Flash 时:https://the-decoder.com/google-makes-gemini-3-flash-the-default-for-search-and-slashes-reasoning-costs/,公司标注了视频的视觉和空间推理作为即将推出的功能。

效率提升在长视频中最为明显,无论是 10 分钟的教程,还是 90 分钟的讲座及多小时的录制内容。使用静态处理时,开发者不得不在高令牌成本与丢失重要细节的方法之间做出选择。在 Google 自家的基准测试中,包括 LongVideoBench,搭载基于代理分析的 Gemini 3.7 Flash 在整体质量评分最高,并提供了准确性与成本效率的最佳组合。广告

Streudiagramm mit Kosten pro Anfrage auf der X-Achse und Genauigkeit auf der Y-Achse; Gemini 3.7 Flash mit agentischer Verarbeitung liegt bei rund 90 Prozent über GPT 5.6 Terra, Claude Opus 5.0 und Grok 4.6.

这一功能已通过 Gemini API 在 Google AI Studio 上对视频上传和 YouTube 视频开放:https://ai.google.dev/gemini-api/docs/video-understanding#agentic-video-understanding 以及在 Gemini 企业代理平台:https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/capabilities/video-understanding 间提供。开发者在 API 配置中将处理模式设置为 “agentic”,并按标准 Gemini API 令牌费率支付,无需额外费用。更多详情可参见开发者指南:https://aistudio.google.com/learn/agentic-video-understanding-with-gemini。广告

Google 计划将这些改进带入自家产品。该功能很快将在 Flash 和 Flash Lite 设备的所有 Gemini 应用用户中推出。在未来几个月中,基于代理的视频分析还将为播放页面上的“Ask YouTube” 功能提供支持:https://the-decoder.com/googles-ask-youtube-turns-video-search-into-a-conversation/,使答案更紧密地对应视频中实际可见的内容。

保持对人工智能的了解。清晰、有用,无废话。

关注 The Decoder 获取 AI 新闻、背景故事和专家分析。

解码器:https://the-decoder.com/

情报判断

Aioga 编辑摘要

Google 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 加入智能体式视频分析。模型可自主选择相关片段、帧率及音频、画面或转录等信息来源,标题称 token 用量最多可降低 88%。

背景分析

此前 Gemini 默认按每秒一帧进行静态视频处理,并结合音频转录分析内容。此次方案由模型自行定位所需时间段,可识别短于一秒的状态变化或剪辑,并对可疑片段提高采样率。

Aioga 观点

Aioga 判断:这项变化的核心不只是减少采样,而是让视频分析从固定规则转向按任务主动取证。若来源所述效果稳定,长视频中的细节保留与成本控制可能获得更好的平衡。

影响与后续

可能影响:长教程、讲座和多小时录制内容的分析方式可能改变;开发者需要重新评估固定采样方案与模型自主取样的准确性、成本及可控性,单项基准结果不足以代表所有场景。 后续观察:应关注该能力在不同长度、类型和任务中的实际表现,尤其是短暂事件识别、重复动作计数、场景检索,以及来源所述质量与成本优势能否在更多测试中复现。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-02T08:21:38.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Google 为 Gemini Flash 系列模型(Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite)推出智能体式视频分析,模型自主决定...

The Decoder:AI News(RSS)2026-09-02T08:21:38.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。