谷歌另辟蹊径:让AI主动理解视频,而非堆砌参数
谷歌近期发布主动视频理解功能,让AI能自主选择重点画面分析,大幅降低token消耗与成本,提升长视频理解准确率。此举或为谷歌在AI竞赛中开辟新赛道,以视频理解弥补旗舰模型短板。
在AI大模型竞赛中,谷歌近来略显被动。过去六周内,其接连推出三款Flash系列模型,却未在业界激起太大水花。当对手在编程与推理任务上屡屡突破时,外界难免质疑谷歌的研发节奏。然而,谷歌似乎正试图通过另一条路径重新定义竞争格局——让AI真正理解物理世界的动态变化,而非仅仅在文本与图像上精进。
从“看图说话”到主动理解:视频处理的范式转变
传统AI分析视频的方式颇为机械:以固定帧率(如每秒1帧)抽取静态图像,再逐一识别。这种采样方法虽缓解了计算压力,却容易遗漏瞬时动作,且长视频会因帧数过多撑爆上下文窗口。谷歌于9月1日推出的“主动视频理解”功能,则打破了这一局限。该功能允许模型自主判断需要重点关注的画面片段,并动态调整处理速度——例如官方演示中,模型能准确数出掌声次数,而此类任务过去常因动作瞬时或声音混杂而失败。
实现这一能力的关键,在于将模型推理与原生工具结合。模型先形成循环判断:接下来分析哪段、以何种速度、依赖画面还是音频,然后调用内部工具精读对应片段。开发者以往需编写大量胶水代码才能实现类似逻辑,如今已由模型自主接管。根据谷歌公布的基准测试,该功能可令token消耗最高降低88%,分析成本最高降低66%,同时准确率提升最多7%。在LongVideoBench等长视频基准上,Gemini 3.7 Flash开启主动理解后,处于准确率与成本的帕累托前沿,性价比表现突出。
视频即数据入口:解锁现实世界的应用场景
谷歌在视频理解上的布局,与其拥有的现实世界数据入口紧密相关。YouTube、Maps与Search等产品提供了海量视频与地理信息,使AI能更自然地触达物理世界。这种优势在体育赛事、家庭监控等场景中已初显潜力。
例如,在NBA或足球直播中,启用主动视频理解的播放器可实时分析战术与球员跑位,当出现精妙配合或争议判罚时,屏幕边缘会弹出战术拆解图,并展示球员历史数据。在家庭监控领域,该技术能过滤窗帘飘动等无效异动,聚焦幼儿攀爬、宠物异常等语义事件,推送如“宝宝正在攀爬书柜”的精准预警。开发者已能通过Google AI Studio及Gemini Enterprise Agent Platform调用此功能,支持上传视频与YouTube链接,按标准token计费,暂无额外费用。
这一能力后续将扩展到Gemini App的Flash系列模型用户,并计划在未来数月为YouTube的“Ask YouTube”功能提供支持。值得注意的是,拥有5亿订阅者的YouTuber MrBeast将在新视频中展示Gemini、Google Health等产品,其穿越极端环境的测试或将凸显视频理解的实用价值。
改写人机交互:视频成为可检索的结构化知识
当“Ask YouTube”成为标配,用户与视频的交互方式将彻底改变。过去,在长篇评测或教程中寻找特定信息,需反复拖拽进度条或依赖评论区时间戳。如今,用户可直接提问,AI实时定位并总结答案,仿佛视频本身拥有了对话能力。互联网海量视频资源,正逐渐转化为可被直接调用的知识库。
在AI竞赛的下半场,谷歌或许暂时难以回到旗舰模型的领跑位置,但若胜负手在于谁能造出真正理解世界、并与世界互动的AI,那么游戏远未结束。从主动视频理解到现实世界数据整合,谷歌正尝试用另一种维度缩短与物理世界的距离——未来的AI不仅能听会说,更可能拥有一双洞察动态、理解逻辑的眼睛,与人类一同凝视瞬息万变的世界。