同一周内,Google DeepMind与Google Research发布了两项似乎彼此独立的更新:一项是把AI气象预报推进到5公里全球网格与小时级刷新,另一项是让多款Gemini Flash模型获得智能体视频理解能力。把它们并置来看,重点并不是Google推出了一个统一产品,而是两条能力路线同时浮出水面:一侧指向高分辨率物理世界预测,另一侧指向对长视频等非结构化数据的主动处理。

WeatherNext 3:把预报精度推向站点级
WeatherNext 3最直接的变化体现在空间和时间粒度上。它提供5公里分辨率的全球预报,并每小时刷新一次。与许多早期AI气象模型相比,这个组合更接近业务系统真正需要的更新频率。Google表示,该模型会开始为搜索、地图和Gemini中的天气信息提供支持,研究者也可以通过Google云平台访问它。对普通用户而言,变化会先体现在常用产品中;对研究者来说,更值得关注的是模型开始直接吸收全球静止卫星拼接作为输入,而不是只依赖传统数值预报的分析结果。
过去三年,AI天气模型一直在缩小与物理预报之间的差距,但两个问题仍没有解决:分辨率不足以刻画局地地形,初始化依赖约晚六小时到达的数值天气预报分析。WeatherNext 3试图同时处理这两个问题。另一个有代表性的能力是面向具体气象站做定向预报,例如把预测落到特定机场。这让模型输出更接近真实应用现场,而不是只给出一张平滑的区域图。
Gemini Flash:从逐帧处理转向按需检查
另一项更新发生在视频理解上。此前,静态处理是更常见的默认路径:模型按每秒1帧抽取画面,处理单通道低码率音频,并每秒插入时间戳。这种方式对长视频并不经济,许多帧和音频段落与问题无关,还会推高token消耗。Google为多款Gemini Flash模型推出的智能体视频理解,则把这个过程改成一个循环:模型先结合自身推理判断需要查看哪些片段,再调用原生视频工具去搜索、扫描和检查帧、音频或转录,只加载提示词实际需要的部分。按照给出的数据,这项能力最多可将视频token减少88%。
它带来的变化不是单纯提高识别精度,而是把视频从“必须整体输入的对象”变成“可以按需检索的信息源”。对开发者来说,这类能力更适合需要从长视频中定位关键片段的任务,而不是适合所有视频场景。资料没有给出具体产品名单,只提到面向多款Gemini Flash模型,因此判断时应聚焦处理机制,而不是把它当成某一个独立应用。
两条路线在竞争什么
两项更新不能合并成一个产品叙事,但它们放在一起能看出AI模型竞争的焦点正在变化。WeatherNext 3关注的是物理世界的连续变化,竞争点在于分辨率、刷新频率,以及能否直接进入搜索、地图等产品;Gemini Flash的视频理解关注的是长时域信息,竞争点在于模型能否在控制成本的同时自主找到相关片段。前者把预测从区域图推向具体地点,后者把理解从逐帧扫描推向按需检查。
对产业观察者来说,更值得关注的是后续是否会沿着同样方向出现新指标:气象模型能否继续缩短初始化延迟、覆盖更多地点;视频模型能否把智能体处理延伸到更多模态和更复杂的工具调用。两个方向都反映出同一种趋势:模型不再只是完成一次静态推断,而是被要求更主动地决定要处理什么、忽略什么。
关于文章版权的声明:
https://news.softunis.com/72822.html 文章来自软盟资讯
若非本站原创的文章,特别作如下声明:
本文刊载所有内容仅供提供信息交流和业务探讨而非提供法律建议目的使用,不代表任何监管机构的立场和观点。不承担任何由于内容的合法性及真实性所引起的争议和法律责任。
凡注明为其他媒体来源的信息,均为转载,版权归版权所有人所有。
如有未注明作者及出处的文章和资料等素材,请版权所有者联系我们,我们将及时补上或者删除,共同建设自媒体信息平台,感谢你的支持!
