专栏名称: 量子位
վ'ᴗ' ի 追踪AI行业和技术动态,这里更快一步!关注我们,回复“今天”,更多大新闻等你来发现
TodayRss-海外RSS稳定源
目录
今天看啥  ›  专栏  ›  量子位

DeepMind率先提出CoF:视频模型有自己的思维链

量子位  · 公众号  · AI  · 2025-09-28 11:38
    

主要观点总结

DeepMind提出新的视频模型概念“帧链CoF(chain-of-frames)”,旨在实现视频模型的通用视觉理解能力。通过测试发现,以Veo 3为代表的视频模型具备四大能力:感知能力、建模能力、操控能力以及跨时空视觉推理能力。DeepMind对通用视频模型充满信心,认为未来“通才”会取代“专才”。

关键观点总结

关键观点1: DeepMind提出帧链CoF概念

DeepMind类比语言模型中的CoT提出了视频模型的CoF概念,使视频模型能够在时间和空间上进行推理。

关键观点2: Veo 3是通用视觉基础模型的代表

Veo 3具备通用视觉理解能力,可以零样本解决视觉任务,并且发展速度快,有望在未来成为机器视觉的通用基础模型。

关键观点3: Veo 3具备四大能力

测试发现Veo 3具备感知能力、建模能力、操控能力和跨时空视觉推理能力,其中跨时空视觉推理能力体现了CoF的概念。

关键观点4: 通用视觉模型的未来发展

DeepMind对通用视频模型充满信心,认为未来通才会取代专才。并且,通过多尝试策略、结合推理时缩放、RLHF指令微调等技术,以及成本下降等因素,视频模型的发展前景被看好。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照