李飞飞新访谈:LLM 预测 Token,世界模型预测「新视角」
昨天
李飞飞联同 World Labs 另外两位联创做客 a16z 详解多模态世界模型 Atlas。Atlas 核心是新视角预测,区别于 LLM 的下一个 token 预测、视频模型的下一帧预测,输入场景若干视角或描述,能输出时空任意位置的画面。它首次将生成与重建纳入同一模型,原生处理文字、图像、视频、3D、相机位姿等多模态。传统 3D 重建需数百上千张照片,Atlas 可将采集量降至几张、几十张,仅用三部 iPhone 就能拍出《黑客帝国》式子弹时间视频。Atlas 由前一代模型 Marble 迭代而来,Marble 以高斯泼溅为输出表示存在瓶颈,Atlas 则以新视角预测为基本原语,突破了这一限制。其实现生成与重建统一,解决了传统重建易有盲区、需靠生成补全的问题,且具备可扩展的空间上下文窗口。应用场景上,Atlas 可服务创意工作者,提供 3D 一致的生成内容,还能应用于建筑设计、施工等领域。在机器人领域,它可大幅提升现实到仿真的效率,解决机器人训练数据不足的问题,未来还可接入动态数据,连接动作规划。目前 Atlas 已具备初步动态处理能力,后续将在动态、编辑、交互等方面推进,目标是构建能让用户与 3D 世界直观交互的系统。研发团队认为,新视角预测和下一个 token 预测地位相当,可能是通往 AGI 的基础原语。
李飞飞新访谈:LLM 预测 Token,世界模型预测「新视角」
智源社区/36Kr/投资界
体验专业版特色功能,拓展更丰富、更全面的相关内容。