炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
(来源:封面新闻)
封面新闻记者 边雪
当地时间2026年9月1日,“AI教母”李飞飞创办的World Labs发布了新一代世界模型Atlas。官方称其为“全球首个多模态世界模型”,一个可以原生处理文本、图像、视频、相机位姿与3D深度信息,并在同一套模型中完成世界生成、空间重建和时空模拟的全模态世界模型。
World Labs生成模型。(图源官网)2024年9月,李飞飞以2.3亿美元启动资金创办World Labs,两年之后,一张照片可以生成三维世界,从“生成好看的世界”转向“生成够用的世界”。
从“生成画面”到“生成世界”
Atlas最直观的突破,在于它将相机控制从“文字玄学”变成了“像素级精确”。
过去,用户在视频生成模型的提示框里输入“镜头缓慢向左拉升、绕着人物微仰角旋转”,结果全凭运气。Atlas的做法是把“相机位姿参数”当作底层原生输入,你要什么角度、什么轨迹、直接给坐标。
只需输入1到6张普通照片,定好运镜轨迹,Atlas就能生成最长1分钟、1440p分辨率的视频。官方演示中,输入一张只拍到机器人正面的照片,Atlas能补全机器人背面;给一张泳池边角照,它能脑补出隔壁没拍到的草坪和远山。
World Labs将Atlas的能力划分为四类:相机控制生成、空间重建、时空模拟和图像生成。
空间重建方面,传统3D高斯泼溅或点云扫描需要扛着专业设备围着目标转几十圈、拍几百上千张照片。Atlas在斯坦福大学Main Quad的演示中,仅用2到25张游客视角的地面平拍照,就还原了草坪、拱廊和纪念教堂外墙的全部细节,并生成了上帝视角航拍漫游。在DTU、ETH3D、ScanNet等公开数据集上,Atlas的稀疏视角重建误差(AbsRel ×10⁻³)达到了25.3。
时空模拟则让Atlas能根据输入视频同时建模空间和时间,支持视频重新构图和机器人的Real-to-Sim(真实到模拟)工作流,
“空间上下文”:给每张照片一个三维坐标
Atlas的核心设计,World Labs称之为“空间上下文”。
架构上,Atlas是一个多模态自回归扩散Transformer。类比大语言模型:LLM把输入编码成context再生成后续token,Atlas流程相同,区别在于进入context的每一张图像都被锚定在三维空间中的一个具体位置,它带着相机位姿一起进来。
这意味着你可以往空间上下文里放两张毫不相关的参考图,并指定它们在三维空间中的相对位置,Atlas会生成一个在两者之间平滑过渡的世界,自己想象出门廊、走道和转角。
李飞飞本人将Atlas视作World Labs的“里程碑式”成果,在社交平台置顶称:“Atlas为从视觉特效到机器人的众多应用场景打开了大门。”其高徒、英伟达机器人主管Jim Fan评论:“这是机器人领域Real-to-Sim的一大步。”
12亿美元与“空间智能”的终局
Atlas的发布,正值World Labs资金弹药充足的时刻。
2026年2月,World Labs宣布完成10亿美元(约合人民币72亿元)融资,投资方包括芯片巨头AMD和英伟达,Autodesk单独出资2亿美元。在此之前,李飞飞2024年9月已筹集2.3亿美元启动资金。
累计超过12亿美元的融资规模,押注的正是“空间智能”这条赛道。
李飞飞与World Labs联合创始人李昀烛曾指出,人工智能的未来绝不能仅依赖缺乏物理约束的语言和文本理解,更要让机器具备感知、推理并与物理空间实时交互的“空间智能”。World Labs始终认为,机器人是空间智能和世界模型极其重要的应用场景。
2026年7月,World Labs推出了Real2Sim2Real物理AI解决方案。而Atlas的机器人模拟能力正是这一路径的延伸——仅需输入几张照片,它就能生成逼真的RGB和深度数据,让机器人在更多不同的模拟空间中进行训练和测试。
竞品方面,Meta的LeCun、Google Project Genie、NVIDIA Cosmos都在布局世界模型。李飞飞认为市场足够大,World Labs有先发认知优势与顶尖团队,专注做“真正理解物理世界的模拟层”。
Atlas目前仅向少数合作伙伴开放早期访问。有开发者公开表示,在Atlas使用过程中,镜头一旦进入原图没有拍到的区域,模型仍需依赖先验去“猜”。“视角跨度越大、生成路径越长,局部几何漂移、物体形状变化和纹理闪烁也越容易暴露。”开发者罗佟锡向记者解释道,所以Atlas生成的更像是一个视觉上合理的三维世界。
从“理解文字”到“理解空间”,李飞飞正在走一条与主流大语言模型截然不同的路。这条路能否跑通,Atlas能否成为AI物理世界的关键拼图,尚需时间检验。