世界模型可模拟物理世界,被广泛认为是AI开发的下一个重大前沿领域。
由斯坦福大学教授李飞飞联合创立的初创公司World Labs周二发布了Atlas,这是一款全新的世界模型,能够根据文本、图像和视频提示生成并修改照片级逼真的可交互虚拟环境。
这家初创公司在博客文章中表示,Atlas是从零开始预训练的,允许用户创建三维环境,并从他们指定的任意摄像机位置和角度进行查看。
出生于中国的李飞飞被誉为“AI教母”,她的研究在2010年代初推动了深度学习革命。她最近将研究兴趣转向世界模型,因为这类模型在模拟真实世界环境以及近似物体运动及其与周围环境交互的物理规律方面具有巨大潜力。这类模型有望在人形机器人和自动驾驶领域取得突破,同时也适用于视频游戏和交互内容等创意产业。
World Labs于2024年结束隐身模式,目前面临着来自中国日益激烈的竞争——今年中国涌现出众多初创公司,竞相开发世界模型。
Atlas可生成交互式图像和视频,与Google的Gemini Omni等其他世界模型直接竞争。其潜在市场也与字节跳动的Seedance 2.5和Google的Veo等视频生成模型存在重叠。