当地时间9月1日,World Labs正式发布了新一代世界模型Atlas。官方给它的定义是“面向空间智能的全能世界模型”,也是他们口中“全球首个多模态世界模型”——能以像素级精确的相机控制生成图像和视频帧,并将其在3D中重建。
消息一出,开发者、用户、投资人几乎同时把目光投了过来。毕竟这是李飞飞离开斯坦福教职、创办World Labs之后交出的第一份硬核答卷。
而更让人在意的是,过去三年全行业都在往大模型里死命塞文字和代码的时候,她始终没有跟上那条拥挤的主赛道。
模型地址:worldlabs官网(海外网站需要科学上网)

一条少有人走的路
李飞飞在斯坦福反复讲的那个词叫Spatial Intelligence,空间智能。听起来学术,但内核很朴素:让AI跨过符号表层,直接理解物理世界的三维几何、时间连续性与因果律。Atlas就是这条哲学路线的第一个实体物证。
过去几年我们习惯了什么?把人类所有的文字、代码、对话喂给模型,以为读懂了语言就读懂了世界。但李飞飞那句话戳得很准:“大自然的天空上从来没有写着字。”
真实世界是由3D几何、材质结构和物理定律堆出来的。你把全人类的文字读上一万遍,AI依然不知道一块石头砸进水里究竟会掀起怎样的波纹。语言只是人类发明出来描述现实的压缩协议,它根本不是现实本身。真实世界没有Token,只有连续的坐标、光线的折射、物体的遮挡,以及不可逆的重力。
这就是为什么World Labs从第一天起就不打算走纯文本的老路。大模型可以借用,但从哲学和底层逻辑来看,这完全是截然不同的两座大山。以前是让AI在人造的文字牢笼里做填字游戏;从今天起,它必须真正睁开眼,去理解这个充满物质与碰撞的三维现实。
语言负责让AI懂人,空间智能才负责让AI懂世界。
Atlas到底做了什么
回到产品本身。Atlas被称为“全能世界模型”,不是因为它什么都能聊,而是因为它能在一个统一框架下同时处理图像生成、视频帧合成与3D重建,并且保持像素级的相机控制精度。这意味着你可以像操作真实摄像机一样指定视角、焦距、运动轨迹,模型输出的内容在几何上是一致的、可重建的,而不是一堆视觉上相似但空间关系混乱的图片序列。
这对影视预演、机器人仿真、工业设计、游戏资产生成等场景的意义,远比“又出了一个生图工具”要深得多。它验证了一件事:不依赖纯语言建模,AI也能建立起对物理世界的有效表征。
泼醒之后
Atlas的发布当然不是终点。World Labs自己也说这是“早期预览”,距离通用空间智能还有很长的路。但它至少完成了一个关键动作:在所有人都在卷文本scaling law的时候,有人真的把另一条路走通了第一步,而且拿出了可运行的系统。
这对行业的意义,可能比跑分更重要。它提醒我们,AGI的拼图里,语言只是一块。那些被我们默认“常识”的东西——物体不会穿模、重力永远向下、杯子倒了水会流出来——从来不在训练语料里,它们藏在三维世界的结构本身之中。
李飞飞没有否定大模型的价值,她只是指出了一个被狂热掩盖的事实:读懂人类说的话,和读懂人类所处的世界,是两件完全不同的事。前者我们已经走了很远,后者才刚刚开始。
Atlas睁开了眼。接下来要看的是,这只眼睛能看多远、看多深,以及整个行业愿不愿意跟着一起,从文字的舒适区里走出来。
AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。
想了解AITOP100平台其它版块的内容,请点击下方超链接查看
AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说
AITOP100平台官方交流社群二维码:










