先说结论:9 月 2 日,李飞飞创办的 World Labs 正式发布了新一代世界模型 Atlas。官方把它称为"全球首个能以像素级相机控制生成图像与视频帧、并重建为 3D 的多模态世界模型"。
这句拗口的话翻译成大白话,就一件事:过去 AI 生成视频,你只能用文字说"镜头往左移一点";现在 Atlas 能直接听懂"相机在三维空间里的精确位置和朝向",你像导演一样指定机位、角度和运动轨迹,它照着拍。而且,给它几张照片,它能把一个真实的 3D 场景重建出来,还能脑补出照片没拍到的地方。
这不是又一个"文生图"玩具,它赌的是更远的事——让 AI 真正理解空间和物理世界。
一、它到底能干什么
Atlas 是 World Labs 说的"全模态模型"(omni model),从零开始预训练,原生处理文本、图像、视频和 3D 四种数据。官方列了四大能力:
1. 像素级相机控制生成。 给它 1 到 6 张参考图,再指定一条相机运动路径,它就能生成最长 1 分钟、1440p 分辨率的视频。关键是镜头角度、路线都是你"点"出来的,不是靠猜文字提示词。
2. 空间重建。 从一张到几十张输入图,就能重建真实场景。它既能输出新视角的图像,也能输出点云、3D 高斯泼溅这种显式的 3D 结果。据官方披露,它在稀疏视角重建上的误差,已经优于多个专门的 3D 重建模型。
3. 时空模拟。 给它几段手机拍的视频,它能同时建模空间和时间,做《黑客帝国》式的"子弹时间"——用 3 到 5 台普通相机拍的素材,就能冻结时间、从原本拍不到的角度重新看同一个瞬间。
4. 图像生成。 文生图、360° 全景图,能遵循复杂指令、准确渲染文字,风格从写实到动漫都能驾驭。
二、"像素级镜头控制",到底牛在哪
这可能是全文最关键的一个词。
过去让视频模型"向左推轨""升个镜头",只能把这些电影术语写进提示词里,模型听懂多少是个黑箱。而 Atlas 的做法,是把相机的几何参数(位置、朝向)当成一种原生输入类型,和文本、图像平起平坐。
World Labs 自己打了个比方:这能让创作者"坐进导演椅,而不是在拉老虎机的拉杆"。
还有一个更妙的用法。你可以往它的"空间上下文"里放两张毫不相关的图片,再分别指定它们在三维空间里的位置,Atlas 就能生成一个在两者之间平滑过渡的世界——门廊、走道、转角,全靠它自己"脑补"出来。
这背后的核心设计,World Labs 叫它 spatial context(空间上下文)。类比一下大语言模型:LLM 把输入编码成 context,再基于它生成后续内容;Atlas 流程一样,区别是——进去的每一张图都被锚定在三维空间的一个具体位置,带着相机位姿一起进来。所以它能保持 3D 一致性,还能推理出没见过区域的画面。
三、它交出的成绩单
光说原理容易空,看看数字。
在相机可控生成上,World Labs 用单张输入图配一到三段运镜指令,交给第三方人类评分盲选。结果 Atlas 对 MiniMax H3 胜率 75%、对 Gemini Omni Flash 81%、对阿里 HappyHorse 1.1 86%、对 FLUX 3 93%、对字节 Seedance 2.5 94%——而且运镜轨迹越复杂,优势越明显。
不过这里要客观补一句:World Labs 自己在博客里写明了,对比的其他模型不接受相机位姿作为原生输入,只能靠文字描述运镜。所以这组胜率,很大程度衡量的是"原生相机接口"对"文字描述运镜"的差距,而不是纯粹的画面质量碾压。
3D 重建那边,Atlas 在稀疏视角重建上的平均误差是 25.3(AbsRel×10⁻³),优于几个开源专用重建模型。但同样,对比对象被限定在"最好的开源专用重建模型",且 Atlas 并非每个数据集都排第一。
一句话:成绩亮眼,但别被营销话术带偏,它强在"原生理解空间"这条新路上,而不是处处碾压。
四、它真正想解决的问题
World Labs 的故事,不能只从 Atlas 讲起。
李飞飞早在 ImageNet 时代就在做"让机器看懂图片里有什么";空间智能则把问题再推一层——不仅要知道"这是什么",还要知道"它在哪、从另一个方向看是什么样、和周围物体什么关系"。识别物体、生成画面、理解空间,是三件相关但不能画等号的事。
Atlas 最务实的落点,其实是机器人。今年 7 月 World Labs 收购了仿真公司 SceniX,这次是战略方向第一次以模型形态落地。
逻辑很简单:机器人训练最大的瓶颈,是缺少廉价、可控、可规模化的训练经验。现实中失败一次,要重置设备、恢复场景,还可能有损坏风险。Atlas 能做的是"真实转仿真"——用手机拍两段环境视频,各取 24 帧重建,然后模拟不同机器人沿不同路径行走,让 Atlas 生成机器人传感器"应该看到"的 RGB 和深度数据。环境重建和传感器渲染来自同一个模型,误差不会在接缝处累积。
对机器人、游戏、影视特效、AR/VR 这些行业来说,这件事的想象空间,比"又生成了一段漂亮视频"大得多。
五、别急,它还没完全准备好
说完了好的,也得说清楚边界。
目前 Atlas 处于早期访问阶段,只向部分合作伙伴开放,还没全面上线。技术上也有明确局限:它擅长静态空间几何建模,但对物体碰撞、复杂动力学这些物理模拟能力还没验证;没拍到的区域,补全靠"先验知识",可能出现几何漂移或纹理闪烁;长路径视频生成的稳定性也还需要提升。
换句话说,它今天更像一个"看得见、能推理空间"的世界模型,离"完全可靠、物理上站得住的模拟器"还有距离。用 World Labs 自己的话说,看的照片越多,模型的想象越少;只给一张图时,它会大量脑补没看到的部分。
六、这件事意味着什么
我的判断是,Atlas 标志着 AI 竞争的一条新线正在清晰起来:从"生成好看的画面",转向"生成够用的世界"。
Marble(World Labs 去年的产品)服务的是影视、游戏、建筑可视化,视觉逼真就够;机器人要的却是物理上站得住的场景,和能被传感器读到的深度数据。Atlas 把生成、重建、仿真收进同一个模型,是在回答一个更难的问题:世界模型除了做内容,还能不能做"现实"。
这也解释了为什么英伟达、AMD、Autodesk、Fidelity 愿意在今年 2 月投给它 10 亿美元、把估值推到约 50 亿美元。芯片公司、设计软件公司、世界模型,凑在一起不是巧合——一端管训练成本,一端管它能不能进真实生产流程。
对普通人来说,短期能感受到的,可能是影视、游戏、3D 建模的成本下降;长期看,它赌的是 AI 从"聊天、画画",进化到"理解并推演物理世界"。这条路能不能走通,现在还没有定论,但 Atlas 至少让"空间智能"这个词,从 PPT 里落到了可演示的模型上。
下次你看到那种"几张手机照片生成一条航拍大片"的演示,别只当魔术看——那背后,可能是一个模型正在学着"看见"这个世界。








