• 首页
  • AI工具集
  • AI资讯
  • AI活动
  • AI社区
  • AI短剧
  • AI创作大赛
  • AI小说
  • AI绘画
    AI视频
    AI对口型
  • AI画布AI画布AI画布
AI 对话

World Labs 发布多模态世界模型 Atlas:支持像素级镜头控制,几张照片就能"走进"一个 3D 世界

World Labs 发布多模态世界模型 Atlas:支持像素级镜头控制,几张照片就能"走进"一个 3D 世界
小峰
56分钟前

先说结论:9 月 2 日,李飞飞创办的 World Labs 正式发布了新一代世界模型 Atlas。官方把它称为"全球首个能以像素级相机控制生成图像与视频帧、并重建为 3D 的多模态世界模型"。

这句拗口的话翻译成大白话,就一件事:过去 AI 生成视频,你只能用文字说"镜头往左移一点";现在 Atlas 能直接听懂"相机在三维空间里的精确位置和朝向",你像导演一样指定机位、角度和运动轨迹,它照着拍。而且,给它几张照片,它能把一个真实的 3D 场景重建出来,还能脑补出照片没拍到的地方。

这不是又一个"文生图"玩具,它赌的是更远的事——让 AI 真正理解空间和物理世界。

一、它到底能干什么

Atlas 是 World Labs 说的"全模态模型"(omni model),从零开始预训练,原生处理文本、图像、视频和 3D 四种数据。官方列了四大能力:

1. 像素级相机控制生成。 给它 1 到 6 张参考图,再指定一条相机运动路径,它就能生成最长 1 分钟、1440p 分辨率的视频。关键是镜头角度、路线都是你"点"出来的,不是靠猜文字提示词。

2. 空间重建。 从一张到几十张输入图,就能重建真实场景。它既能输出新视角的图像,也能输出点云、3D 高斯泼溅这种显式的 3D 结果。据官方披露,它在稀疏视角重建上的误差,已经优于多个专门的 3D 重建模型。

3. 时空模拟。 给它几段手机拍的视频,它能同时建模空间和时间,做《黑客帝国》式的"子弹时间"——用 3 到 5 台普通相机拍的素材,就能冻结时间、从原本拍不到的角度重新看同一个瞬间。

4. 图像生成。 文生图、360° 全景图,能遵循复杂指令、准确渲染文字,风格从写实到动漫都能驾驭。

二、"像素级镜头控制",到底牛在哪

这可能是全文最关键的一个词。

过去让视频模型"向左推轨""升个镜头",只能把这些电影术语写进提示词里,模型听懂多少是个黑箱。而 Atlas 的做法,是把相机的几何参数(位置、朝向)当成一种原生输入类型,和文本、图像平起平坐。

World Labs 自己打了个比方:这能让创作者"坐进导演椅,而不是在拉老虎机的拉杆"。

还有一个更妙的用法。你可以往它的"空间上下文"里放两张毫不相关的图片,再分别指定它们在三维空间里的位置,Atlas 就能生成一个在两者之间平滑过渡的世界——门廊、走道、转角,全靠它自己"脑补"出来。

这背后的核心设计,World Labs 叫它 spatial context(空间上下文)。类比一下大语言模型:LLM 把输入编码成 context,再基于它生成后续内容;Atlas 流程一样,区别是——进去的每一张图都被锚定在三维空间的一个具体位置,带着相机位姿一起进来。所以它能保持 3D 一致性,还能推理出没见过区域的画面。

三、它交出的成绩单

光说原理容易空,看看数字。

在相机可控生成上,World Labs 用单张输入图配一到三段运镜指令,交给第三方人类评分盲选。结果 Atlas 对 MiniMax H3 胜率 75%、对 Gemini Omni Flash 81%、对阿里 HappyHorse 1.1 86%、对 FLUX 3 93%、对字节 Seedance 2.5 94%——而且运镜轨迹越复杂,优势越明显。

不过这里要客观补一句:World Labs 自己在博客里写明了,对比的其他模型不接受相机位姿作为原生输入,只能靠文字描述运镜。所以这组胜率,很大程度衡量的是"原生相机接口"对"文字描述运镜"的差距,而不是纯粹的画面质量碾压。

3D 重建那边,Atlas 在稀疏视角重建上的平均误差是 25.3(AbsRel×10⁻³),优于几个开源专用重建模型。但同样,对比对象被限定在"最好的开源专用重建模型",且 Atlas 并非每个数据集都排第一。

一句话:成绩亮眼,但别被营销话术带偏,它强在"原生理解空间"这条新路上,而不是处处碾压。

四、它真正想解决的问题

World Labs 的故事,不能只从 Atlas 讲起。

李飞飞早在 ImageNet 时代就在做"让机器看懂图片里有什么";空间智能则把问题再推一层——不仅要知道"这是什么",还要知道"它在哪、从另一个方向看是什么样、和周围物体什么关系"。识别物体、生成画面、理解空间,是三件相关但不能画等号的事。

Atlas 最务实的落点,其实是机器人。今年 7 月 World Labs 收购了仿真公司 SceniX,这次是战略方向第一次以模型形态落地。

逻辑很简单:机器人训练最大的瓶颈,是缺少廉价、可控、可规模化的训练经验。现实中失败一次,要重置设备、恢复场景,还可能有损坏风险。Atlas 能做的是"真实转仿真"——用手机拍两段环境视频,各取 24 帧重建,然后模拟不同机器人沿不同路径行走,让 Atlas 生成机器人传感器"应该看到"的 RGB 和深度数据。环境重建和传感器渲染来自同一个模型,误差不会在接缝处累积。

对机器人、游戏、影视特效、AR/VR 这些行业来说,这件事的想象空间,比"又生成了一段漂亮视频"大得多。

五、别急,它还没完全准备好

说完了好的,也得说清楚边界。

目前 Atlas 处于早期访问阶段,只向部分合作伙伴开放,还没全面上线。技术上也有明确局限:它擅长静态空间几何建模,但对物体碰撞、复杂动力学这些物理模拟能力还没验证;没拍到的区域,补全靠"先验知识",可能出现几何漂移或纹理闪烁;长路径视频生成的稳定性也还需要提升。

换句话说,它今天更像一个"看得见、能推理空间"的世界模型,离"完全可靠、物理上站得住的模拟器"还有距离。用 World Labs 自己的话说,看的照片越多,模型的想象越少;只给一张图时,它会大量脑补没看到的部分。

六、这件事意味着什么

我的判断是,Atlas 标志着 AI 竞争的一条新线正在清晰起来:从"生成好看的画面",转向"生成够用的世界"。

Marble(World Labs 去年的产品)服务的是影视、游戏、建筑可视化,视觉逼真就够;机器人要的却是物理上站得住的场景,和能被传感器读到的深度数据。Atlas 把生成、重建、仿真收进同一个模型,是在回答一个更难的问题:世界模型除了做内容,还能不能做"现实"。

这也解释了为什么英伟达、AMD、Autodesk、Fidelity 愿意在今年 2 月投给它 10 亿美元、把估值推到约 50 亿美元。芯片公司、设计软件公司、世界模型,凑在一起不是巧合——一端管训练成本,一端管它能不能进真实生产流程。

对普通人来说,短期能感受到的,可能是影视、游戏、3D 建模的成本下降;长期看,它赌的是 AI 从"聊天、画画",进化到"理解并推演物理世界"。这条路能不能走通,现在还没有定论,但 Atlas 至少让"空间智能"这个词,从 PPT 里落到了可演示的模型上。

下次你看到那种"几张手机照片生成一条航拍大片"的演示,别只当魔术看——那背后,可能是一个模型正在学着"看见"这个世界。





0
0
文章来源:AI TOP100
免责声明:本文不代表本平台立场,且不构成投资建议,请谨慎对待。
全部评论
暂无评论
相关资讯
  • 每日AI资讯-2026年9月11日

  • 每日AI资讯-2026年9月10日

  • 每日AI资讯-2026年9月09日

  • 每日AI资讯-2026年9月08日

  • 每日AI资讯-2026年9月07日

热点资讯

每日AI资讯-2026年9月04日

8天前
每日AI资讯-2026年9月04日

每日AI资讯-2026年9月10日

2天前
每日AI资讯-2026年9月10日

AITOP100-AI画布「分享优质工作流」激励计划上线,3万积分等你来拿!🚀

5天前
AITOP100-AI画布「分享优质工作流」激励计划上线,3万积分等你来拿!🚀

AITOP100平台2026年9月初AI大赛汇总:7场大赛总奖金257.3万

9天前
AITOP100平台2026年9月初AI大赛汇总:7场大赛总奖金257.3万

每日AI资讯-2026年9月09日

3天前
每日AI资讯-2026年9月09日
分享
0
0

欢迎来到AI Top100!我们聚合全球500+款AI智能软件,提供最新资讯、热门课程和活动。我们致力于打造最专业的信息平台,让您轻松了解全球AI领域动态,并为您提供优质服务。

合作伙伴
联系我们
加入AITOP100社群
加入社群
AITOP100商务微信
商务微信
相关链接
服务及隐私政策
网站地图
关于我们
粤ICP备2022124843号-2粤公网安备44030002004505广播电视节目制作经营许可证:(粤)字第00712号Copyright © 华强方特(深圳)动漫有限公司 版权所有