
一、World Labs是什么?
World Labs 是由斯坦福大学教授、“AI教母”李飞飞于 2024年 创立的 AI 公司。公司的核心使命是 实现“空间智能”(Spatial Intelligence) ——即让 AI 不仅能识别图像,更能像人类一样理解、推理、生成并与三维物理世界进行交互。
李飞飞将人类智能归结为两大类:语言智能 和 空间智能 。语言模型让机器学会了遣词造句与逻辑推理,而空间智能则让机器理解世界的物理本质——物体如何存在、如何运动、如何相互作用。World Labs 所做的,正是通过构建“世界模型”(World Model)来实现这一目标。
公司的创始团队阵容豪华:除了李飞飞本人外,还包括她的学生 Justin Johnson,以及由 a16z 合伙人引荐的两位科学家 Christoph Lassner 和 Ben Mildenhall。2024年9月,World Labs 以 2.3亿美元 融资结束隐身状态正式亮相。2026年2月,公司完成 10亿美元 新一轮融资,投后估值达到 50亿美元 ,投资方包括英伟达、AMD、Autodesk、Emerson Collective、富达管理研究公司等顶级机构。
二、主要产品
World Labs 目前推出了两款核心产品:
1. Marble(2025年11月发布)
Marble 是 World Labs 的 首款商用世界模型产品 。它是一个生成式多模态世界模型,能够通过一张图、一句话、一个视频,直接生成一个完整、可探索的 3D 世界。
核心特点:
- 多模态输入 :支持文本、单图、多图/视频、3D 布局等多种输入方式
- AI 原生编辑 :内置编辑工具,可对生成的 3D 世界进行局部微调或全局调整
- Chisel 模式 :针对高级用户的实验性工具,将世界的“结构”与“风格”分离,先用简单几何搭建骨架,再用文字填充细节
- 世界扩展 :可在已生成场景基础上继续扩展,或通过“作曲家模式”将多个世界拼接成更大空间
- 多种导出格式 :支持导出为高斯溅射(Gaussian Splats)、三角网格或视频格式,可直接导入 Unreal、Unity、Blender 等创作工具
Marble 提供 免费增值模式 :免费版可生成约 4 个世界,标准版每月 20 美元;付费套餐最高 95 美元/月,提供 75 次生成及商业使用权。
2. Atlas(2026年9月发布)
Atlas 是 World Labs 的 新一代世界模型 ,被官方称为“全球首个多模态世界模型”。它是一个从零开始预训练的 全模态模型(omni model) ,原生支持文本、图像、视频、相机位姿与 3D 深度信息的联合处理。
Atlas 将作为未来版本 Marble 以及其他 World Labs 产品的底层驱动模型。
三、核心功能
Atlas 的能力覆盖 世界生成、空间重建和时空模拟 三大领域:
1. 相机控制生成(Camera-Controlled Generation)
Atlas 接受一张或多张参考图像,根据用户指定的任意相机位置和角度生成新视角。与传统视频生成模型依赖模糊的文本指令不同,Atlas 将精确的相机几何作为原生输入类型 ——你要什么角度、什么轨迹,直接给坐标。可输出最长 1 分钟、1440p 分辨率 的视频。
官方演示中,Atlas 从一张机器人正面照片出发,能生成该机器人的背面视角;给一张泳池边角照,它能“猜测”泳池旁边应该有一片草地——这说明模型不仅在插值像素,还在调用世界知识进行场景理解。
2. 空间重建(Spatial Reconstruction)
Atlas 可从 一张到数十张 输入图像中重建真实世界场景。它既能生成新视角下的图像帧,也能输出显式 3D 结构。官方展示的斯坦福大学 Main Quad 案例中,仅需 2 到 25 张游客视角的地面平拍照,就能还原草坪、拱廊及教堂外墙的全部细节。在 3D 重建任务上,Atlas 超越了专门为此设计的 SOTA 模型。
3. 时空模拟(Space-Time Simulation)
Atlas 从输入视频中同时建模空间与时间,能够对视频进行重新取景以产生电影级视觉效果。更重要的是,它支持 “现实到模拟再到现实”(Real-to-Sim-to-Real) 的机器人工作流——仅需喂几张照片,就能生成逼真的 RGB 和深度数据,让机器人在更多不同的模拟空间中进行训练和测试。
4. 图像生成(Image Generation)
Atlas 可根据文本生成图像和 360 度全景图,能够遵循复杂提示、渲染文字,并生成多种视觉风格。
四、核心技术架构
Atlas 采用 多模态自回归扩散 Transformer 架构 :
- 多模态 :原生处理文本、图像、相机位姿、3D 深度图等多种数据类型
- 自回归 :将输入输出视为序列,每次生成新内容都以前面已存在的序列为条件
- 扩散模型 :通过逐步去噪生成输出,推理时可调整去噪步骤数来平衡速度与质量
- 空间上下文 :所有输入都被锚定在三维空间中的具体位置,形成空间上下文。就像 LLM 看上文接下文,Atlas 则是给每张图片绑定三维坐标和深度,在空间中搭出一个带轴网的“房间”
Atlas 专为规模化设计 :其性能随训练计算量的增加而提升。
五、如何使用
目前 World Labs 的产品使用入口如下:
- Marble :访问官网 marble.worldlabs.ai,用户可直接在网页端用 WASD 键移动、鼠标拖拽调整视角,像玩第一人称游戏一样自由探索 AI 生成的 3D 空间
- Atlas :部分合作伙伴已获得抢先体验资格,官方表示将在未来几周内开放早期访问
- 开发者 API :开发者可通过 World Labs 平台 API 调用模型,需要先注册 Marble 账户并购买积分
六、应用场景
Marble 和 Atlas 覆盖广泛的行业应用:
- 游戏开发 :快速生成 3D 游戏场景与资产
- 影视特效 / 虚拟制片 :从照片生成虚拟运镜,节省实拍成本
- 建筑与室内设计可视化 :将设计图转化为可漫游的 3D 空间
- VR/AR 应用 :生成沉浸式 3D 环境
- 机器人仿真训练 :生成逼真的训练环境,解决具身智能数据匮乏问题
- 科学发现 :为科学研究提供可视化的 3D 建模与模拟环境
七、目标需求人群
- 创意工作者 :游戏开发者、电影特效师、VR/AR 内容创作者、建筑师、设计师
- 开发者与工程师 :需要通过 API 集成 3D 生成能力的开发者
- 机器人研究人员 :需要仿真训练环境来解决 Sim2Real 鸿沟的具身智能团队
- 企业客户 :需要大规模 3D 内容生成与空间重建的商业用户
八、最新动态(截至2026年9月)
- 2026年9月1日 :World Labs 正式发布 Atlas ,全球首个多模态世界模型
- 2026年8月 :World Labs 推出 Real2Sim2Real 物理 AI 解决方案
- 2026年7月 :World Labs 收购 3D 场景理解公司 SceniX
- 2026年4月 :推出 Marble 1.1 版本
- 2026年2月 :完成 10亿美元 新一轮融资,估值达 50 亿美元
- 2025年11月 :发布首款商用产品 Marble
- 2025年9月 :Marble 限量访问 Beta 测试版上线
- 2024年9月 :World Labs 以 2.3 亿美元融资结束隐身状态
AITOP100作为华强方特(深圳)动漫有限公司倾力打造的AI数智化聚合营销平台,同时也作为全网最全AI大赛活动举办和收录平台以及国内AI头部社区之一,平台已收录超700场AI视频、绘画、写作、算法等大赛。更有AI工具、资讯、教程、大咖直播。承办线上线下活动。快来参与或合作!
官网:https://www.aitop100.cn
想了解AITOP100平台其它版块的内容,请点击下方超链接查看
AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说
AITOP100平台官方交流社群二维码:


评论
全部评论

暂无评论
热门推荐
相关推荐

Llama
Meta Llama模型是Meta研发的大型语言模型系列,它基于先进的深度学习架构,旨在处理和理解自然语言。Llama模型以其强大的语言处理能力和广泛的应用场景,成为了AI领域的一款全能选手。无论是文本生成、语言理解,还是多模态交互,Llama模型都能展现出其卓越的性能。
阶跃AI
阶跃AI绝非又一个单纯的聊天机器人,它是上海阶跃星辰智能科技有限公司打造的多模态大模型生态矩阵。其核心定位极其犀利:以“Step系列”基座模型为核心,以“智能体(Agent)”为落地形态,旨在成为物理世界与数字世界的交互入口。
Parakeet-TDT-0.6B-V2
Parakeet-TDT-0.6B-V2是英伟达在语音识别技术领域的又一力作,它基于先进的FastConformer架构,并融合了创新的TDT解码器,是一款专注于英文自动语音识别的强大模型。作为Parakeet模型的升级版本,它不仅继承了前代模型的优秀基因,还在性能和功能上实现了重大突破。
魔搭社区
ModelScope魔搭社区是一个由阿里巴巴达摩院联合CCF开源发展委员会共同推出的中文AI模型开源社区。它致力于汇集业界领先的模型和丰富的数据集,为科研机构和科技公司提供一个分享和建设的平台。ModelScope的推出旨在降低AI应用门槛,推动技术创新和原创性模型研究的发展。
魔多
魔多AI社区是厚德云旗下一个专为AI创作者打造的趣玩社区,集算力GPU云服务器、模型与镜像分享、在线工作流、在线模型训练、算力激励等为一体的AI创作生态社区
CausVid
CausVid是一种基于自回归因果推理架构的AI视频生成模型,专为解决传统模型“生成速度慢、长视频质量差”的痛点而设计。由麻省理工学院计算机科学人工智能实验室(CSAIL)与 Adobe Research 联合研发,这一混合模型可以在几秒钟内生成高质量视频。
Magma AI
Magma是一款由微软精心打造的多模态AI模型,它旨在处理和整合图像、文本和视频等多种数据类型。与传统的AI系统不同,Magma不仅仅专注于视觉-语言理解或机器人操作等单一领域,而是将这两种能力结合成一个统一的模型,使得AI代理能够在数字和物理环境中执行更为复杂的任务。
小米MiMo-7B
MiMo-7B是小米AI实验室发布的首个专为推理(Reasoning)设计的开源大模型,该模型以7亿参数的轻量化架构,结合强化学习优化,展现了在数学、代码和通用推理任务上的卓越性能,甚至超越了多个32亿参数以上的基线模型。
0
0






