Runway正式推出首个“界面世界模型”Solaris,标志着软件交互范式从“代码渲染”向“AI逐帧生成”跨越。该模型基于Gen-4.5架构,实现毫秒级实时响应与用户意图驱动的动态UI重构。
尽管在文本精度与无障碍适配上仍存挑战,但其61%的指令准确率偏好度已验证技术可行性,为下一代计算平台奠定原型基础。
模型地址: https://runway.com/news/research/introducing-solaris

当软件不再需要“写”出来
据 [Runway官网] 8月29日消息,知名AI视频生成公司Runway正式发布名为Solaris 的全新模型。这并非又一款文生视频工具,而是被定义为“界面世界模型”(Interface World Models)的首个落地产品。
简单来说,Solaris让软件和网页摆脱了预设代码的束缚,能够在用户使用过程中实时、逐帧地“画”出整个图形交互界面 。这意味着,未来的App可能不再是开发者提前写好的固定页面,而是根据你当下的需求,由AI现场生成的专属交互场景。
对于长期关注AI应用落地的朋友来说,这可能是继Sora之后,又一个真正触及“人机交互本质”的技术节点。
传统界面的“有损压缩”困境
要理解Solaris的价值,得先看清现有软件架构的痛点。
过去几十年,数字界面一直建立在两套割裂的系统之上:一套是“知晓事物”的AI助手(如大模型),擅长理解语义但无法直接操作界面;另一套是“实时响应”的传统程序(如前端代码、游戏引擎),能渲染动态效果却对用户的真实意图一无所知。
每一次人与软件的交互,都必须通过代码这个“中间层”进行转译 。这不仅牺牲了视觉表现的丰富性,更将无限可能的操作空间进行了严重的“有损压缩”。你看到的每一个按钮、每一个弹窗,都是开发者预先定义好的“标准答案”,而非为你量身定制的“最优解”。
Solaris的核心突破,正是将渲染与交互合二为一 。它跳过了代码转译环节,作为一个单一的世界模型直接生成每一帧画面,并对用户的输入做出即时、连贯的动态响应。
实测体验:像逛实体店一样操作软件
这种抽象的技术描述,落到实际体验中是什么样的?
据 [Runway官方演示] 显示,在虚拟服装店场景中,用户可以直接上传自己的照片作为参考,像在现实中一样自然地拖拽衣架上的衣服进行试穿 ,无需点击任何“试穿”按钮或等待页面跳转。又或者,仅凭一句语音指令“把桌子换成深色,灯光调暖一点”,场景中的家具位置、材质、光影便会随之实时演变。
软件不再是一堆冰冷脚本的堆叠,而变成了一个鲜活的、可对话的场景 。这种开放式、沉浸式的体验,彻底打破了传统GUI(图形用户界面)的线性操作逻辑。
比如下面视频这个例子:
• 向上拖动树,树就会变大
• 向斜下方拖动壁画,壁画也会变大
• 把灯拖出来移动位置,它就会放到你拖动到的最终位置,并重新渲染光线和物体之间的交互
• 点击的话还会弹出一个 UI 选项,让你去变换样式 这一切都是基于视频模型去完成的。
我觉得这个想法和思路还是挺好的,但目前实时生成的问题依然比较大。 主要问题在于延迟、实时生成的成本、一致性,以及连贯性和速度问题
硬核拆解:Gen-4.5如何撑起实时交互
作为一项前沿技术,Solaris并非凭空出现,而是建立在Runway成熟的Gen-4.5视频生成模型 之上。其在三个关键维度实现了工程化突破:
- 速度 :通过自回归生成机制和多步去噪蒸馏技术,将原本需要数秒的视频生成过程压缩至可跟上人类操作节奏的实时运行速度 。
- 协同 :采用大语言模型与世界模型的双系统架构。LLM负责解读用户意图并指导场景演变方向,世界模型则专注视觉的实时渲染,二者分工明确、无缝衔接。
- 成本 :通过对快速模型的持续训练,在保持长会话和多步交互连贯性的同时,大幅降低了推理成本 ,使实时生成具备商业可行性。
数据说话:61%准确率偏好度验证可用性
新技术最怕“Demo惊艳、实测拉胯”。在客观评测层面,Solaris交出了一份相对扎实的成绩单。
在对比多模态大语言模型仅凭截图重建界面的基准测试中,研究发现传统转译方式会随着视觉复杂度提升而不可避免地丢失细节,而Solaris从第一帧起便完美保留了界面的视觉与语义状态 。
更值得关注的是用户侧反馈。在包含7500多次成对比较的研究中,参与者在“遵循指令准确度”和“行为自然度”两项指标上,对Solaris的偏好度分别达到61%和71% ,显著优于传统编码界面孤立更新UI的表现。这一数据表明,AI生成界面在可用性与体验感上已初步跨越“能用”的门槛。
冷静看待:三大挑战仍需时间攻克
当然,作为一项处于前沿的创新技术,Solaris远未到完美阶段。结合行业观察与技术文档,当前至少存在三个亟待解决的难题:
- 高精度文本生成仍是短板 :视频生成模型在渲染清晰、可读的UI文字方面依然存在天然缺陷,错字、模糊、排版错乱等问题在复杂界面中尤为明显。
- 长周期一致性待优化 :在开放式、多轮次的深度交互中,维持视觉风格与语义逻辑的长期稳定,仍是世界模型领域的共性挑战。
- 无障碍生态尚未打通 :现有屏幕阅读器、键盘导航等无障碍API均基于DOM结构设计,纯像素生成的界面对视障用户极不友好 ,需重新设计适配方案。
这些问题的解决,不仅依赖模型迭代,更需要整个软件生态的协同演进。
下一代计算平台的雏形已现
尽管挑战犹存,但界面世界模型的出现,已然勾勒出下一代计算平台的演进方向。
它有望彻底消除传统“应用”的边界,让软件根据用户的即时意图进行千人千面的动态重塑。我们或许正在见证一场从“人适应软件”到“软件适应人”的范式迁移 。
目前,Runay已面向核心合作伙伴开放Solaris的抢先体验申请。对于开发者、产品经理及交互设计师而言,现在正是理解并布局这一新范式的最佳窗口期。
AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。
想了解AITOP100平台其它版块的内容,请点击下方超链接查看
AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说
AITOP100平台官方交流社群二维码:










