

机器之心编辑部
过去,AI 改写软件开发的方式,大体遵循着同一条路径。人说一句话,模型写代码;代码跑起来,再变成网页、App 和各种可以点击的界面。从 Copilot 到 Cursor,再到越来越多 Coding Agent,模型已经接手了相当一部分编程工作。但有一件事没变:代码仍然夹在人的想法和最终界面之间。
现在,Runway 想把这一层直接拿掉。
今天凌晨,Runway 公布了一项新研究 Solaris,并将其定义为首个 Interface World Model,界面世界模型。
它提出的问题很直接:如果操作系统里的 App 和网站,不再提前写好,而是在你使用的过程中实时生成,会发生什么?Solaris 给出的答案是,界面可以像视频一样生成。

你点一下、拖一下,或者输入一句话,模型便根据当前状态继续生成下一帧。按钮、物体、场景以及随之发生的变化,都不必由开发者提前逐项写进代码里。
换句话说,在 Solaris 的设想里,你眼前看到的画面,本身就可以成为软件。这也是 Runway 从视频生成走到世界模型之后,又一次明显的方向扩张。

有人感叹道,「太猛了,你们还是一如既往地领跑。已经迫不及待想看看未来半年世界模型会进化到什么程度。」

当一张图真的可以「运行」
今天的 AI 已经很会画界面了。给模型一句 Prompt,它可以生成一张完成度很高的电商页面、产品官网,甚至一整套 App 设计稿。问题在于,这些图只能看,不能真正运行。
想让图片里的衣服可以被拖动,让购物车能够计算价格,让页面根据点击发生变化,设计最终还是要经过 HTML、CSS、JavaScript 或其他程序语言,转换成计算机能够执行的结构。
Runway 对这件事的看法相当激进。在它看来,这次转换本身就是一种信息损失。
一张复杂的视觉设计里,可能包含材质、光影、空间关系、细微的物体状态。但当它被重新表达成组件、布局和代码后,程序保留下来的,只是开发者提前决定要实现的那一部分行为。软件最终能够发生什么,也因此在上线之前就基本确定了。
Solaris 试图换一条路:不再先把画面翻译成代码,再让代码驱动画面;模型直接在视觉空间里处理界面和交互。
例如,在 Runway 展示的一个虚拟服装店场景里,整个店面本身就是界面。用户可以从衣架上拿起一件衣服,把它拖到自己身上试穿,也可以直接移动店里的陈设。

传统网页需要开发者预先定义:这个区域可以点击,那个物体允许拖拽,拖到这里之后触发什么事件。到了 Solaris,这些变化由模型根据当前画面和用户动作继续生成。

界面的边界因此变得模糊了。它可以是一排按钮,也可以是一间店、一张桌子、一幅画,甚至一个完整的三维场景。

Runway 是怎么把视频模型变成「软件」的?
Solaris 并不是从零训练出来的一套新系统。它建立在 Runway 的视频生成模型 Gen-4.5 之上,并沿用了此前 GWM-1 世界模型的技术路线。
第一步,是让视频模型真正理解「交互」。
Solaris 在生成下一帧时,会把点击、拖拽等用户输入也作为条件。模型看到的不只是连续的画面,同时还看到画面发生变化之前,人做了什么。看过足够多这样的对应关系后,它能够学习某个动作和视觉结果之间的联系。
因此,当用户拖动一个物体时,系统不一定需要一段事先写好的程序告诉它「拖拽之后将 X 坐标增加多少」,模型可以直接预测这个动作之后的视觉状态应该是什么。
但仅仅理解动作还不够。一个界面如果点一下之后等几秒钟才动起来,基本没法用。传统视频扩散模型往往需要经过几十步去噪,生成一段视频可能需要数秒甚至更长时间。对于看视频,这个速度还能接受;换成鼠标交互,就完全是另一回事。
Runway 给 Solaris 做了三步改造。先把生成过程变成逐帧自回归,让当前帧只依赖已经出现的内容;再把原本多步的去噪过程蒸馏到少数几步;最后,让加速后的模型继续用自己的生成结果训练,以减少长时间连续运行后的画面漂移。
Runway 称,这套方法最终让 Solaris 达到了能够进行实时交互的生成速度,同时维持 Gen-4.5 教师模型的视觉质量。官方给 Solaris 设定的目标之一,是在 720p 下保持长时间交互中的视觉质量。

Solaris 还有一处设计很值得注意。真正驱动这套系统的,并不是单独一个视频模型。接下来,Runway 把整个过程拆成了两个部分:语言模型负责推理,世界模型负责渲染。
语言模型先理解用户想完成什么,判断当前场景应该发生局部变化,还是应该切换到一个新的状态,再生成用于指导 Solaris 的提示。Solaris 随后负责把这个变化真正画出来,并持续生成后续画面。一个决定应用下一步应该做什么,另一个决定这件事应该怎样出现在屏幕上。
这让 Solaris 和单纯的「AI 生成网页」拉开了距离。
最后一个重要的能力是持续生成。
你只需要提供一个初始状态,比如一个品牌场景或产品展示场景,模型就会实时持续生成画面帧。当用户点击、拖拽或输入内容时,这些交互会被纳入后续画面的生成过程,场景也会随之在原地实时响应。
整个过程中,没有预先定义好的页面,也没有固定模板可以调用。取而代之的是,通过文本提示来定义在特定场景中,点击、拖拽以及其他交互分别意味着什么。

和前沿大模型比,Solaris 表现怎么样?
Runway 也专门设计了一组实验,验证这种路线到底有没有意义。
第一组测试针对的是「翻译损失」。Runway 选取了 30 个不同复杂度的界面,包括普通网页、图片密集型网页以及自然图像,让包括 Claude Fable 5 在内的多模态模型根据单张截图重建界面。
评估采用了两类指标。一个是 SSIM,即结构相似度,用来衡量重建结果与原始画面在位置和视觉结构上的相似程度。另一个使用 DINOv3 特征,把原始画面的不同区域与重建结果中的对应内容进行比较,用于观察即使布局发生变化,原始视觉信息究竟保留了多少。
Runway 公布的结果显示,随着画面复杂度增加,经由语言和代码重新构建界面时,信息损失会越来越明显。自然图像受到的影响尤其大。

第二组实验更直观。Runway 让 Solaris 和使用 Claude Opus 5 生成的代码界面从同一张图片开始,接受相同的交互要求,再让真人判断哪一种结果更好。实验覆盖 30 个交互案例,共邀请 250 名参与者,最终收集了接近 7500 次两两比较。
在「是否更好地遵循交互指令」这一项上,Solaris 获得 61% 的偏好,代码方案为 24%;在「行为是否更自然」这一项上,Solaris 的偏好比例达到 71%,代码方案为 21%。
至少在 Runway 设计的这批任务中,直接生成整个视觉状态,更容易让一次操作和周围环境保持连贯,而不是只修改被要求变化的那个 UI 元素。

更大的用途,可能还不是给人用
如果 Solaris 只是让网页变得更漂亮,它还不足以让 Runway 单独创造一个「Interface World Model」的概念。另一个更值得关注的用途,是 训练 Agent。
当前 Computer Use Agent 面临一个很现实的问题。互联网是为人设计的,而 Agent 需要学习怎样点按钮、填写表单、操作网页。模型如果大量在固定网站上训练,很容易把某一种具体布局学进去。换一个酒店网站,按钮的位置、页面结构甚至整个交互方式都变了,模型原先学到的操作经验可能迅速失效。
Solaris 提供的是另一种训练环境。
因为界面本身就可以不断生成,同一个任务能够对应大量不同的布局、视觉元素和交互路径。Agent 不能只记住「右上角有一个按钮」,而要真正理解:自己现在想完成什么,画面里什么东西具有对应功能,做完这个动作之后环境发生了什么变化。
Runway 认为,这可以提供一种持续变化、甚至此前从未存在过的界面,用来训练 Agent 的泛化能力。这里也能看出 Runway 最近一段时间世界模型路线的连贯性。
GWM-1 已经被用于可探索环境、实时角色和机器人;Runway 今年还公布过用世界模型模拟机器人策略执行的实验。现在,Solaris 又把「可交互模拟」推进到了电脑界面。
它们背后的共同思路很接近:让模型面对一个可以行动、可以观察结果、可以继续变化的环境。视频生成只是底层能力,Runway 真正想做的,是让视频模型逐渐承担「模拟器」的角色。
原文地址:https://runway.com/news/research/introducing-solaris

© THE END
转载请联系本公众号获得授权
投稿或寻求报道:liyazhou@jiqizhixin.com