Runway 发布 Interface World Models 首个模型 Solaris,实时逐帧生成可交互界面

Runway:News(网页)·2026-08-31 00:00·15天前·Runway
AI 导读

Runway 发布 Solaris,称其为新模型家族 Interface World Models 的第一个模型,由世界模型实时逐帧生成界面并对点击、拖拽等交互作出响应,无需代码等中间表示。

Runway:News(网页)
精选
67AI 编辑部评分,满分 100

Runway 发布 Interface World Models 首个模型 Solaris,实时逐帧生成可交互界面

2026-08-31 00:00· 15天前· Runway
AI 导读

Runway 发布 Solaris,称其为新模型家族 Interface World Models 的第一个模型,由世界模型实时逐帧生成界面并对点击、拖拽等交互作出响应,无需代码等中间表示。

推荐理由

官方完整披露了模型机制、用户研究和局限,读者可以据此理解去除中间表示后界面生成与智能体训练的路径。

正文 · AI 翻译
Introducing Solaris

今天,我们分享 Solaris:这是我们称之为 Interface World Models 的全新 AI 系统家族中的首个模型。Solaris 始于一个问题:当一个操作系统在你使用它的过程中实时生成应用和网站时,会发生什么?

从早期的终端到 Linux 和 macOS,每一个操作系统都决定了屏幕上渲染什么,以及当人或程序对其操作时会发生什么。应用程序构建在其之上,并保持固定不变,直到有人推送更新。而 Solaris 则直接渲染这一层。它是一个实时交互模型,逐帧生成界面本身。每一帧都在你交互时被合成,使界面能够持续响应你的操作。

设计比以往任何时候都更加注重视觉,像素级精确的模型图和图像模型能够生成几乎与成品难以区分的完整界面。但图像并不像网站或应用那样运行。如今构建的每一款软件仍然需要一次转换:视觉设计必须先被转换为一种中间表示(例如代码),然后才能做任何事情。

这种中间表示限制了界面可以是什么样子,以及它如何响应人类和智能体的交互。每一种行为都必须事先被明确定义并实现,因此软件在发布时,只是对可能交互空间的一种有损压缩,在任何用户到来之前就已经被冻结。同样的转换过程也牺牲了视觉保真度。一旦设计被简化为一种简化表示,界面就能快速响应,但代价是放弃了原始设计的大量丰富性。

Solaris 将渲染与交互统一处理,消除了我们今天在设计中所关联的许多权衡。单一世界模型生成每一帧以及对用户输入的每一个响应,无需中间表示。由于没有转换步骤,也就没有损失,整个画面本身即成为界面。

我们认为 Solaris 开辟了构建网站、应用及其他在线界面的新方式。但它也是一种在更加动态的环境中训练智能体的新方法。即便是当今最好的 LLM,也难以完成基本的计算机使用任务,比如预订酒店或订购杂货。由于基于文本的模型被训练来使用编码界面,它们往往学到的是训练时所针对的特定布局,无法适应稍有差异的界面(比如两个不同的酒店网站)。通过压缩动作与响应之间的空间,Solaris 让智能体能够针对不断变化的界面、以及可能从未存在过的布局进行训练。

新功能

Solaris 为软件带来了三项新能力。

首先,Solaris 是完全视觉化的。当图像本身成为应用时,用户所见视觉之下便不再需要隐藏的第二层实现步骤。想象一下浏览一家虚拟服装店,展厅本身就是界面。只需用一张你自己的图像作为参考,你就能从衣架上拿起一件衬衫,把它拖到自己身上试穿,或者像在实体店里一样自然地重新摆放陈列。

其次,它是活的。由于应用是持续渲染的,它始终在演化,而不是等待用户的下一次操作。倒影会随光线变化而移动,物体在被操控时会自然地做出响应。用户可以说出像这样简单的话:“把桌子移一下,让我看看效果如何”或“改变 沙发的颜色。”其结果是,这款软件感觉不再像是在预设页面之间导航,而更像是与一个活生生的环境互动。

媒体内容 · 前往原文查看
即便是同一个起始帧——这里是一只手的 X 光片——也能对同一次拖拽做出两种完全不同的响应。

最后,它是开放式的。传统界面仅限于开发者在开发期间预先设想的交互,而 Solaris 能在同一场景中支持完全不同的行为,实时响应用户交互。这种灵活性将界面与预定义的工作流解耦,转而由驱动它的世界模型的能力来决定什么是可能的。

Solaris 将界面变成一种交互式体验,而不是一连串页面。用户无需从菜单中选择选项,而是直接与场景本身互动。制作一份沙拉就像把食材拖进碗里一样简单,每加入一种食材,界面都会自然地做出响应。

媒体内容 · 前往原文查看
如今,人们在上网遇到困难时会求助于 LLM。但 LLM 以文本作答,而大多数动手操作的任务并不是基于文本的问题。Solaris 会以可视化方式呈现你当前情境中的下一步,而且你可以对它进行引导。例如,你可以生成一个关于燃烧的交互式演示,让用户尝试不同的材料,并在交互过程中观察符合物理规律的反应。

为什么这件事直到现在才出现?

数字界面建立在两套系统之上,而这两套系统直到现在都生活在不同的世界里。

  • 那些“知道事情”的系统(例如搜索引擎和 AI 助手)以静态内容作答:文本、一张图片,或许还有嵌入的视频。
  • 那些实时响应的系统(例如 JavaScript/CSS、游戏引擎,以及更近期的交互式世界模型)能创造出丰富、可交互的体验,但它们对你的产品、你的任务或你想要达成的目标一无所知。

我们传统上把软件界面视为确定性程序,把世界模型视为视觉内容的生成器。而界面世界模型必须同时兼具两者:一个既能理解你的意图,又能围绕意图持续渲染出一个可交互世界的系统。

一旦你尝试构建这样一个系统,三个工程挑战便会立刻浮现:

  • 速度。交互在延迟达到约半秒左右时就会不再让人感觉是交互式的。视频扩散模型生成一段片段需要数秒甚至数分钟,这对内容创作来说可以接受,但对界面而言太慢了。要跨过这道门槛,模型必须逐帧顺序生成,每一帧只依赖于此前生成的内容,且成本要足够低,才能跟上用户的节奏。
  • 保持连贯。界面必须在整个会话过程中保持一致,而不仅仅是单个片段。它需要保留的东西(例如文本、布局、物体的身份特征)正是生成视频历来难以维持的东西,而生成持续得越久,小错误就会不断累积。
  • 成本。逐帧生成仍然比提供一个一次性构建好的页面更昂贵。让 Solaris 实现实时的那套工作,同时也让它的运行成本比标准视频扩散模型低了几个数量级,而且成本曲线还在持续改善。

Solaris 是我们的一次押注,赌的是这些概念性与技术性障碍能够被克服。我们构建它时聚焦于三点:实时交互、整个会话过程中的连贯性,以及在 720p 下依然保持的视觉质量。

Solaris 如何工作

Solaris 建立在我们 Gen-4.5 视频生成模型之上,我们对其进行了改造,使其能够(1)理解交互,(2)实时响应。它延续了我们以 GWM-1 开辟的路径,那是我们的通用世界模型。

学习交互。 Solaris 将用户输入视为对下一帧的条件约束,就像它对待文本或图像一样。模型在生成过程中观察点击、拖拽和其他交互,将它们用作接下来会发生什么的信号。由于模型只会看到已经发生的交互(从不会看到未来的交互),它学会了用户动作与视觉结果之间的关系。这意味着它知道当某物被点击、拖拽或修改时应该发生什么,而无需对这些交互进行显式编程。

实时运行。 标准的视频扩散模型需要对整段视频进行数十步去噪才能完成精修,这一过程对于动态的用户交互来说实在太慢。我们分三个阶段将 Solaris 改造成了一个实时引擎。首先,我们教会它以自回归方式生成帧,每一帧只依赖于之前的内容。接着,我们将多步去噪过程蒸馏为仅需几步。最后,我们在其自身输出上训练这个快速模型,从而让视觉质量在长时间交互中保持稳定。最终结果能够以交互级速度生成帧,同时保留原始教师模型的视觉质量。

推理与渲染。 Solaris 逐帧生成界面,而一个大语言模型则决定该界面如何演变。这个大语言模型解读用户请求,判断交互何时应修改当前场景、何时应过渡到新场景,定义让这个世界显得鲜活的行为,并生成提示词来引导 Solaris 渲染每一个状态。语言模型与世界模型共同将推理与渲染分离:一个决定应用接下来该做什么,另一个则实时生成该行为如何呈现并作出响应。

持续生成。你提供一个起始状态(例如品牌环境或产品场景),模型便会实时流式输出帧。当用户点击、拖拽或输入时,这些交互会被纳入接下来生成的帧中,场景会就地做出响应。这里没有预定义的界面,也没有可回退的模板。相反,文本提示词会规定点击、拖拽及其他交互在特定场景中的含义。

重新定义鼠标。一旦交互用自然语言来描述,而非通过编程实现,它们就不再需要事先固定下来。场景中的每个对象都可以成为一种新型工具。点击一只猫,你接下来的点击就会把它的毛色和质感应用到你触碰的任何东西上。点击一幅画,你或许就能开始以它的风格作画。

评估 Solaris

翻译的代价

此前,我们论证过,将界面翻译为中间表示不可避免地会造成信息损耗。为了衡量这种损耗,我们测试了当今的多模态语言模型能够多忠实地从一张截图中重建一个界面。

A plain product webpage next to reconstructions by GPT-4o, Gemini 2.5 Pro and Fable 5 An image-heavy event poster next to reconstructions by GPT-4o, Gemini 2.5 Pro and Fable 5 A natural photo of a kitchen scene next to reconstructions by GPT-4o, Gemini 2.5 Pro and Fable 5

为了衡量这一点,我们在从单张截图重建网站界面的任务上,评估了当前最先进的多模态语言模型,包括 Claude Fable 5。我们的评估覆盖了 30 个多样化的界面集合,从较简单的纯网页到图片密集的网页以及自然图像,以此考察视觉理解的不同方面。

我们以两种互补的方式衡量信息保留程度。首先,结构相似性(SSIM)在原位将重建界面与原始界面进行比较,捕捉视觉外观被复现的忠实程度。其次,我们使用 DINOv3 特征,将原始界面的每个区域与重建结果中任意位置最相似的区域进行比较,衡量即使元素发生移动或布局发生变化,底层的视觉内容是否仍然得以保留。

随视觉复杂度递增的重建保真度。即便多模态语言模型持续进步,重建质量仍会随着视觉复杂度的增加而持续下降,揭示出当界面经由语言转译时所丢失的信息。

尽管近年来进展迅速,每一个语言模型在重建过程中都会丢失信息。自然图像受到的影响最大,因为丰富的视觉细节无法用语言准确表达。随着界面变得更加复杂,即便是文本、布局或结构上的微小变化,也可能从根本上改变界面的行为方式。

Solaris 并非将界面翻译为语言再重新构建,而是直接在视觉界面本身上进行操作。通过消除中间表示,它从第一帧起就保留了界面的完整视觉与语义状态。

Solaris 与代码化界面

我们的重建基准衡量的是界面被翻译为代码时丢失了多少信息。接下来我们要问:给定相同的界面和相同的用户交互,哪种方法能产生更好的结果?代码化界面能否像由界面世界模型生成的界面那样,重现同样鲜活、灵敏的环境感受?

媒体内容 · 前往原文查看
点击任意元素都会使其升起并缓缓向上漂浮,悬停时保持其形状。
媒体内容 · 前往原文查看
镜头从灯塔阳台向右平移并向下俯仰,以一个平滑连贯的动作,最终定格在下方拍打岩石海岸的浪花上。

对比。虽然两个系统对相同的交互请求作出响应,但 Solaris 保留了整个场景的连贯性,产生的交互感觉更自然、更具物理真实感。

为了回答这个问题,我们将 Solaris 与一个最先进的大语言模型(Claude Opus 5)进行了对比。两个系统都从同一张图像出发,并接收相同的交互请求,我们记录了各自的响应方式。随后,我们开展了一项用户研究,涵盖 30 个交互示例、共 250 名参与者,收集了近 7,500 组两两对比判断。在每次对比中,参与者需回答两个问题:“哪个结果更好地遵循了给定指令?”以及“哪个在场景中的表现更自然?”

参与者在两项指标上都更偏好 Solaris。在遵循所请求的交互方面,Solaris 在 61% 的对比中更受偏好,而编码结果仅为 24%,另有 13% 被评为相当。在行为自然度方面差距更大,Solaris 在 71% 的对比中更受偏好,而编码网站仅为 21%,另有 6% 被评为相当。

第二个结果凸显了两种方法之间更广泛的差异。编码界面通常能够复现所请求的更改,但它将交互视为对界面的一次孤立更新。而在 Interface World Models 中,由于模型已经理解了物体、材质和环境的行为方式,它能够生成在场景中感觉连贯一致的交互,而不是将每个 UI 操作当作孤立元素来处理。

它目前还做不到什么

Solaris 最擅长环境运动、点击拖拽交互和场景过渡。但仍存在若干重要挑战:

  • 文本。 稳定、清晰的文本始终是视频生成中最棘手的问题之一,而界面对其依赖程度几乎超过任何其他视觉领域。一条切实可行的路径是采用混合系统:当可以接受短暂停顿时,由图像模型渲染文本密集的视图;而视频模型则负责处理连续交互。完全实时生成的文本仍是一个尚未解决的挑战。
  • 可信度。 对于教学或商业体验而言,一个令人信服的错误答案比没有答案更糟糕。如今,Solaris 通过你提供给它的内容来保持锚定。起始帧可以由真实的产品图像和参考素材构成,从而将场景扎根于实际存在的事物之上。随着会话的推进,基于更丰富的已验证上下文(参考图像、产品数据、文档)来条件化生成,是一个活跃的研究重点。
  • 长会话。 在长时间、开放式的交互中保持视觉和语义的一致性,仍然是一个活跃的研究领域。
  • 可访问性与集成。 生成的界面仍然需要能在软件栈的其他部分中正常工作,包括屏幕阅读器和无障碍 API 等辅助技术,这样灵活性才不会以牺牲可用性为代价。

这些挑战反映了实时生成模型当前的前沿水平,我们预计它们将随着底层模型本身的进步而改善。

新型界面

Solaris 是迈向全新操作层的第一步,我们看到了多种新的交互模式正在涌现。

  • 应用不再是与你交互的基本单元。如今,要完成一件事意味着打开为此预先构建的应用——一个用于购物,另一个用于看新闻,还有一个用于餐厅预订。如果操作系统能够生成有用的界面,那么无论用户想做什么,都无需再将软件归入固定的应用目录。你所需的一切会直接出现,并为你量身定制。
  • 界面世界模型消除了在视觉构想与中间表示之间进行转换的需要。无需通过 UI 框架、组件和代码来实现,任何视觉概念都可以变成可交互的界面。
  • 店面不再是每位访客看到的固定布局。它变成了一个生成式环境,在保持品牌识别度的同时适应每一个个体。产品、布局、颜色、材质和推荐会围绕你的意图实时重塑,让你的品牌和产品在超个性化体验中依然保持可辨识度。
  • 教程不再为每个人重放相同的流程。相反,它们会在你自己的情境中呈现下一步,随着你的进展而调整,并在你偏离脚本时自然地恢复。

我们预计界面生成会沿着与图像和视频生成相同的轨迹发展:每一代模型都会变得更快、更连贯、更可控、能力更强。那些曾让生成式界面显得不切实际的挑战,如今越来越像是可解决的工程问题。

Solaris 是我们的首个 Interface World Model,我们很期待继续探索生成式软件能够成为什么样子——从更丰富的交互、更强的落地能力、更持久的体验,到如今尚不存在的全新界面形态。我们正与重要合作伙伴携手,将 Solaris 公开发布。请填写下方表单以申请抢先体验。

来源:Runway:News(网页)· runwayml.com