Aioga
AI资讯 / 行业动态
返回 AI资讯

Runway 发布 Solaris:首个界面世界模型,实时生成操作系统级交互界面

Runway:News(网页)Aioga 编辑团队2026-08-31T17:03:47.000Z热度 72

Runway 推出 Solaris,这是其全新界面世界模型(Interface World Models)系列的首个模型。Solaris 能实时逐帧生成应用和网站界面,无需中间...

行业动态Runway:News(网页)

今日 AI 情报摘要

Runway 推出 Solaris,这是其全新界面世界模型(Interface World Models)系列的首个模型。

Solaris 能实时逐帧生成应用和网站界面,无需中间代码表示,直接以图像作为交互层,支持视觉化、动态响应和开放式交互。 它还可用于训练智能体,使其适应不断变化的界面布局,而非局限于特定训练环境。

中文正文 · AI 翻译

今天,我们分享 Solaris:它是我们称为界面世界模型(Interface World Models)的一类新型人工智能系统中的第一个模型。Solaris 从一个问题开始:当操作系统在你使用它时生成应用程序和网站,会发生什么?

Introducing Solaris

从早期终端到 Linux 和 macOS,每一个操作系统都决定了屏幕上显示什么,以及当人或程序进行操作时会发生什么。应用程序建立在其上,并保持固定状态,直到有人推送更新。而 Solaris 则直接渲染这一层。它是一个实时交互模型,逐帧生成界面。每一帧在你交互时合成,使界面能够持续响应你的操作。

设计比以往更加视觉化,拥有像素级精确的模型和能够生成几乎与成品无异的整屏图像模型。但图像无法像网站或应用那样运行。今天构建的每一款软件仍然需要一个转换过程:视觉设计必须先被转换为中间表示(例如代码),才能发挥作用。

这种中间表示限制了界面的功能以及其对人类和智能体交互的响应方式。每一种行为都必须提前明确地定义和实现,因此软件就像可能交互空间的有损压缩,在用户到来之前就被冻结。相同的转换过程同样牺牲了视觉保真度。一旦设计被简化为中间表示,界面能够快速响应,但代价是丢失了原始设计中的很多丰富内容。

Solaris 将渲染和交互联合处理,消除了我们今天在设计中常见的很多折衷。单一的世界模型生成每一帧以及对用户输入的每一次响应,消除了对中间表示的需求。因为没有转换步骤,就不会有损失,整个帧本身就成为界面。

我们认为 Solaris 开辟了构建网站、应用程序和其他在线界面的新方法。但它同样也是训练代理的新方式,适用于更加动态的环境。即便是当今最先进的大型语言模型(LLM)也难以完成:https://arxiv.org/abs/2606.29537 基础的计算机使用任务,例如预订酒店或购买杂货。由于基于文本的模型被训练以使用编码接口,它们往往会学习训练时所使用的特定布局,无法适应略有不同的界面(比如两个不同的酒店网站)。通过缩短动作与反应之间的空间,Solaris 让代理可以在不断变化的界面和可能从未存在过的布局中进行训练。

Solaris 为软件带来了三项新功能。

首先,Solaris 完全以视觉为基础。当图像本身成为应用程序时,就无需在用户所见视觉背后进行第二次实现。想象在浏览一个虚拟服装店时,展厅本身就是界面。使用你自己的单张图像作为参考,你可以从衣架上拿起一件衬衫,将其拖到自己身上试穿,或像在实体店中一样自然地重新排列展示。

其次,它是生动的。由于应用程序是持续渲染的,它总是在演变,而不是等待下一次用户操作。反光随着光线而变化,物体在操作时自然反应。用户可以说一些简单的指令,例如:“移动桌子,这样我可以看看效果”或“改变沙发的颜色。” 结果是软件感觉不再是浏览脚本化页面,而更像是在与一个有生命的环境互动。

最后,它是开放的。传统界面只能实现开发者在开发时预想的交互,但 Solaris 可以在同一场景中支持完全不同的行为,实时响应用户交互。这种灵活性将界面从预定义工作流程中解耦,而是让驱动世界模型的能力决定可能性。

Solaris 将界面变成了一种互动体验,而不仅仅是一系列页面。用户不再仅从菜单中选择选项,而是直接与场景本身进行互动。制作沙拉就像将食材拖入碗中一样简单,每加入一种食材,界面都会自然地做出响应。

数字界面建立在两个系统之上,而这两个系统直到现在一直存在于不同的世界中。

我们传统上认为软件界面是确定性的程序,而世界模型是视觉内容的生成器。一个界面世界模型必须同时具备两者功能:既要理解你的意图,又要持续渲染一个围绕意图的互动世界。

一旦你尝试构建这样一个模型,就会立即出现三个工程挑战:

Solaris 是我们对这些概念性和技术性障碍能够被克服的一种赌注。我们在构建时,专注于三方面:实时交互、整个会话的一致性以及在 720p 下保持的视觉质量。

Solaris 基于我们的 Gen-4.5:https://runwayml.com/research/introducing-runway-gen-4.5 视频生成模型,我们对其进行了调整,使其可以 (1) 理解交互,(2) 实时响应。它沿用了我们在 GWM-1:https://runwayml.com/research/introducing-runway-gwm-1(我们的通用世界模型)中开辟的路径。

学习交互。Solaris 将用户输入视为下一个帧的条件,就像处理文本或图像一样。模型在生成时会观察点击、拖动及其他交互,将其作为下一步动作的信号。由于模型只会看到已经发生的交互(从不看到未来的交互),它可以学习用户操作与视觉结果之间的关系。这意味着它知道在点击、拖动或修改某些内容时应该发生什么,而无需显式编程这些交互。

实时运行。标准的视频扩散模型需要经过几十步去噪处理整个视频片段,这一过程对于动态用户交互来说过于缓慢。我们将 Solaris 转换为实时引擎,共分三阶段。首先,我们让它以自回归方式生成帧,每一帧只依赖于之前的内容。接着,我们将多步骤去噪过程提炼为仅几步。最后,我们在模型自身输出上进行训练,以确保长时间交互中视觉质量保持稳定。最终生成的帧既能达到交互速度,又保留了原始教师模型的视觉质量。

推理与渲染。Solaris 每次生成界面的一帧,同时语言模型决定该界面如何演变。大语言模型解读用户请求,决定交互何时应修改当前场景或转入新场景,定义让世界栩栩如生的行为,并生成指导 Solaris 渲染每一个状态的提示。语言模型与世界模型协作,将推理与渲染分开:一方决定应用程序接下来应该做什么,另一方生成这些行为的实时外观和反应。

连续生成。用户提供初始状态(例如品牌环境或产品场景),模型即时流式生成帧。随着用户点击、拖动或输入,这些交互会被整合到下一帧生成中,场景实时响应。没有预定义的屏幕,也没有备用模板。相反,文本提示指定点击、拖动及其他交互在特定场景中的含义。

重新定义鼠标。一旦交互以自然语言描述,而非通过编程进行,它们就无需事先固定。场景中的每个对象都可以成为一种全新的工具。点击猫咪,你的下一次点击会将它的毛色和质感应用到所触碰的任何物体。点击画作,你可能会开始以其风格绘画。

此前,我们提出将界面翻译为中间表示不可避免会导致信息损失。为了测量这一损失,我们测试了当今多模态语言模型从截图中重建界面的忠实度。

A plain product webpage next to reconstructions by GPT-4o, Gemini 2.5 Pro and Fable 5
An image-heavy event poster next to reconstructions by GPT-4o, Gemini 2.5 Pro and Fable 5
A natural photo of a kitchen scene next to reconstructions by GPT-4o, Gemini 2.5 Pro and Fable 5

为了衡量这一点,我们评估了最先进的多模态语言模型,包括 Claude Fable 5,在从单张截图重建网站界面任务中的表现。我们在一个包含 30 个不同界面的多样化集合上进行评估,这些界面从简单的纯网页到图片密集型网页及自然图片不等,用于评估视觉理解的不同方面。

我们通过两种互补的方式衡量信息保留情况。首先,结构相似性(SSIM)将重建的界面与原版界面进行对比,以捕捉视觉外观的忠实再现程度。其次,我们使用 DINOv3 特征,将原界面的每个区域与重建中最相似的区域进行比较,测量即使元素移动或布局变化,底层视觉内容是否仍被保留。

Runway 发布 Solaris:首个界面世界模型,实时生成操作系统级交互界面

随着视觉复杂性的增加,重建的保真度。即使多模态语言模型不断改进,随着视觉复杂性增加,重建质量仍会持续下降,揭示界面通过语言翻译时丢失的信息。

尽管近年来进展迅速,每种语言模型在重建过程中都会丢失信息。自然图片受到的影响最大,因为丰富的视觉细节无法在语言中准确表示。随着界面变得更复杂,即使是文本、布局或结构的微小变化也可能从根本上改变界面的行为。

Solaris 并不是将界面翻译成语言再重建,而是直接在视觉界面本身上操作。通过消除中间表示,它从第一帧开始就保留了界面的完整视觉和语义状态。

我们的重建基准测试衡量了当界面被翻译成代码时信息丢失的程度。接下来我们要问:在相同界面和相同用户交互的情况下,哪种方法能产生更好的结果?一个编码的界面能否重现与由界面世界模型生成的界面相同的生动且响应式的环境感?

比较。虽然两种系统都对相同的交互请求作出响应,但 Solaris 保持了整个场景的一致性,产生的交互更加自然且具有物理基础。

为了回答这个问题,我们将Solaris与最先进的语言模型(Claude Opus 5)进行了比较。两个系统都从同一幅图像开始,并接收相同的交互请求,我们记录了每个系统的响应情况。然后,我们进行了用户研究,涉及250名参与者和30个交互示例,收集了近7,500条成对评价。在每次比较中,参与者回答了两个问题:“哪个结果更好地遵循了给定的指令?”和“哪个在场景中表现得更自然?”

Runway 发布 Solaris:首个界面世界模型,实时生成操作系统级交互界面

参与者在两个指标上都更倾向于Solaris。在遵循请求的交互方面,Solaris在61%的比较中被偏好,而编码结果为24%,有13%被评为相同。在自然行为方面,差距更大,Solaris在71%的比较中被偏好,而编码网站为21%,有6%被评为相同。

第二个结果突出了两种方法之间的更广泛差异。编码界面往往可以再现请求的更改,但它将交互视为界面的孤立更新。而使用接口世界模型,由于模型已经理解了对象、材料和环境的行为,它可以生成在场景中感觉连贯的交互,而不是将每个UI操作视为孤立元素。

Solaris在环境运动、点击拖拽交互和场景切换方面最具优势。仍存在若干重要挑战:

这些挑战反映了实时生成模型的当前前沿,我们预计它们将随着底层模型自身的改进而得到提升。

Solaris是迈向新操作层的早期一步,我们看到几种新的交互模式正在出现。

我们预计界面生成将遵循与图像和视频生成相同的轨迹:每一代模型生成将变得更快、更连贯、更可控、更强大。曾经让生成界面看似不切实际的挑战,现在越来越像是可解决的工程问题。

Solaris 是我们的第一个界面世界模型,我们很高兴继续探索生成式软件可能的发展,从更丰富的交互、更强的基础和更持久的体验,到今天不存在的全新界面类型。我们正在与关键合作伙伴合作,公开发布 Solaris。请填写下面的表格以申请提前访问。

情报判断

Aioga 编辑摘要

Runway 发布 Solaris,称其为 Interface World Models 系列的首个模型。Solaris 可实时逐帧生成应用和网站界面,以图像作为交互层,并可用于训练智能体适应持续变化的界面布局。

背景分析

来源称,现有软件通常需要先将视觉设计转换为代码等中间表示,再实现交互。Solaris 将渲染与交互结合,由模型生成每一帧及对用户输入的响应,取消这一中间转换环节。

Aioga 观点

Aioga 判断:Solaris 的核心变化不只是生成界面视觉,而是试图把界面本身变成持续响应的交互层。其价值仍需结合实际使用效果和智能体适应能力进一步观察。

影响与后续

可能影响:软件界面的构建方式和智能体训练环境都可能出现新的路径,但这不代表传统代码表示会被取代,也不足以证明动态生成界面已经具备稳定的产品化能力。 后续观察:应关注 Solaris 的实际可用范围、交互稳定性、响应质量,以及智能体在不同且持续变化的界面中能否保持可靠完成任务的表现。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: runwayml.com

来源: Runway:News(网页)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-31T17:03:47.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Runway 推出 Solaris,这是其全新界面世界模型(Interface World Models)系列的首个模型。Solaris 能实时逐帧生成应用和网站界面,无需中间...

Runway:News(网页)2026-08-31T17:03:47.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。