Runway 发布 Solaris:把软件界面当视频实时生成,不用一行代码

过去两年,AI 改造软件开发的主流思路是:人说需求,AI 写代码,再由代码渲染出界面。从 Copilot 到 Cursor 到各种 Coding Agent,模型接管了编程工作,但代码始终夹在想法和最终界面之间这一层,没被拿掉。

Runway 现在想把这一层也拿掉。

8月31日,Runway 公布了 Solaris,首个 Interface World Model——界面世界模型。核心主张是:软件界面能不能像视频一样逐帧实时生成?

需求 → 直接生成 UI,代码那层没了

传统的 AI 生成软件,流程是:需求 → 生成 HTML/CSS/JS → 浏览器把代码渲染成界面。Solaris 把中间那一步跳过了——你看到的就是模型直接画出来的画面,点一下、拖一下、输入一句话,模型根据当前状态实时生成下一帧。

具体来说,当你把一盏灯拖到新位置,模型会预测它在新位置后光影应该怎么变化,然后直接渲染出来。按钮、物体、场景都跟着你的操作实时变化,不需要开发者提前写好每个交互状态的代码。

一个更直觉的理解方式:以前 AI 做软件是「需求 → 生成代码 → 渲染 UI」,Solaris 尝试变成「需求 → 直接生成 UI」。

架构:语言模型 + 视频模型,双核驱动

Solaris 真正驱动的不是单独一个视频模型。Runway 把整个过程拆成了两个部分:

语言模型负责推理。它先理解用户想完成什么,判断当前场景应该发生局部变化还是切换到新状态,再生成指导视频模型生成的提示词。

视频模型负责渲染。基于 Gen-4.5 改造的 Solaris,把这个提示词变成下一帧画面,持续生成后续帧。

两个模型各司其职:一个决定应用下一步该做什么,一个决定这件事该怎样出现在屏幕上。

速度是工程难点,Runway 做了三层改造

视频扩散模型生成一帧通常需要几十步去噪,生成一段视频要数秒。这个速度对看视频可以接受,对鼠标交互就完全是另一个体验。

Runway 给 Solaris 做了三层工程改造:

第一,把生成过程变成逐帧自回归,当前帧只依赖已经出现的内容;第二,把多步去噪过程蒸馏到少数几步;第三,让加速后的模型用自己的生成结果做继续训练,减少长时间运行后的画面漂移。

最终达到了实时交互的生成速度,同时维持 Gen-4.5 的视觉质量。官方目标是在 720p 下保持长时间交互的视觉一致性。

真人盲测:61% 选 Solaris,24% 选 Claude

Runway 专门设计了两组实验来验证这条路线有没有意义。

第一组针对「翻译损失」。选取 30 个不同复杂度的界面,包括普通网页、图片密集型网页和自然图像,让包括 Claude Fable 5 在内的多模态模型根据单张截图重建界面。结果显示,随着界面复杂度增加,通过语言和代码重建界面的信息损失越来越明显。

第二组更直接:Solaris 和 Claude Opus 5 生成的代码界面从同一张图出发,接受相同的交互要求,让真人判断哪个更好。30 个交互案例,250 名参与者,接近 7500 次两两比较。结果:任务完成度,61% 选 Solaris,24% 选 Claude;自然程度,71% 对 21%。

离替代 App 还远,但方向值得盯

Solaris 现在还是研究预览,有几个硬问题没解决:每帧实时生成成本高于普通网页;文字稳定性差;长时间保持界面一致性是难题;无障碍支持还没有。

但这个方向本身值得注意。Runway 从视频生成走到世界模型,现在又往界面生成走了一步。它的设问是:如果操作系统里的 App 和网站,不再提前写好,而是在使用过程中实时生成,会发生什么?

这和 AI Coding 的方向正好相反。AI Coding 是让模型更好地写代码,Solaris 是问代码这层能不能直接不要。如果这条路最终跑通,未来 App 可能没有固定 UI 了——你需要什么,界面就现场生成什么。

不过这个距离现在还很远,先看着就好。