当视频模型开始生成界面:Runway Solaris 观察
#博客更新

先说结论

8 月 31 日,Runway 发布了 Solaris 研究预览,并把它称为 Interface World Model

官方描述很大胆:这不是一个普通的视频生成器,而是一种新型“操作系统”,窗口、菜单、滑杆等界面由视频模型实时生成,方向包括场景化视频、游戏界面、创意工具和产品原型。

我对这件事的判断是:如果 Solaris 的可操作性能够成立,它改变的不是“视频能生成得更漂亮”,而是界面本身可能不再是预先写好的组件集合。

但现在还不能把它写成成熟产品。当前公开信号主要来自 Runway 官方账号和一个 X List 旁证,公测资格、API、状态持久化和独立测试都没有明确资料。下面是方向分析,不是能力评测。

过去的界面是什么样的

我们熟悉的软件界面有一个稳定假设:
固定组件
  + 固定状态
  + 固定事件处理
  + 固定数据模型
  = 可操作应用

一个按钮是一个 DOM 节点,一个滑杆有明确的数值,一个菜单项对应一条路由。即使界面由游戏引擎或 Canvas 绘制,背后通常仍然有一套确定的 UI 状态机。

传统的生成式 AI 主要生成的是内容:
提示词 → 图片 / 视频 / 音频

它可以生成一个看起来像软件的画面,但这个画面通常只是结果,不是一个可以持续操作、保存状态、撤销和再次打开的应用。

Solaris 想挑战的是中间那条边界:
意图
  → 模型生成当前界面
  → 用户动作
  → 模型理解动作后的世界状态
  → 生成下一帧界面

如果这条循环稳定,界面就不再只是“渲染数据”,而变成了模型对世界状态的一种实时投影。

它和 GUI Agent 不是一回事

最近也有很多 GUI Agent:模型看屏幕,点击按钮,输入文字,拖动鼠标。这些系统通常是在已有界面上行动。

可以这样对比:

所以不能因为两者都“会用界面”,就把 Solaris 当成另一个 computer-use 模型。它更接近:模型不仅使用工作台,还参与生成工作台。

真正困难的不是画出一扇窗

从演示画面看,窗口、菜单和滑杆并不难想象。真正难的是这些东西必须具备软件的性质。

1. 状态要持久

用户拖动滑杆之后,数值应该进入某个可恢复的状态,而不是下一帧又随机回去。
动作 A
  → 状态 S1
  → 关闭界面
  → 重新打开
  → 仍然得到 S1

如果状态只存在模型的短期上下文里,它就更像一次互动幻觉,而不是应用。

2. 动作要可重复

同样的点击在同样的状态下,应该产生相同或可解释的结果。视频模型天然带有生成随机性,而软件交互依赖确定性。

这会要求系统把“视觉帧”和“真实状态”分开:
可生成的显示层
       ↓
可验证的状态层
       ↓
可执行的动作层

如果没有状态层,用户看到的按钮和系统真正接受的动作可能不是一回事。

3. 界面要能被机器理解

固定 UI 有 DOM、Accessibility Tree、语义标签和键盘焦点。模型生成的界面如果只有像素,接入自动化、辅助功能和测试都会变得困难。

一个真正可用的 Interface World Model,至少需要回答:

当前有哪些控件
每个控件的语义是什么
哪些控件可以操作
操作会改变哪些状态
屏幕阅读器和键盘如何访问它们

“看起来像按钮”不等于“它是一个按钮”。

4. 延迟必须足够低

普通视频生成可以等几秒甚至几分钟。界面交互不能每次点击都等一段完整视频生成。

用户会期待:
按下按钮
  → 立即看到反馈
  → 状态逐步稳定

因此 Solaris 更像实时世界模型,而不是离线视频模型。它要解决的不是单次画质,而是连续生成、状态更新和输入响应之间的延迟。

5. 失败要能撤销

固定应用里的错误操作通常可以 undo、回退或重新加载。生成式界面如果把每次状态变化都当成新一帧,就必须有明确的历史:
S0 → S1 → S2 → S3
           ↑
        undo / fork

否则用户很难知道一次错误是模型生成错了,还是自己的操作真的改变了数据。

我会怎样评估它

如果 Solaris 之后开放试用,我不会先截几张好看的图,而会做一套重复性测试。

我尤其关注“同一个任务跑十次”的成功率。生成界面最容易在单次演示里看起来惊艳,真正决定它是不是产品的是第十次还能不能找到同一个按钮。

它可能先在哪些地方成立

游戏

游戏本来就接受动态世界和非固定界面。模型生成一个场景化的控制层,可能比在办公软件里生成表单更自然。但游戏仍然需要物理规则、存档、碰撞和多人同步,视觉生成不能替代底层状态机。

创意工具

创作工具的界面本来就经常围绕当前任务变化。用户在做分镜、调色或构图时,需要的控件不一样,动态生成一个任务专用工作台有实际价值。

产品原型

这是最容易落地的方向:不是直接替代生产软件,而是让用户用自然语言快速得到一个可交互的原型。这里对确定性的要求相对低,但仍然需要能保存和分享。

场景化学习

教学界面、模拟实验和可视化解释也可能受益。模型不只是给一段答案,而是根据用户的理解程度生成一套可以探索的界面。

也要警惕一个误区

“界面由模型生成”不代表界面一定更好。

固定组件的价值就在于稳定、可预测、可测试。动态生成会带来新的成本:

用户每次打开都看到不同布局
团队无法复用操作教程
自动化脚本容易失效
产品问题难以复现
视觉一致性和品牌规范变复杂
安全敏感的操作可能被模型藏在不明显的位置

所以我不期待所有软件都变成生成界面。更现实的形态可能是:稳定的底层状态和权限 + 针对当前任务生成的工作台视图。

最后

Runway Solaris 目前还是研究预览,很多关键问题没有答案。它值得关注,不是因为一条视频里出现了会动的菜单,而是因为它把一个问题摆到了台面上:
界面究竟是程序的固定外壳,还是模型理解世界后生成的一种临时视图?
我暂时不会把它叫作“下一个操作系统”。但如果它能把生成画面、真实状态、语义操作和持久化历史接在一起,那它可能会成为一种新的软件入口。

现在先等它从演示里出来,给别人真正点几下。

参考资料

Runway 官方研究页面
Runway 官方网站
OKP:Runway 发布 Solaris
阿里 Qwen-UI-Agent 信号(相关背景)

via 棒无 AI Video Research & Innovation | Runway AI
 
 
Back to Top