61%对24%:Runway去掉了代码层,没去掉成本
8月31日,Runway发布Solaris,并把一个此前没被正式使用过的品类名字交给了它:Interface World Model(界面世界模型)。产品逻辑一句话可以说完——设计稿不再被翻译成代码,模型一帧一帧把界面画出来,用户的点击、拖拽直接作为下一帧的输入条件。Runway公布的一组对比结果里,250名参与者在30个交互场景上做出近7500次两两判断,Solaris在"哪一个更符合给定指令"上被选了61%,由Claude Opus 5写代码实现的界面为24%,13%被认为相当;在"哪一个在场景中表现更自然"上,两个数字是71%和21%。
同一篇官方博客里还写着另外两句:稳定清晰的文字生成"仍然是一个开放难题";每一帧都重新生成,"仍然比服务一个已经建好的页面更贵"。这不是一声App时代终结的号角,但它确实是一次把筹码押在"视频即界面"这条底层路线上的公开下注。真正值得拆开看的是:它省掉的到底是什么,剩下的那四道墙又有多硬。
省掉的不是写代码,是那层"翻译"
Runway的论证起点不是"做界面太麻烦",而是一个信息论意味很强的判断:任何软件都需要一次翻译,视觉设计必须先被转换成一个中间表征(也就是代码)才能运行;而一旦经过这层转换,软件就变成了"可能交互空间的一次有损压缩",在第一位用户到来之前就被冻结了。
为了证明这不是修辞,官方博客设置了一个基准:用30个从简单网页到图片密集页面、再到自然图像的界面,测试Claude Fable 5、GPT-4o、Gemini 2.5 Pro等多模态模型能否只凭一张截图把它重建成可用界面,衡量指标是结构相似度SSIM与基于DINOv3特征的区域相似度。Runway给出的结论是,所有语言模型在重建中都会丢信息,且视觉复杂度越高、失真越明显。需要说明的是,论文正文只公布趋势与图示,未给出具体分值,这套题和判分标准也都出自Runway自己。
Solaris的解法是不翻译:一个世界模型同时负责画面与交互响应,"没有中间表征"。但"不写代码"不等于"什么都不用写"。官方博客在"持续生成"一节明确写道,用户要提供一个起始状态,而"文本提示规定点击、拖拽等交互在特定场景中意味着什么"。规约从代码迁移到了自然语言提示,定义交互含义这件事并没有消失,只是换了工种。这也是Runway那句"任何视觉概念都可以成为交互界面"最该被限定理解的地方。
61%不是能力分,是偏好票
把Solaris说成"盲测碾压Claude"的表述,在二次传播中广泛流传,但它与原始口径并不完全对齐。官方博客的表述是"we conducted a user study"(我们开展了一项用户研究),没有使用盲测字样,也未披露参与者构成、地域、设备以及是否双盲。两位选手从同一张起始图出发、收到同样的交互请求,然后被拿来问两个主观问题:哪个更符合指令,哪个在场景中更自然。也就是说,61%和71%是两两偏好判断的占比,不是任务完成率、不是准确率、也不是可用性测试结果,更不是第三方独立复核。
即便如此,这组数字的分量不该被一笔抹掉。近7500次成对判断是有一定规模的样本量,两项指标分别拉开37个和50个百分点,且"相当"的比例只有13%和6%——在被挑选出来的那30个场景里,Solaris的优势不是统计学上的零头,而是被稳定感知到的。它赢的也不是"更正确",而是"更活":反射随光线移动、物体被拖动时有物理感的回应。反过来,代码界面在同样的题目上,优势是可预期、可审计、文字清楚,只是这些恰恰不在两个提问的范围内。
"实时"两个字,才是真正的成本关口
Runway在博客中给了一个工程阈值:交互延迟大约到半秒,就不再感觉是"实时"了。而它自己此前公开过一次实时化的真实代价。5月4日的Runway Characters工程文章中,同一套GWM-1路线的模型跑到24帧每秒时,每帧的预算只有42毫秒,实测每帧有效模型时间37毫秒,还要求把扩散与解码流水线并行才能挤进预算;即便如此,用户说完话到画面开始回应,服务端回合延迟仍是1.75秒。Solaris没有公布自己的帧率、延迟、上下文会话上限和推理硬件,"实时"目前只有厂商的定性描述。
成本上,Solaris的口径同样是定性的:相对标准视频扩散模型便宜"数个数量级",没有绝对值。可以参照的是Runway官网定价页——它自家最贵的视频模型Gen-4.5按每秒12个credits计费,年付Standard档每月12美元含625个credits,官方标注约等于52秒Gen-4.5。按这个口径粗略折算,一分钟约14美元、一小时约840美元。这显然不是Solaris的会话报价,两者任务形态不同,但它至少说明了一件事:以Runway目前的公开价格锚点,持续逐帧合成一段画面,仍然是一笔按秒计的钱。而传统软件是构建一次、服务千万次。Runway在7月的《AI Media Report》中称企业客户的媒体制作成本下降了"两到三个数量级",但那组数字由客户自报、案例匿名、场景是广告与影视素材,不是界面运行时。
它可能压根不是先卖给设计师的
如果只把Solaris当成"少写点前端代码"的工具,很容易看错它的位置。官方博客里有一段被大多数转述略过的内容:Runway认为这同时也是训练智能体的新办法。它引用研究称,即便是最好的大模型,在订酒店、买菜这类基础电脑操作任务上仍然会失败,原因是模型在训练时学的是代码界面的具体版式,换一个长得不一样的酒店网站就适应不了。Solaris提供的是"永远在变的界面",可以让智能体对着可能从未存在过的布局去训练泛化能力。
这条线索指向的买家,更可能是做大模型和智能体的团队,而不是设计部门——这也解释了为什么Runway没有把它先做成一款设计师工具。至于商业叙事上的意图,官方博客写得更直白:"Solaris是我们朝一个新的操作层迈出的早期一步","App不再是你要与之交互的单位",软件"没有必要再被归进固定的App目录"。这些都是Runway的赌注与预期(原文用的是"bet"和"we expect"),而不是已经发生的产业变化。
接下来该盯什么
第一条是文字。Runway给出的现实路径是混合方案:允许短暂停顿的文字密集页面交给图像模型渲染,视频模型负责连续交互。界面几乎由文字构成,这一关不过,它就只能待在演示环节。第二条是成本与延迟的可核实数字,包括帧率、每会话推理开销和会话时长上限。第三条是无障碍与集成,官方博客把屏幕阅读器、accessibility API列为待解决问题——这决定它能否进入企业的采购清单,而不只是展台。第四条是发布节奏:目前Solaris未公开发布,官方只说"正在与关键合作伙伴推进公开发布",页面提供early access申请表单,无定价、无上线时间、无客户名称。第五条是第三方能否复现那61%和71%。
把这几条放在一起看,比较稳的判断是:作为技术展示,Solaris的真实含量高于"又一个demo"——它把视频扩散模型压进了一个可以持续响应用户输入的交互回路,这在界面生成这条路线上确实是一次底层改动;但作为产品,它的完成度明显低于新闻标题给人的印象,四项核心局限由厂商自己列出,商业化状态停在一纸申请表上。人机交互在这里进入的是"视频即界面"的实验阶段,而不是App时代的落幕时刻。
参考数据来源
- Runway · Introducing Solaris(官方博客,含用户研究与局限说明) · 2026年8月31日 · https://runwayml.com/news/research/introducing-solaris
- Runway · Building Runway Characters: Real-Time Conversational Video Agent(官方工程博客,24fps/37毫秒每帧/1.75秒回合延迟口径) · 2026年5月4日 · https://runway.com/news/engineering/building-runway-characters
- Runway · Choose the Right Plan for You(官方定价页,Gen-4.5按12 credits/秒、625 credits约52秒口径) · 2026年9月3日访问 · https://runway.com/pricing


