在采访接近尾声时,Anastasis Germanidis 抛出了一个判断:像 Interface World Models 这样的技术,终局是一台完全由神经网络驱动的操作系统。他提到 Andrej Karpathy 很早就写过类似的想法,但他觉得更值得深究的是当下的一个悖论——今天的语言模型能谈论任何话题、能把对话引向任意方向,几乎无所不能,但人们与它交互的界面却异常僵化。在他看来,用不了多久,界面本身也会变成可学习的组件:交付一个应用不再只是交付一个语言模型,还要交付渲染、交付像素本身。这句话像是给整场对话定了调——Runway 走到今天,从来不是一家做视频特效工具的公司,而是一家在赌"生成"这件事的边界到底在哪里。

Runway 联合创始人 Anastasis Germanidis 与 Latent Space 的 swyx 和 Vibhu 坐下来,把公司七年的路径重新捋了一遍:从一个把开源模型包装给艺术家用的小工具,到签下一份让 B 轮公司显得"有点不理智"的算力合同,再到今天把视频生成当作通往世界模拟的路径。这条路线不是一开始就设计好的,而是一步步被逼出来的。

1. 他一直活在两个平行世界里

Anastasis 说自己长期被分裂在两个身份之间。一边是他自己的艺术实践,做了很长时间的互动艺术;另一边是在不同公司做机器学习工程师、后端工程师的职业轨迹。他对编程和计算的兴趣一直存在,但真正让他着迷的是仿真——把这种兴趣带回了早期的艺术创作里。

这种双线并行不是简单的爱好叠加。一条线是生成模型和当时正在起效的早期机器学习研究,另一条线是仿真本身:通过给人类行为和互动建一个极简的模型,我们能从中学到什么。这个问题后来几乎原样投射到了 Runway 的产品哲学里——生成模型不只是用来产出内容,也是理解和模拟世界的一种方式。

2. 一场由马尔可夫链驱动的画廊社交实验

2015 年,Anastasis 做过一个项目:在展览空间里给人发出语音指令,协调陌生人之间的互动。系统会先给每个人分配一个身份——你是建筑师,30岁,喜欢体育——然后把你和另一个人匹配起来,生成一段完全虚构的对话开场。

当时语言模型远没有今天这样成熟,这套系统靠的是模板和马尔可夫链生成的文本拼接而成:一堆职业列表、一堆性格类型列表、一堆年龄列表,程序随机组合出人设,再驱动整个画廊里的小型对话模拟。这不是一次严肃的技术攻坚,却精确地预演了后来 Runway 反复出现的思路——用非常简单的生成机制,去逼近对人类行为的某种理解。

3. 一个训练在自动驾驶数据上的模型,被拿去生成一百万个行人

Anani Valley 和 Anani Road 是 Anastasis 与联合创始人 Chris 合作的早期项目之一,用的是 NVIDIA 在 2016、2017 年发布的 Pix2PixHD——一个把场景语义图转换成照片级输出的图像到图像模型。按今天标准看效果非常粗糙,但它是第一批能生成 1K 分辨率图像的模型之一,训练数据全部来自自动驾驶场景,语义类别也局限在行人、交通标志、自行车、红绿灯这些"路上会遇到的东西"。

真正有意思的是接下来发生的事:人们拿这个模型去生成极其超现实的画面——一百万个行人、一百万个交通标志、巨人般的人类。这是 Runway 最早得到的一个信号:一个训练在极其枯燥数据集上的模型,一旦被重新给到艺术家手上、被推向分布之外,反而能产出艺术上有说服力的东西。这在某种程度上就是 Runway 这家公司的方法论摘要——同一个生成模型,换个方向看它,围绕它搭建有意思的工具,交到艺术家手里,他们会做出你完全想不到的事情。

4. 从包装开源模型,到不得不自己建研究团队

Runway 最初的定位很朴素:把当时所有开源模型——比如 Pix2Pix——用简单的方式包装起来,交给艺术家用。这个想法的出发点是,那些模型如果不是机器学习工程师根本用不了,那把它们交给艺术家之后会发生什么?

但这个定位很快撑不住了。团队很快意识到,公司内部必须建一个真正的研究组织,这个转折发生在公司成立后大约第一年。当时的图像生成模型、尤其是视频生成模型——那时候视频生成的例子屈指可数——都远没有成熟到可以产品化、嵌入创作工作流的程度。于是团队不得不去推动研究前沿本身。

这段研究几乎是在后台悄悄进行了将近四年,期间 Runway 真正被外界认识的产品是一个叫 Green Screen 的抠像工具,解决的是视频分割这个在特效制作里极其重要但极度手工、没人愿意做的问题——rotoscoping。这个工具后来被用在《瞬息全宇宙》等多部高关注度电影和剧集里,Runway 在很长一段时间里本质上是一家后期制作工具公司,直到潜在扩散模型带来了 Gen-1、Gen-2。

5. 一次"有点不理性"的决定:签下一千张A100

转折发生在 2022 年年中。当时 Runway 意识到自己的研究规模相对算力而言太小,而图像和视频生成很可能会遵循和语言模型一样的 scaling law。于是他们做了一个大胆的决定:签约建一个一千张 A100 的集群。在当时,Runway 只是一家 B 轮公司,这几乎是一个略显不理智的决定,但团队真心相信,如果在足够大的规模上训练一个视频模型,最终会得到一个足够好的模型。

2022 年秋天,团队给自己定下一个目标:找到视频领域的"潜在扩散/Stable Diffusion 时刻"是什么样子。当时最好的视频模型叫 CogVideo,分辨率只有 256×256,质量并不高。于是 Runway 决定不再依赖别人的研究成果,自己投入建集群、训练视频模型。

6. 文生视频太难了,所以先做视频生视频

训练 Gen-1 的过程中,团队原本想直接做文本生成视频,但很快发现完全从零生成视频的难度太高。一个更容易切入的起点是视频到视频的转换——当你有更强的条件约束时,重新对一段已有视频进行风格化,本质上比从无到有生成一段视频要容易得多。基于这个判断,Runway 在 2023 年 1 月先发布了 Gen-1。

Anastasis 回忆起当时看到那些结果的感受:那种震撼几乎和当年图像生成或视频生成刚出现时一样——你会觉得这不可思议,这居然是可以做到的。这句朴素的感慨,恰好呼应了他在采访开头提出的那个更大的判断:从图像到视频,从视频到界面,Runway 一直在重复同一件事——把生成模型推向它原本没被设计要去的方向,然后看它能走多远。

从画廊里的语音陌生人实验,到自动驾驶数据集里长出的超现实图像,再到押上全部家当的一千张A100,Runway 走的从来不是一条线性的产品路线图,而是一连串"发现生成模型能做的事,远比设计它的初衷要多"的时刻。这也是理解 Anastasis 那句"界面终将变成可学习组件"的最好背景——如果一个训练在枯燥数据上的模型都能被逼出艺术性,那么一个被封装在僵化界面里的语言模型,被解放出来也只是时间问题。

Latent Space 作者:智顶顶