视频直播基础设施建立在一个持续了五十年的假设之上:每个目的地都需要完整画面。传输视频流、送达画面帧,任务完成。
AI正在打破这个假设。机器目的地是请求者,而非观看者。它不需要画面,它需要足够的视觉信息来回答一个具体问题。一个监测场景变化的模型只需要极小一部分分辨率。一个读取滚动字幕的模型只需要画面某个角落的完整清晰度。一个扫描四十路视频的监控系统在大多数时间几乎不需要任何一路视频的信息,但会突然对其中一路需要大量信息。
而网络系统仍然一视同仁地传输所有内容。全部数据,一个不落。
这种浪费是可以量化的。英特尔与V-Nova联合开展的一项研究,使用英特尔Deep Learning Streamer和MobileNetV2-SSD在UHD视频序列上进行测试,结果显示解码后的像素中只有约1.4%最终被用于推理运算。剩余部分仍然消耗了解码周期、缩放算力和内存带宽。在稀疏推理场景中解决这种不匹配问题后,在模型架构和硬件保持不变的情况下,处理时间最多降低了96%。
在大多数直播工作流程中,实际可选方案仍然局限于两种:将全质量源视频发送给模型,或者提前生成低分辨率的衍生版本。前者为推理前就被丢弃的像素付出了全额代价。后者则将当下模型的需求固化进管道流程,一旦明天的模型需求有所不同,就需要重新生成一个版本。
传统路由问的是哪个目的地该接收视频流。AI路由问的是哪个模型该接收视频流。而算力感知路由问的是这个模型究竟需要视频流中的多少内容。
swXtch.ai推出的AI广播工程师abbe,正是提出第三个问题的地方。VC-6(SMPTE ST 2117-1)标准则通过编码表示中内置的选择性数据召回机制来回答这个问题。分辨率层级和自定义空间区域都可以直接被寻址,因此管道流程只需获取和解码满足特定质量等级或区域请求所需的字节,而无需处理全分辨率画面帧。
单一表示形式可服务多个模型,无需生成或同步单独的代理版本,这正是该方案与代理阶梯或ABR(自适应比特率)版本集的区别所在。这套架构不是移动完整的画面帧,而是仅传输每个任务所需的视觉信息。
在IBC展会上,swXtch.ai首发亮相abbe,初期具备直播媒体传输和SRT管理能力,同时配备一套直播AI音频处理工作流程。
VC-6与abbe的集成工作正在进行中,目标是十月底完成。届时,多个AI模型将能从单一VC-6视频流中提取其任务所需的分辨率或区域,无需为每个模型单独进行解码和降采样处理。我们正在IBC展会上招募试点合作伙伴,共同推动这项技术落地。
我们正在从头到尾构建的第一个工作流程是:大量并发视频流以低分辨率持续观测,成本低廉,可大规模运行。当某个模型检测到重要情况时,管道流程会拉取更高分辨率的表示形式或特定区域,进行成本更高的二次审查,随后触发生产端操作,无论是路由、剪辑、日志记录还是告警。这一切都不是纯理论构想。
支撑这套方案的核心科学技术已经发表,编解码器基准测试结果也可复现验证。VC-6 AI蓝图展示了从单一解码器状态实现自适应多模型推理的能力,先进行低分辨率推理,再对选定区域以更高精度进行细化处理。NVIDIA的开发者博客记录了独立访问选定质量等级和区域的测试数据,测得第一级降采样约占编码字节数的63%,第二级约占27%。相关基准测试数据在V-Nova的vc6-samples代码仓库中公开可查。在swXtch基础设施上进行的1080p30直播多播测试中,与未压缩的ST 2110相比,接收端处理量下降约70%,端到端AI延迟下降约80%。
上述工作流程将与同等硬件条件下的传统全解码管道进行对比测试。
我们最关心的指标是每分析流媒体小时的成本,因为这是运营商纳入预算时会考量的数字。在这个指标之下,还包括每个GPU支持的并发流数量、端到端推理延迟、每个分析流实际解码的数据量,以及算力利用率。模型准确度的对等性和广播级运营可靠性是必须坚守的底线,而非可以牺牲的代价。一个通过降低分析质量来实现更多流分析的管道,并没有真正证明任何价值。
我们会在得出这些结果后予以公布。
在IBC展会上,我们正在挑选一小批试点合作伙伴——那些正在大规模运行直播视频、希望针对自身应用场景和数据进行验证的机构。
试点合作伙伴能获得的东西是具体而实在的:在十月底集成落地时获得联合评估项目的使用权限;在架构仍可调整阶段参与并影响其设计;获得一个明确定义的测试窗口,基于约定的基准线、针对你自己的内容和基础设施进行测量,无论结果如何都会将测试结果反馈给你。
如果你正在处理大量直播视频流,并预计未来每年都会有越来越多的机器在观看这些视频,请来找我们。V-Nova位于5号馆5.D52和5.D54展位。swXtch.io位于5号馆MR13展位。
你也可以提前预约会面。
V-Nova同时也在为IBC加速器项目"Delta协议:直播的未来"贡献力量。该项目的最终展示将于周六上午11:30至下午12:30在14号馆的Future Tech Stage舞台举行,其展台位于加速器专区14.D25。
Q&A
Q1:abbe是什么?它有什么作用?
A:abbe是swXtch.ai开发的AI广播工程师产品,具备直播媒体传输和SRT管理能力,并配备直播AI音频处理工作流程,能够让AI模型只获取任务所需的视觉信息,而非完整画面帧。
Q2:VC-6编解码标准能带来什么好处?
A:VC-6(SMPTE ST 2117-1)支持选择性数据召回,分辨率层级和空间区域可直接被寻址,管道只需解码所需部分即可。测试显示接收端处理量可下降约70%,端到端AI延迟可下降约80%。
Q3:如何成为这项技术的试点合作伙伴?
A:可以在IBC展会现场联系swXtch.ai或V-Nova团队,V-Nova位于5号馆5.D52和5.D54展位,swXtch.io位于5号馆MR13展位,也可提前预约会面申请成为试点。
