当企业部署AI技术时,最常见的瓶颈并非模型开发本身,而是部署阶段:让训练完成的模型在实际目标设备上稳定运行。

这项CCTV低光视频修复项目遵循了同样的规律,部署阶段的优化正是核心挑战所在。客户现有模型在目标边缘环境(Jetson Orin NX)上测得每帧处理时间为400毫秒,远远达不到33毫秒(30帧每秒)的实时目标。

最终,Nota AI在满足客户质量要求的同时,将处理时间缩短到28毫秒以内(超过30帧每秒)。

这一改进并非仅靠通用的后期优化手段实现。当量化、剪枝等标准方法达到极限后,Nota AI将硬件约束与视频领域的特定特性结合起来,从零开始重新设计模型。

以下内容将详细说明标准优化方法在边缘设备上究竟卡在哪里,以及Nota AI如何通过从模型架构到硬件优化的一体化设计能力,解决了实时处理难题。

CCTV运行标准与现有视觉模型的局限

此次合作的初始规格要求总结如下。

30帧每秒并非随意设定的数字,而是下游目标检测与跟踪的下限。低于这一速率,快速移动的物体会在帧间丢失,检测将变得不可靠。

将这个案例仅视为纯粹的"速度问题"是有偏差的。由于部署领域是商业CCTV运营,图像质量与运行条件是相互交织的。除了30帧每秒和边缘部署之外,以下运行条件必须同时满足才有实际意义:

无参考图像(GT-free)环境:现场没有可用的参考图像,性能必须依靠"无参考质量"指标来验证。亮度顺序保持:防止明暗相对平衡被扭曲,否则会降低下游目标检测的准确性。自然图像质量:确保下游识别算法能够提取稳定特征,而不受人工噪点干扰。

多通道并发处理:多个摄像头通道必须在单个GPU上同时运行,以保证基础设施效率。

在这四项运行条件中,现有模型面临的第一个障碍是评估指标的差异。传统算法验证通常依赖PSNR(峰值信噪比)或SSIM(结构相似性指数),两者都是在像素级别将修复图像与参考真值(GT)图像进行比较。

然而在实际CCTV部署中,并不存在这样的参考真值。评估必须转而依靠无参考指标:NIQE(自然图像质量评估)用于衡量感知自然度,LOE(亮度顺序误差)用于衡量每帧内相对亮度顺序。一旦评估标准转变为此类运行指标,即便是在公开数据集排行榜上领先的模型,也不再能保证在实际生产环境中具备质量优势。

即使某个模型满足了这些无参考质量标准,实时处理约束(33毫秒)仍是一个完全独立的挑战。以下具体实验数据详细说明了现有基线模型究竟超出这一目标多少,并在实际硬件上造成了瓶颈。

33毫秒的壁垂:通用优化的局限所在

客户为部署准备的现有模型是一个重量级架构:一个基础低光增强模块,后接一个独立的去噪模块,用于抑制亮度提升过程中被放大的噪点。原始模型在部署目标设备(Jetson Orin NX)上运行时,推理时间达到约400毫秒,超过33毫秒实时目标的10倍以上。为了评估优化的上限,我们在规格更高的开发板(AGX Orin)上对模型进行了性能分析。即便在这块开发板上,延迟仍测得约180毫秒,仍远远达不到目标。

我们在开发环境中应用了所有可行的优化技术。首先,通过修改原始模型的ONNX图以减少Transpose和Reshape操作,并提高下采样比例,我们将延迟从180毫秒降至约60毫秒。然而,一旦将TensorRT 10.3.x确定为运行时,运行时本身开始自动执行这种手动图优化,这一路径便再无更多优化空间。INT8量化由于符合条件的层比例有限,实际运行速度反而比FP16更慢。50%剪枝将帧率压制在目标帧率的一半左右(约15帧每秒),并产生了明显的质量下降,进一步推进已无意义。

我们得出结论:仅靠对现有模型架构的后期优化,无法达到33毫秒的目标。作为替代方案,我们试验了该领域四个广受引用的模型:RUAS、Zero-DCE++、LiteIE和Wave-mamba。这些模型均未达到目标。

经过一系列实验,根本原因逐渐清晰。现有模型和这四个替代模型都依赖一种重量级的计算方式:从零开始生成或修复整张图像。在这种模式下,无论怎样优化都无法突破33毫秒的界限。因此,Nota AI停止对现成模型进行调优,转而从零开始设计一个充分考虑边缘硬件约束的轻量化模型。这一决策之所以能够实现,正是因为Nota AI将算法开发、优化和部署作为一个持续统一的流程来处理。

采用YUV通道分离的自研轻量ViT模型(98K参数)

在设计自研架构之前,我们重新定义了问题。低光视频增强的本质是恢复亮度(Y)通道,而非重新生成色度(UV)通道。在夜间CCTV环境中,大部分可识别信息是隐藏在黑暗中的亮度数据。色彩信息可以通过一个轻量级校正层来处理,而非依靠沉重的深度学习解码器,对下游识别算法的影响可以忽略不计。基于这一问题定义,我们做出了三项结构性设计决策。

YUV色彩空间分离

我们将输入图像拆分为Y(亮度)和UV(色度)通道,仅将Y通道输入模型主干网络。这将模型需要处理的输入信息量减少到三分之一,并消除了对重量级色彩重建解码器的需求。

约2/5比例的高强度下采样

由于UV通道被排除在模型主干之外,我们能够应用更大幅度的下采样。亮度通道对高频空间信息的丢失相对稳健,而色彩通道在下采样时会出现明显的色彩渗色问题。通过将色彩处理隔离到一个独立的轻量级校正层,我们使模型主干摆脱了这一限制,使1920×1080的输入以原始尺寸约2/5的比例通过主干网络。

双线性上采样与色彩校正UV合并

经下采样后恢复的Y通道,使用双线性插值上采样回原始分辨率。随后与原始UV通道合并,UV通道已经过一个轻量级色彩校正层处理,以补偿亮度变化引起的色彩偏移,从而生成最终图像。由于色彩并非通过重量级学习模型重新生成,色彩一致性能够自然保持,无需独立解码器。

在这三项机制优化后的流程中,最关键的角色由亮度(Y)恢复模块承担。部署在该位置的模型主干是DeltaViT,这是Nota AI自研的轻量级视觉Transformer(ViT),参数量约为98K。与解决同类任务的排行榜顶级模型RetinexFormer(约160万参数)相比,DeltaViT的参数量减少约16倍,直观展示了其结构上的轻量化设计。

需要说明的是:这一设计针对以亮度校正为主要需求的低光CCTV环境进行了优化。对于色温快速变化的特殊领域,如舞台照明或工业特定光谱照明中UV分量变化显著的场景,可能需要额外验证。

在Jetson Orin NX上达到28毫秒并取得顶级质量指标

将最终的Torch模型导出为ONNX并转换为TensorRT后,我们在开发环境(AGX Orin)上测得延迟低于10毫秒。转移到实际部署目标设备(Jetson Orin NX)上,结果为GPU计算时间低于28毫秒。33毫秒的量化目标以超过5毫秒的余量顺利达成。在客户现有模型此前运行约400毫秒的同一设备上,DeltaViT现在的运行时间低于28毫秒。

在解决了实时推理速度这一主要挑战后,我们进行了量化图像质量验证。该模型已经通过了客户针对运行需求的定性视觉审查。下一步是量化其与现有通用模型之间的差距。

我们在RTX 3090 24GB显卡上,针对五个标准低光数据集进行了基准测试,将自研DeltaViT(98K参数)与LYT-Net(45K)、RUAS(3.4K)、Zero-DCE++(10.6K)和RetinexFormer(160万)进行比较。值得注意的是,LYT-Net在1080p推理时因内存溢出(OOM)错误而失败,导致其在实际场景中无法运行。排除该模型后,下表总结了剩余四个模型在与CCTV生产环境最相关的指标上的表现:LOE、NIQE和1080p推理时间。

如图表所示,DeltaViT在NIQE和LOE两项指标上均排名第一。这一结果是在参数量缩小16倍(98K对比160万)、速度比RetinexFormer快约63倍的架构上实现的。在1080p推理下,DeltaViT测得8.92毫秒,约相当于112帧每秒,相对30帧每秒最低门槛有3.7倍的余量。最值得关注的是,当输入像素从480p增加到1080p,增幅达6.7倍时,DeltaViT的推理时间仅增长1.93倍,展现出卓越的负载适应能力(Zero-DCE++为6.72倍,RetinexFormer为7.87倍)。

3通道对0通道:单张RTX 3090上的吞吐量差距

此次合作的主要部署目标是在Jetson Orin NX上运行单一通道。然而,客户的运行需求还包括在中央监控服务器上同时处理多个摄像头通道的场景。单个GPU能够支撑的通道数量直接关系到部署与运营成本。

我们测量了同样的四个模型中每一个在单张RTX 3090 24GB显卡上、维持1080p 30帧每秒条件下能够同时处理的通道数量。结果显示:DeltaViT稳定支撑3个通道,Zero-DCE++在临界点达到1个通道,RUAS则不稳定,通道数低于1个,RetinexFormer的通道数为0。即便在RTX 3090这样的高端GPU上,RetinexFormer也无法维持单个1080p 30帧每秒的通道。

DeltaViT专为单通道边缘部署而设计,但同一模型却能以更少的GPU数量承担相同的多通道服务器工作负载。

从模型设计到优化的一体化流程

在Jetson Orin NX上将低光视频增强模型压缩进33毫秒约束范围内,同时满足客户的质量要求,这一目标仅凭通用的后期优化手段是无法实现的。当量化、剪枝等标准压缩技术在现有修复模型固有的计算开销面前碰壁时,Nota AI选择的解决方案是一种一体化设计方法:从设计阶段起就将硬件约束与领域特性结合起来。

通过分离YUV通道将信息量减少到三分之一,并仅对亮度(Y)通道应用轻量级ViT模型的同时保留色彩关系,这种结构性方法带来的不仅是处理时间的缩短,更是在边缘设备计算约束范围内达成了目标线。最终结果:在目标设备上延迟低于28毫秒,同时在标准基准测试环境中取得LOE和NIQE指标的第一名。

这一案例为边缘部署领域提供了一个重要启示:基准分数并不能直接转化为生产环境中的实时性能。在通用图优化或压缩手段单独无法达成目标的领域,决定成败的关键在于能否将算法建模与硬件感知优化视为一个持续统一的流程,而非彼此割裂的环节。在此次合作中,Nota AI在一个真实生产目标上验证了这种一体化设计能力。

这些差异化的技术能力建立在Nota AI自研的AI优化平台NetsPresso(R)之上。

Q&A

Q1:这次低光视频优化项目的核心成果是什么?

A:Nota AI将CCTV低光视频修复模型在Jetson Orin NX设备上的处理时间从400毫秒降低到28毫秒以内,成功超过了30帧每秒的实时处理目标,同时满足了客户的图像质量要求。

Q2:为什么通用的模型优化方法无法达到实时处理目标?

A:因为现有模型依赖从零生成或修复整张图像的重量级计算方式,无论应用量化、剪枝还是图优化等通用手段,都无法突破33毫秒的性能瓶颈,因此Nota AI改为从零设计轻量化专用模型。

Q3:DeltaViT模型是如何实现轻量化的?

A:DeltaViT通过将图像拆分为YUV通道,仅对亮度(Y)通道使用轻量级Transformer处理,色度(UV)通道则用简单校正层处理,大幅减少了计算量,参数量仅98K,比同类顶级模型少16倍。

Edge AI and Vision Alliance - Latest News