Diffusion Controller 如何统一并简化 AI 图像生成
我们提出 Diffusion Controller,一种轻量级的“转向阻尼器”网络,能够精准引导图像生成,从而显著提升提示词对齐效果。它可以无缝挂载到即使是有访问限制的闭源模型上,在提升图像质量的同时不破坏基线的稳定性。
快速链接
像 Nano Banana、Stable Diffusion 和 Flux 这类文生图 AI 模型的快速进步,已经从根本上改变了创意设计,让任何人都能根据文字描述合成出逼真、高保真的图像。然而,要让这些庞大的模型精准满足用户意图、下游目标或严格的视觉约束,仍然是一场微妙且不可预测的平衡术。举个例子,假设你给模型输入“一只戴着墨镜的蜥蜴”。模型可能生成一只逼真的蜥蜴,但没戴墨镜。反过来,如果强行让模型加上墨镜,又可能扭曲蜥蜴的脸,毁掉画面质量。
现有的图像生成引导或微调方法彼此割裂。一方面,开发者使用推理阶段的技术(如无分类器扩散引导)来调整文本提示词的影响力,在生成过程中实时引导图像生成。另一方面,他们依赖 LoRA 这类参数高效适配器、奖励加权回归或策略梯度进行重量级微调,以改变模型行为。
由于这些工具长期以来被视为彼此独立、互不相关的修补手段,这一领域始终缺乏一套统一的、有原则的数学语言,来统一、分析和优化我们对生成式模型的控制方式。这种碎片化的做法常常迫使工程师在平衡用户偏好对齐与图像质量时只能靠猜。
为了解决这一平衡难题,我们提出了 Diffusion Controller 框架。它不把图像生成看作一串僵硬的孤立步骤,而是将整个去噪过程重新定义为一个平滑、连续的控制问题。结果表明,Diffusion Controller 的轻量级附加网络在匹配人类偏好方面超过了行业标准。更进一步,其完全解锁版本(即拥有“白盒”或无限制访问权限、可修改模型内部权重的微调模型)相对基线模型取得了 90% 的胜率。
Diffusion Controller 框架
Diffusion Controller 框架把图像生成过程(AI 模型从随机噪声出发,逐步精炼出清晰图像)视为一段可平滑控制的旅程。可以把这个预训练基础模型想象成一辆动力强劲的摩托车;为了改变它的行驶方式而去重建核心引擎,既低效又冒险。Diffusion Controller 则像一个轻量级转向阻尼器挂载其上,而主模型(摩托车)始终保持完全冻结、不被触碰。
Diffusion Controller 的核心机制(转向阻尼器)不会去猜测每一步该如何引导生成,而是在图像生成过程中动态调整生成轨迹。它平滑地重新校准模型的默认行为,把更多权重分配给那些能够最大化用户自定义目标的方向(例如实现某种艺术风格或上下文对齐)。
通过数学方法并借助反馈来优化这些生成轨迹上的偏移,Diffusion Controller 框架实现了平衡:既能成功地把模型的生成过程引向新的用户偏好,又能完整保留基础模型清晰的画面质量和底层稳定性。回到上面蜥蜴的例子,这意味着转向阻尼器会引导模型确保墨镜被画出来,而惩罚护栏会同时介入,防止系统为了达成这一点而扭曲蜥蜴天然的鳞片纹理和身体比例。
从理论到实践
为了把这个理论上的控制问题变成实用工具,我们把抽象、甚至可能难以求解的方程,转化为两种完全基于最终奖励分数的高效微调方法:
“转向阻尼器”网络
Diffusion Controller 框架的运行方式类似转向阻尼器,它解决了一个巨大的现实商业问题。通常,要改变模型的行为,你需要“白盒”访问权限,深入其核心引擎并修改内部设置。然而,世界上最好的图像生成模型往往是企业的机密(被称为黑盒或灰盒)。
转向阻尼器网络依赖完美的图像引导指令,即基础模型的知识加上一个微小的修正量。它观察正在被去除噪声的图像,并注入精确、微小的引导修正。这让工程师能够完美地控制和定制即便是严格锁定、闭源的模型,而无需触碰其底层代码。
实验与结果
我们以 Stable Diffusion v1.4 作为骨干模型,在三种微调范式下评估 Diffusion Controller 框架的能力:监督微调(SFT)、奖励加权损失(RWL)和 PPO。性能使用标准化的人类偏好分数(HPS-v2)来衡量,以判断生成图像与用户提示词及审美偏好的对齐程度。
我们在 Diffusion Controller 框架下实现了四种网络结构:
结果显示,Diffusion Controller 在完全可访问的“白盒”环境和限制严格的“灰盒”环境中都表现出色,持续超越对应的基线,并实现了更好的质量与效率权衡。
在 SFT 和 RWL 两个方向上,灰盒的 Diffusion Controller 转向阻尼器网络在 HPS-v2 胜率上超过了 LoRA——后者是当前最先进的参数高效白盒方法。这是一个重要的里程碑,因为 Diffusion Controller 是在操纵远少于 LoRA 的模型内部层的情况下做到这一点的。此外,在综合的人类评估小组中,Diffusion Controller 在复杂、多属性的测试提示词上取得了最佳的主观质量和提示词匹配结果。
该框架的一个核心特性是它在运行时的灵活性。通过调整单一的推理阶段引导强度参数,用户可以动态调高或调低控制约束的强度。这使得用户能够在生成过程中平滑、细致地调整提示词对齐程度,而不会破坏基线的图像稳定性,也不会造成旧式引导方法常见的视觉扭曲。
结语
通过把数学控制与图像生成模型结合起来,Diffusion Controller 弥合了纯数学与现代创意工具之间的鸿沟。它不再依赖拼凑各种猜测和临时补救来调校模型,而是提供了一套统一、数学上严谨的图像生成引导系统。最妙的是,它给出了一套实用、轻量的“转向阻尼器”蓝图,即使在有访问限制的闭源模型上也能完美运作。
展望未来,这一统一框架为研究开辟了令人兴奋的新方向。由于控制层与模型的核心引擎完全分离,未来的开发者可以将 Diffusion Controller 用于远超文本提示词匹配的用途。近期的下一步包括:用该框架构建高级个性化工具、开发稳健的安全机制以帮助缓解有害内容的生成,以及调整转向阻尼器网络去控制复杂的下一代视频模型。
致谢
我们感谢来自 Google Research、Google DeepMind 以及学术界的共同作者与协作者对这项工作的贡献。
快速链接
Q&A
Q1:Diffusion Controller 是什么?它能做什么?
A:Diffusion Controller 是一种轻量级的“转向阻尼器”网络,能够精准引导图像生成,显著提升提示词对齐效果。它可以无缝挂载到即使有访问限制的闭源模型上,在提升图像质量的同时不破坏基线的稳定性。
Q2:Diffusion Controller 和 LoRA 相比有什么优势?
A:在 SFT 和 RWL 两个方向上,灰盒的 Diffusion Controller 转向阻尼器网络在 HPS-v2 胜率上超过了 LoRA,而且操纵的模型内部层数远少于 LoRA。它的完全解锁版本相对基线模型取得了 90% 的胜率。
Q3:Diffusion Controller 未来有什么应用方向?
A:由于控制层与模型核心引擎完全分离,它可以用于构建高级个性化工具、开发稳健的安全机制以缓解有害内容生成,以及适配到复杂的下一代视频模型上。
