Link: DiffusionNFT: Online Diffusion Reinforcement with Forward Process.
DiffusionNFT 提出了一种在 forward process 中用 RL 训练 Diffusion Model 的方法, 在除了数据收集阶段, 不需要任何 reverse process. 所以不依赖任何 Solver 求解 ODE. 由于本人对于 Diffusion Model 的了解还非常的浅层, 也希望能够在未来回过头来继续补充本篇.
Diffusion 的加噪过程可以写为
而 Flow Model 的训练目标是训练一个速度场
那么训练得到的最优速度场为后验期望
下面回到正题, 对于 Online RL, 我们从 prompt 集合中
RL 的每一步要求
这是因为
我们只需要说明
我们记
继而
然而作者 argue, 并希望能够充分利用
我们已经利用了它们的凸组合性质, 下面要证明它们的后验分布也是凸组合.
这一步的目的是为了和最优速度场相联系, 从而得到训练目标.
用
从而得到了
在式 (1) 的两边同时作用
并结合
有了这一步, 并结合 flow model 的最优速度场, 我们可以得到在
从而, 为了实现
且此目标函数训练下的最优速度场为
证明如下:
首先对
对内部的期望进行改造:
同理
同理, 另一部分可以写为
因此, 最后
因此, 式 (2) 提出了一种 off-policy 的强化学习方法, 并于监督学习相结合. 下面是一些实践中的细节.
首先是 reward 的计算, 借鉴了 GRPO 的思路, 对 reward 做了归一化处理:
其中
其二是关于
另一个小改动是启发式地设定 time weight function
训练采用