ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

VRNN论文总结 - 指南

VRNN论文总结 - 指南

前一篇文章,笔者对于论文《A Recurrent Latent Variable Model for Sequential Data》进行了翻译,本篇文章将对该论文做一些重点说明,并分析其网络结构。

⭐️ 重要说明

1. 在RNN-Gauss / RNN-GMM中,为了有效建模这类序列,RNN为什么必须能够将x t \mathbf{x}_{t}xt中的微小变化(即唯一的随机性来源)映射到隐藏状态h t \mathbf{h}_{t}ht的潜在巨大变化上。

为什么说x t \mathbf{x}_{t}xt唯一的随机性来源?就是中的微小变化
这句话必须从标准RNN的确定性结构来理解。

  1. RNN的隐藏状态转移是完全确定性的确定性的”(the internal transition structure of the standard RNN is entirely deterministic)。这意味着,给定上一时刻的隐藏状态就是:如论文第1节所述,“标准RNN的内部转移结构完全h t − 1 \mathbf{h}_{t-1}ht1 和当前输入 x t \mathbf{x}_{t}xt,下一时刻的隐藏状态h t \mathbf{h}_{t}ht是经过一个固定的函数 f f f计算出来的:
    h t = f ( x t , h t − 1 ) \mathbf{h}_{t} = f(\mathbf{x}_{t}, \mathbf{h}_{t-1})ht=f(xt,ht1)
    这个过程没有随机性,就像一个数学公式,输入相同,输出必然相同。

  2. RNN的“随机性”只存在于输出层:模型的唯一不确定性来自于在生成x t \mathbf{x}_{t}xt时使用的概率分布。例如,在 RNN-Gauss 中,模型预测的是一个高斯分布的均值μ t \boldsymbol{\mu}_{t}μt,而真实的 x t \mathbf{x}_{t}xt 是从这个以 μ t \boldsymbol{\mu}_{t}μt为中心的分布中采样得到的。这个采样过程引入了随机性。

  3. 结论:因此,在整个RNN的动力学系统中,只有从“预测的分布”到“实际观测的x t \mathbf{x}_{t}xt”这一步是随机的。一旦x t \mathbf{x}_{t}xt被观测到,后续所有计算(更新h t \mathbf{h}_{t}ht)都是确定性的。所以,x t \mathbf{x}_{t}xt相对于模型预测值μ t \boldsymbol{\mu}_{t}μt的偏差(即“微小变化”),就是驱动整个架构发生不同行为的唯一随机性来源

为什么RNN必须将x t \mathbf{x}_{t}xt的微小变化映射到h t \mathbf{h}_{t}ht的巨大变化上?

这源于对高度结构化、高信噪比序列噪声。就是(如自然语音)建模的需求。这类数据的特点是,其内部的“可变性”(variability)是信号本身的关键组成部分,而不

核心矛盾

举例说明:语音合成中的说话人变化

假设我们有一个训练好的 RNN-GMM 模型,用于生成英语单词 “hello” 的音频波形。

论文如何论证这一点

  1. 性能妥协:论文指出,为了防止过拟合,网络容量必须受限。这迫使模型在两个目标间做妥协:

  2. VRNN的解决方案:VRNN通过引入潜在变量z t \mathbf{z}_{t}zt解决了这个矛盾。

返回列表