|
|
1
1
Hardmax是在你别无选择只能以非概率的方式做出决定时使用的。例如,当你使用一个模型来生成一个神经结构,就像在神经模块网络中一样,你必须做出一个离散的选择。要使此可训练(因为这在您的状态下是不可微的),您可以使用REINFORCE(RL中的一个算法)通过策略梯度进行训练,并通过蒙特卡罗抽样估计此损失贡献。神经模块网络是一种NLP结构,依赖于seq2seq。我相信有很多例子,但这是一个立即想到的。 |