|
1
0
损失取决于批次大小和批次中的元素。对于30张随机图像,丢失的几率更高(尤其是在训练开始时)。
另一方面,如果多个GPU和单个GPU在每个批次中具有相同数量的示例,并且每个批次完全相同,网络参数也相同,那么损失也应该相等(这可以通过固定两种情况下的种子、批次大小和权重来实现)。 |