是一个超参数,用于调整辅助 Loss 的权重。论文中选择了 ,这个值足够大,可以确保负载均衡,同时又足够小,不会压倒主要的交叉熵目标(即主要的训练损失)。论文实验了从 到 的 值范围,发现 的值可以快速平衡负载,同时不会干扰训练损失。 那么一个典型的门控网络是什么呢?一个典型的门控网络通常是一个带有 softmax 函数的简单的网络。这个网络将学习将输入发送给哪个 expert。如下所示: 在论文中,作者提到这个... https://www.blogger.com/u/8/profile/09889890415012625943
Index Aptallar için
Internet 6 hours ago hankz173btk1Web Directory Categories
Web Directory Search
New Site Listings