机器学习深度学习——softmax回归的简洁实现

👨‍🎓作者简介：一位即将上大四，正专攻机器学习的保研er
🌌上期文章：机器学习&&深度学习——softmax回归从零开始实现
📚订阅专栏：机器学习&&深度学习
希望文章对你们有所帮助

继续使用Fashion-MNIST数据集，并保持批量大小为256：

import torch
from torch import nn
from d2l import torch as d2l

batch_size = 256
train_iter, test_iter = d2l.load_data_fashion_mnist(batch_size)

softmax回归的简洁实现

初始化模型参数
重新审视softmax的实现
- 数学推导
- 交叉熵函数
优化算法
训练

初始化模型参数

softmax的输出层是一个全连接层，因此，为了实现模型，我们只需要在Sequential中添加一个带有10个输出的全连接层。当然这里的Sequential并不是必要的，但是他是深度模型的基础。我们仍旧以均值为0，标准差为0.01来随机初始化权重。

# pytorch不会隐式地调整输入的形状
# 因此在线性层前就定义了展平层flatten，来调整网络输入的形状
net = nn.Sequential(nn.Flatten(), nn.Linear(784, 10))

def init_weights(m):
    if type(m) == nn.Linear:
        nn.init.normal_(m.weight, std=0.01)

net.apply(init_weights)  # 给net每一层跑一次init_weights函数

重新审视softmax的实现

数学推导

在之前的例子里，我们计算了模型的输出，然后将此输出送入交叉熵损失。看似合理，但是指数级计算可能会造成数值的稳定性问题。
回想一下之前的softmax函数：
$\hat{y}_j=\frac{exp(o_j)}{\sum_kexp(o_k)}\\ 其中\hat{y}_j是预测的概率分布，o_j是未规范化的第j个元素$
由于o中的一些数值会非常大，所以可能会让其指数值上溢，使得分子或分母变成inf，最后得到的预测值可能变成的0、inf或者nan。此时我们无法得到一个明确的交叉熵值。
提出解决这个问题的一个技巧：在继续softmax计算之前，先从所有的o中减去max(o)，修改softmax函数的构造且不改变其返回值：
$\hat{y}_j=\frac{exp(o_j-max(o_k))exp(max(o_k))}{\sum_kexp(o_j-max(o_k))exp(max(o_k))}$
这样操作以后，可能会使得一些分子的exp(o-max(o))有接近0的值，即为下溢。这些值可能会四舍五入为0，这样就会使得预测值为0，那么此时要是取对数以后就会变为-inf。要是这样反向传播几步，我们可能会发现自己屏幕有一堆的nan。
尽管我们需要计算指数函数，但是我们最终会在计算交叉熵损失的时候会取他们的对数。尽管通过将softmax和交叉熵结合在一起，可以避免反向传播过程中可能会困扰我们的数值稳定性问题。如下面的式子：
$log(\hat{y}_j)=log(\frac{exp(o_j-max(o_k))}{\sum_kexp(o_k-max(o_k))})\\ =log(exp(o_j-max(o_k)))-log(\sum_kexp(o_k-max(o_k)))\\ =o_j-max(o_k)-log(\sum_kexp(o_k-max(o_k)))$
通过上式，我们避免了计算单独的exp(o-max(o))，而是直接使用o-max(o)。
因此，我们计算交叉熵函数的时候，传递的不是未规范化的预测o，而不是softmax。
但是我们也希望保留传统的softmax函数，以备我们要评估通过模型输出的概率。

交叉熵函数

在这里介绍一下交叉熵函数，以用于上面推导所需的需求：

torch.nn.CrossEntropyLoss(weight=None,
						ignore_index=-100,
						reduction='mean')

交叉熵函数是将LogSoftMax和NLLLoss集成到一个类中，通常用于多分类问题。其参数使用情况：

ignore_index：指定被忽略且对输入梯度没有贡献的目标值。
reduction：string类型的可选项，可在[none,mean,sum]中选。none表示不降维，返回和target一样的形状；mean表示对一个batch的损失求均值；sum表示对一个batch的损失求和。
weight：是一个一维的张量，包含n个元素，分别代表n类的权重，在训练样本不均衡时很有用，默认为None：
（1）当weight=None时，损失函数计算方式为
loss(x,class)=-log(exp(x[class])/Σexp(x[j]))=-x[class]+log(Σexp(x[j])
（2）当weight被指定时，损失函数计算方式为：
loss(x,class)=weight[class]×(-x[class]+log(Σexp(x[j]))

# 在交叉熵损失函数中传递未归一化的预测，并同时计算softmax及其导数
loss = nn.CrossEntropyLoss(reduction='none')

优化算法

# 优化算法
trainer = torch.optim.SGD(net.parameters(), lr=0.1)

训练

调用之前定义的训练函数来训练模型：

# 调用之前的训练函数来训练模型
num_epochs = 10
d2l.train_ch3(net, train_iter, test_iter, loss, num_epochs, trainer)
d2l.plt.show()

在这里插入图片描述

本文来自互联网用户投稿，该文观点仅代表作者本人，不代表本站立场。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如若转载，请注明出处：/a/51589.html

如若内容造成侵权/违法违规/事实不符，请联系我们进行投诉反馈qq邮箱809451989@qq.com，一经查实，立即删除！

机器学习深度学习——softmax回归的简洁实现

softmax回归的简洁实现

初始化模型参数

重新审视softmax的实现

数学推导

交叉熵函数

优化算法

训练

相关文章

状态机实现N位按键消抖

Virtualbox虚拟机中Ubuntu忘记密码

软件测试面试【证券项目公司】

GAMES101 笔记 Lecture13 光线追踪1

PC音频框架学习

spring项目中idea提示Application context not configured for this file

【NLP】语音识别 — GMM， HMM

C++之文件操作

JVM详解(超详细)

【设计模式——学习笔记】23种设计模式——组合模式Composite（原理讲解+应用场景介绍+案例介绍+Java代码实现）

EXCEL，如何比较2个表里的数据差异（使用数据透视表）

CMU 15-445 -- Multi-Version Concurrency Control - 16

linux系统安装mysql

MD-MTSP：成长优化算法GO求解多仓库多旅行商问题MATLAB（可更改数据集，旅行商的数量和起点）

【物联网无线通信技术】UWB定位从理论到实现（DW1000）

Labelme制作COCO格式的图像语义分割数据集

[个人笔记] vCenter设置时区和NTP同步

linux+Jenkins+飞书机器人发送通知(带签名)

ChatGPT炒股：爬取股票官方微信公众号的新闻资讯

beego验证码（配置到redis存储）