FCN全卷积网络理解及代码实现(来自pytorch官方实现)_是七叔呀的博客-程序员宅基地_fcn代码

技术标签: cnn  计算机视觉  深度学习  人工智能  神经网络  

视频链接:https://www.bilibili.com/video/BV1J3411C7zd?vd_source=a0d4f7000e77468aec70dc618794d26f
代码:https://github.com/WZMIAOMIAO/deep-learning-for-image-processing

FCN是2015年提出的首个端对端的针对像素级预测的全卷积网络。
如今的pytorch实现的FCN都是基于ResNet-50的backbone,不是论文中的VGG16,且使用的是空洞卷积(也叫膨胀卷积)

pytorch官方实现的FCN网络结构图

在这里插入图片描述
博主github:https://github.com/WZMIAOMIAO/deep-learning-for-image-processing/tree/master/pytorch_segmentation/fcn

一、相比以前网络的巨大提升:

在这里插入图片描述

二、传统使用池化层最后得到的其实是一个长度为1000的向量:

在这里插入图片描述
而换为卷积层之后,最后得到的是1000通道的2D图像,可以可视化为heat map图。

三、回顾VGG16

一般说的vgg16是D
在这里插入图片描述
全连接操作前后:77512(通道)
在这里插入图片描述

【 假 设 忽 略 偏 置 】 \color{red}{【假设忽略偏置】}
全连接FC1计算:计算对应某一个结点的输出,将该节点与上一层某一个结点的权重与输入对应节点数值相乘,再求和

  • FC1参数:25088*4096=102760448

下层使用7*7的卷积核、stride=1,4096个卷积核的一个卷积层

  • Conv参数:77512*4096=102760448

一 个 卷 积 核 和 F C 1 一 个 节 点 参 数 量 一 样 \color{red}{一个卷积核和FC1一个节点参数量一样} FC1,一共4096个卷积核,FC也是4096个节点。

【 不 忽 略 偏 置 的 正 常 卷 积 操 作 , 4096 个 卷 积 核 应 该 有 4096 个 偏 置 项 】 \color{red}{【不忽略偏置的正常卷积操作,4096个卷积核应该有4096个偏置项】} 40964096
在这里插入图片描述

PS:全连接层

全连接层的输入是一维数组,多维数组需先进行Flatten进行一维化处理,然后连接全连接层。全连接层的每一个结点都与上一层的所有结点相连,用来把前边提取到的特征综合起来。由于其全相连的特性,一般全连接层的参数也是最多的。全连接图结构如下:
在这里插入图片描述
其中,x1、x2、x3为全连接层的输入,a1、a2、a3为输出,有
在这里插入图片描述

全连接层参数计算

权值参数=输入一维数组大小*全连接层输出结点数
偏置参数b=全连接层输出结点数

eg:
输入有[5044]个神经元结点,输出有500个结点,则一共需要5044*500=400000个权值参数W和500个偏置参数b

卷积和全连接层

卷积跟全连接都是一个点乘的操作,区别在于卷积是作用在一个局部的区域,而全连接是对于整个输入而言,那么只要把卷积作用的区域扩大为整个输入,那就变成全连接了,我就不给出形式化定义了。所以我们只需要把卷积核变成跟输入的一个map的大小一样就可以了,这样的话就相当于使得卷积跟全连接层的参数一样多。
eg:输入是224x224x3 的图像,假设经过变换之后最后一层是[7x7x512]的,那么传统的方法应该将其展平成为一个7x7x512长度的一层,然后做全连接层,假设全连接层为4096×1000层的(假设有1000个分类结果)。 那么用1×1卷积核怎么做呢,因为1×1卷积核相当于在不同channel之间做线性变换,所以:

先选择7×7的卷积核,输出层特征层数为4096层,这样得到一个[1×1×4096]层的
然后再选择用1×1卷积核,输出层数为1000层,这样得到一个[1×1×1000]层这样就搞定了。

四、FCN-32s、16s、8s的区别

在这里插入图片描述
上采样倍率为32的模型对应的就是FCN-32s,16s、8s同理。

FCN-32s

FCN原论文中backbone的第一个卷积层padding=100,为了防止图片过小(例如192192)后面的卷积层会报错。
如果图片小于32
32的话在卷积过程就会报错。
但是没必要设置,只要输入图片大小大于32*32,我们就可以将padding设置为3。
在这里插入图片描述
对于FCN-32s

  • vgg16 backbone输出的特征图大小就为h/32,w/32,512。高度宽度变为原图的1/32。

  • 之后经过FC6层:由于我们将FC6卷积层的padding设置为3、卷积核大小7*7,通过FC6之后将不会改变特征图的高和宽;且我们使用了4096个卷积核,所以这里就得到了4096个2D特征图。

  • 经过FC7:使用了1*1大小的卷积核,步距也为1,所以输出特征图shape也不会发生变化。

  • 之后经过卷积核大小为1*1的卷积层:它的卷积核的个数和我们的分类类别数一样(包含背景,对于voc为20类+1背景),将特征图通道数变为num_cls。

  • 之后通过一个转置卷积:这里的s32我们会将特征图上采样32倍【原论文中使用的是双线性插值】,得到特征图大小变为h,w,num_cls。

之后特征图经过一个softmax处理就能得到针对每一个pixel的预测类别。
前面的backbone使用的是vgg16的预训练权重,整个结构十分简单,但是效果还是非常不错的。
在这里插入图片描述
其实这里的转置卷积在原论文中其实是将参数给冻结住了,冻结住意味着其实它就是一个简单的双线性卷积了。

  • 所以这里其实可以不使用转置卷积,可以直接使用深度学习框架提供给我们的双线性插值方法。

  • 为什么会冻结呢?作者说冻结不冻结作者觉得结果好像没有什么差别,而且冻结参数会少一些。up主觉得冻结不冻节效果一般的原因是这里的上采样倍率太大了,有点强人所难的感觉。有兴趣的可以看一下u-net中的上采样率是多少。

FCN-16s

在这里插入图片描述

FC6、FC7、Conv2d核32s的一样。
不同点:

  • 转置卷积上采样率变为了2倍,之后高和宽变为1/16
  • 下面分支经过maxpool4之后变也为1/16,通道数为512;后接上了一个1*1卷积、卷积核数量为num_cls、步长为1,得到特征图大小1/16、通道数变为num_cls
  • 之后进行一个相加操作,转置卷积上采样16倍就得到了原图大小h,w,num_cls

【 F C N − 16 s 中 融 合 了 来 自 m a x p o o l 4 的 信 息 】 \color{red}{【FCN-16s中融合了来自maxpool4的信息】} FCN16smaxpool4

须知:vgg16经过mxpool3之后特征图大小下采样率为8,经过maxpool4后下采样率为16。
在这里插入图片描述

FCN-8s

在这里插入图片描述

不同点:

  • 8s还利用了来自于mxpool3的信息,经过16s类似的1*1卷积层后得到一个1/8,通道数为num_cls的特征图;
  • FCN-16s上两层后得到的1/16特征图,经过一个转置卷积上采样,采样率为2倍就能得到一个和maxpool3输出尺寸一样的1/8的特征图
  • 一块进行一个相同位置元素的相加操作【进一步的融合】,最后进行一个上采样倍率为8的转置卷积就能得到一个和原图大小一样的特征图大小h,w,num_cls。

【 由 此 可 见 , F C N − 16 s 和 F C N − 8 s 融 合 了 一 个 底 层 的 信 息 ; 而 F C N 32 s 是 最 简 单 的 , 它 没 有 融 合 底 层 信 息 】 \color{red}{【由此可见,FCN-16s和FCN-8s融合了一个底层的信息;而FCN32s是最简单的,它没有融合底层信息】} FCN16sFCN8sFCN32s在网上看到最多的是FCN-32的实现。

五、损失计算

在这里插入图片描述
针对每一个pixel都会去计算它所对应的一个Cross Entropy Loss,然后将所有pixel的交叉熵损失进行一个求平均操作就得到了一个我们网络的最终的一个损失

六、语义分割评价指标

在这里插入图片描述

见前言:语义分割前沿

七、代码实现

在这里插入图片描述
ResNet-50中先经过conv1 7*7的一个卷积

  • conv_2:3*3的一个最大池化下采样,再接上3个残差块(对应右图layer1)
  • conv_3:4个残差块(对应layer2)

不 同 的 地 方 : \color{red}{不同的地方:}

  • layer3:这里也有6个残差结构,1个Bottleneck1+5个Bottleneck2
  • layer4:3个残差结构,1个Bottleneck1+2个Bottleneck2

Bottleneck1:

  • 将残差连接的2*2卷积层步距改为1,原来resnet这个分支会进行一个下采样将高和宽缩短为一半,【这里因为语义分割中下采样倍率过大的话,再还原成原图后,这里的效果其实会受影响,所以我们这里就没有必要再做一个下采样了。】

  • 此外主干分支3*3卷积的步距也从2改为了1,同时引入了r参数,即膨胀系数。

在这里插入图片描述
Bottleneck2:
在这里插入图片描述
接下来通过FCN Head模块:33卷积层缩小通道为原来的1/4【2048-512】,再通过一个dropout和一个11卷积层,这里11卷积层调整特征层的channel为分割类别中的类别个数。
最后经过双线性插值还原特征图大小到原图。【图例:输入480
480,上采样也到480*480】
在这里插入图片描述

layer3中引出的一条FCN Head,官方回答:为了防止误差梯度没法传递到网络浅层,这里就引入了一个辅助分类器。和google net中辅助分类器是差不多的。
训练的时候是可以使用辅助分类器件的【可用可不用,都可以试一下】,但是最后去预测或者部署到正式环境的时候只用主干的output,不用aux output。
在这里插入图片描述
up主的代码地址:https://github.com/WZMIAOMIAO/deep-learning-for-image-processing/tree/master/pytorch_segmentation/fcn

版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明。
本文链接:https://blog.csdn.net/m0_46378271/article/details/125286033

智能推荐

java线程 jni_C多线程Java JNI方法调用_一个喜欢写作的人的博客-程序员宅基地

我能够运行类似的代码(如下所示),其中有多个线程访问同一JVM(macOS).我正在使用pthread.很少有重要的事情>将线程附加到JVM(根据文档,一次只能有一个线程可以使用JVM)>连接螺纹>我想也最好使用互斥体以防止连接多个线程main.c#include #include #include #define NUM_THREADS 6pthread_mutex_t mut...

使用jstack跟踪Java进程_氺氺的博客-程序员宅基地

生产运行的系统运行时间长了,容易出现运行缓慢,内容不足等问题。         如果单靠通过查看代码是很难去发现这些问题,在这一次故障排查中,我也学到了怎样更好的使用jvm监控工具来进行诊断,主要用到了jstack和jmap命令,jmap上次已经讲过就不再讲了,下面就一个例子来讲怎么使用jstack来对的Java程序进行诊断。         首先让我们来了解一下jstack这个命令的作用

玩转目标检测预训练模型(二)—LearnOpenCV库的使用_nerd呱呱的博客-程序员宅基地_目标检测预训练模型

预训练模型使用的代码地址https://github.com/spmallick/learnopencv/tree/master/ObjectDetection-YOLO模型下载地址:https://github.com/reu2018DL/YOLO-LITEhttps://pjreddie.com/darknet/yolo/下载模型我们在下载地址中找到感兴趣的模型,下载对应cfg(...

常用正则表达式_LRX_GOAT的博客-程序员宅基地

邮件地址^\w+([-+.]\w+)@\w+([-.]\w+).\w+([-.]\w+)*$python使用re.search匹配邮件地址,可去掉开头的^以及结尾的$域名[a-zA-Z0-9][-a-zA-Z0-9]{0,62}(.[a-zA-Z0-9][-a-zA-Z0-9]{0,62})+.?空白行\n\s*\r(可以用来删除空白行)汉字^[\u4e00-\u9fa5]{0,}$禁止输入~字符[^~\x22]+身份证号(^\d{15}$)|(^\d{18}$)|(^

jsp用EL语法遍历输出对象集合_海底钓鱼的博客-程序员宅基地

<%@page import="org.apache.jasper.tagplugins.jstl.core.ForEach"%><%@page import="com.demo.entity.User"%><%@page import="java.util.ArrayList"%><%@page import="java.util.List"%&g...

July 18th, Week 30th Monday, 2016_dflkg8956的博客-程序员宅基地

Truth needs no color; beauty, no pencil.真理不需要色彩,美丽无需涂饰。Most of the time, giving some color to truth can make the truth more accpectable;And it is natural that a beautiful face with exquisit...

随便推点

外观模式(三):抽象外观类,外观模式效果与适用场景_Sunny Mornings的博客-程序员宅基地

4. 抽象外观类      在标准的外观模式结构图中,如果需要增加、删除或更换与外观类交互的子系统类,必须修改外观类或客户端的源代码,这将违背开闭原则,因此可以通过引入抽象外观类来对系统进行改进,在一定程度上可以解决该问题。在引入抽象外观类之后,客户端可以针对抽象外观类进行编程,对于新的业务需求,不需要修改原有外观类,而对应增加一个新的具体外观类,由新的具体外观类来关联新的子系统对象,

Oracle图形化安装报错:已拒绝X11转移申请_shayuwei的博客-程序员宅基地_xorg-x11-xauth

问题描述Oracle图形化安装时报错:问题解决原来X11 forwarding依赖xorg-x11-xauth软件包,所以必须先安装xorg-x11-xauth软件包。# yum install xorg-x11-xauth

Vue路由传值,父子组件传值,组件间传值,Vuex传值_米柆的博客-程序员宅基地

一、路由传值:1、通过路由的路径带参数,同时配置路由的时候也要带上参数,获取参数使用this.$route.params.id,直接拿路由里面的参数。toRouter(){ var id = 1; this.$router.push({ path:'/content/${id}'; });}router.js需配置{ path:"index/:id", name:"index", component: Index}...

Linux Kernel 内存管理之CMA分配和释放_星空探索的博客-程序员宅基地

/** * cma_alloc() - allocate pages from contiguous area * @cma:   Contiguous memory region for which the allocation is performed. * @count: Requested number of pages. * @align: Requested align

推荐文章

热门文章

相关标签