摘要本周阅读了一篇关于空间转换器的论文虽然论文只是在早期的操作但是也可以是一种轻量化的特征抽取模型。对我的实验有一定的启发。AbstractThis week, I read a paper on spatial transformers. Although the paper is only in its early stages of development, it can still serve as a lightweight feature extraction model. It provides some inspiration for my experiments.1 空间转换器背景图像识别任务的理想是把物体的特征提取出来不管是物体经过旋转、缩放等CNN中的局部最大池化可以提取特征但是尺寸太小了比如2 × 2 2\times 22×2个像素大小。需要堆叠很多层池化才能捕捉到较大的特征不变性。空间转换器模块是一种动态机制可以通过为每个输入样本生成适当的转换来主动地空间转换图像或特征图。然后在整个特征图上执行转换非局部可以包括缩放、裁剪、旋转以及非刚性变形。这使得包含空间转换器的网络不仅可以选择图像中最相关注意力的区域还可以将这些区域转换为规范的、预期的姿势以简化后续层的识别。值得注意的是空间转换器可以使用标准反向传播进行训练允许对它们注入的模型进行端到端训练。空间转换器参数预测一个小型的神经网络接受特征图U的输入然后输出要对该特征进行空间变换的参数η \etaη。不同的任务有不同的参数由任务决定但是值由模型训练。网格生成器创建一个规则网络G G i G{G_i}GGi​每一个G i ( x i t , y i t ) G_i(x_i^t,y_i^t)Gi​(xit​,yit​)代表输出图V上的一个目标坐标变换操作T将V中的每一个点映射到特征图U上得到一组源坐标( x i s , y i s ) (x_i^s,y_i^s)(xis​,yis​)然后执行对应的变换T例如对于2D仿射变换计算方式( x i s , y i s ) η ∗ ( x i t , y i t ) (x_i^s,y_i^s)^\eta*(x_i^t,y_i^t)(xis​,yis​)η∗(xit​,yit​)。当前的输出的特征图V就是骨架。可微分采样输出特征图V上的每一个位置( x i t , y i t ) (x_i^t,y_i^t)(xit​,yit​)根据源坐标( x i s , y i s ) (x_i^s,y_i^s)(xis​,yis​)在U上去颜色值采样双线性插值对周围四个像素点取平均。2 应用修改模型任务目标为残差原始图片img1和目标图片img2之间只有文本不一致背景部分是一致的那么预测残差部分可以降低预测全图的复杂度。总损失注意力图img_attntext_attn编辑效果resultimg1img2一张img1被划分为256个patch那么就会有256个位置指令(pos_inst)修改为残差之后背景相同的区域不应该再使用位置指令随机自回归了这样会浪费计算而且随机顺序没有控制会导致模型大多数学习到的顺序都不相同(256!)可能影响模型收敛。那么就需要一个变换器来指导模型对哪些区域进行随机自回归预测是有效的。总结后续将会把空间转换器应用到实验中监督模型的生成输入[rec2,img1]到一个轻量级的GPT模型f输出区域权重然后再对选定的区域应用随机自回归这样模型的泛化能力和收敛速度都会在理论上有所提升。