自 2017 年 6月谷歌提出Transformer以来,它便逐渐成为了自然语言处理领域的主流模型。最近一段时间,Transformer更是开启了自己的跨界之旅,开始在计算机视觉领域大展身手,涌现出了多个基于Transformer的新模型,如谷歌用于图像分类的ViT以及复旦、牛津、腾讯等 ...