
本文基于YOLOv13 官方仓库(iMoonLab/yolov13,ultralytics 8.3.63 fork)实测整理,Windows/CPU 全程可跑。SwiftFormer(Shao et al., ICCV 2023《SwiftFormer: Efficient Additive Attention for Lightning-fast Vision Transformers》,官方源码 github.com/Amshaker/SwiftFormer)的核心是高效加性注意力:Q/K 线性映射并 L2 归一化后,用可学习向量给 Q 打分,token 维 softmax 得到全局上下文向量 G(B×D),输出Proj(G⊙K)+Q——全程没有 N×N 注意力矩阵,复杂度 O(N)。本文把官方 SwiftFormerEncoder 整块(局部表征 + 加性注意力 + MLP,双 layer-scale 残差)插进 v13n 层 8 之后(P5 出口,256 通道 @20×20),实测+924,928 参数、GFLOPs 6.54→7.28,与官方逐位一致(max diff = 0),1 轮冒烟训练正常完成。前言移动端 ViT 的进化链:MobileViT(第 85 篇)把 Transformer 塞进 CNN、EfficientFormer 砍掉 4D 注意力里的 layouts、SwiftFormer 再进一步——注意力矩阵整个不要了:每个 token 的注意力分数