05-锚框Anchor机制:自适应锚框、聚类生成锚框实战

发布时间:2026/8/9 3:01:04
05-锚框Anchor机制:自适应锚框、聚类生成锚框实战 锚框Anchor机制:自适应锚框、聚类生成锚框实战作者:黒漂技术佬 | 系列:YOLO目标检测算法精讲前言:为什么需要Anchor?设身处地想一下:你让模型直接输出边界框的 x、y、w、h。模型面对一张图,它要猜框应该放在哪里、多宽多高——搜索空间是整张图的所有像素位置和所有可能的尺寸组合。这个空间太大了,模型前几个 epoch 基本在"瞎猜",训练极其不稳定。Anchor(锚框)的引入就是为了缩小搜索空间、降低学习难度。它的思路很简单:你不是让模型从零猜一个框,而是先给它几个"模板框"——这些模板框有预设的宽高比和尺寸,模型只需要在模板的基础上做微调。就像给你几个固定大小的相框,你只需要在其中选一个最接近的,然后稍微裁剪调整即可。一、Anchor的本质:预设框 + 偏移学习预��机制YOLO 在每个检测尺度(如 80×80、40×40、20×20)的每个网格上,预设 K 个不同尺寸的 Anchor。以 YOLOv5s 为例,默认 K=3,共三个尺度,所以总共有 9 个 Anchor:尺度1(80×80,检测小目标): Anchor 1: (10, 13) # 又矮又窄,像一个竖着的口香糖 Anchor 2: (16, 30) # 中等高宽比 Anchor 3: (33, 23) # 横着的形状 尺度2(40×40,检测中目标): Anchor 4: (30, 61) Anchor 5: (62, 45) Anchor 6: (59, 119) 尺度3(20×20,检测大目标): Anchor 7: (116, 90) Anchor 8: (156, 198) Anchor 9: (373, 326)这些数字是相对于输入图片尺寸的像素值(假设640×640)。小 Anchor 分给高分辨率特征图(小目标),大 Anchor 分给低分辨率特征图(大目标)。偏移学习模型不是直接输出框的绝对坐标,而是输出相对于 Anchor 的偏移量:b_x = σ(t_x) + c_x # 中心点x:偏移 + 所在网格左上角 b_y = σ(t_y) + c_y # 中心点y:同上 b_w = p_w × exp(t_w) # 宽度:Anchor宽度 × 缩放系数 b_h = p_h × exp(t_h) # 高度:Anchor高度 × 缩放系数其中t_x、t_y、t_w、t_h是网络的输出,p_w、p_h是 Anchor 的宽高,(c_x, c_y)是当前网格的左上角坐标,σ 是 Sigmoid 函数(把值限定在 0~1 之间)。这个设计非常聪明:t_x、t_y 经过 sigmoid 后范围是 (0, 1),意味着预测的中心点只能在当前网格内。这相当于告诉你"别跑太远,就在你脚下这片区域找"。t_w、t_h 经过 exp 后可以缩放到任意正数,意味着框的宽高可以在 Anchor 的基础上自由调整。1.0 就是 Anchor 原始大小,2.0 就是两倍大。等于说 Anchor 给了模型一个"初始猜测",模型只需学习偏离初值多少即可。这比从零学容易得多。匹配机制训练时,每个真实框(Ground Truth)需要匹配到某个 Anchor 上。匹配规则是:计算真实框与所有 Anchor 的宽高比(不是位置,只看形状)比例在阈值范围内(如 0.25~4.0 之间)的 Anchor 算匹配成功一个真实框可能匹配到多个 Anchor(在不同尺度上)匹配上的是正样本,没匹配上的是负样本。只有正样本参与坐标损失和类别损失的计算。通俗总结Anchor 机制就像给模型配了一组"初始猜测尺"——你不用从零开始拿尺子量,面前已经摆好了几个常用尺寸的模板,你只需要说"比这个宽一点""比那个高一点"就行。二、自适应锚框:K-Means聚类自动生成为什么需要自适应YOLO 的默认 Anchor 是用 MS COCO 数据集聚类出来的。COCO 有 80 个类别,包含人、车、动物等通用目标。但你的数据集可能完全不同:无人售货柜:商品形状固定(瓶装饮料 3:1 细长形,盒装口香糖 1:1 正方形)无人机农田:虫害斑是极小的不规则区域,和 COCO 里的小目标大小不在一个量级机械臂工件:螺丝、螺母是接近正方形的小目标用不适合的 Anchor,就像给木匠发了一套绣花针。自适应锚框的核心就是用你的数据聚类出