深度学习实战——从标注到部署的完整闭环
核心问题:怎么让一个“不会看”的模型,学会识别工业零件表面的划痕? 质检员的 0.5 秒困境 想象你是一个质检员,面前是传送带上飞速流动的钢板。每秒几十张,你要在 0.5 秒内判断:这张有没有划痕?有没有夹杂物?有没有裂纹? 人眼做不到。但神经网络可以。 目标——用深度学习,把这双"眼睛"训练出来。从 CNN 的底层原理开始,经过 YOLO 目标检测实战、LabelMe 数据标注,到用 trace-cn 辅助写训练代码,最终走完**“标注→训练→推理”**的完整闭环。 CNN 基础:卷积神经网络到底在"看"什么? 从生物视觉到数学公式 CNN 的设计灵感来自人类视觉皮层。你看到一张照片,不是逐个像素分析的——你先看到边缘,再看到形状,最后组合出"这是一张脸"。CNN 干的是同样的事: 浅层卷积核提取边缘、纹理(“这里有条线”) 中层把边缘组合成形状(“这是个圆形”) 深层把形状组合成语义(“这是个齿轮”) 核心操作是卷积:一个小的权重矩阵(比如 3×3)在图像上滑动,每个位置做加权求和。一个 3×3 的卷积核只有 9 个参数,却能扫描整个图像——这就是参数共享的威力。全连接网络处理一张 224×224 的图片需要上亿参数,CNN 可能只需要几万。 为什么卷积核能提取特征? 假设你有一个检测水平边缘的卷积核: [[-1, -1, -1], [ 0, 0, 0], [ 1, 1, 1]] 当它滑过图像时,遇到"上暗下亮"的区域,输出值就很大;遇到均匀区域,输出接近零。所以卷积核本质上就是一个模式匹配器——每个核负责匹配一种特定的视觉模式。 池化层:压缩但不丢失 卷积之后通常接一个池化层(最常见的是 2×2 最大池化)。它做的事情很简单:把 2×2 区域里的最大值保留下来,其余扔掉。 为什么这么"浪费"?因为池化做了两件事: 降低计算量:特征图尺寸减半,参数量降到 25% 增加鲁棒性:目标稍微平移一点,最大池化的输出不变 这就像你看一个人,不需要记住他脸上每个像素的位置,只需要知道"眼睛在鼻子上面"这种相对关系。 训练的三驾马车:损失函数、学习率、早停 损失函数衡量模型预测和真实值的差距。不同任务用不同的损失: 分类用交叉熵(“你预测是猫,但其实是狗,惩罚!") 目标检测用 CIoU Loss(同时考虑框的重叠面积、中心距离、宽高比) 分割用 Dice Loss(对小目标特别敏感,比如医学影像里的肿瘤) 学习率控制每次更新参数的步长。太大了来回震荡,太小了原地踏步。实际训练中常用自适应学习率(如 Adam),它会根据梯度自动调整步长——梯度大就小步走,梯度小就大步跑。 ...