CV领域的范式转移

计算机视觉经历了从手工特征到深度学习、从CNN到Vision Transformer的演进。2012年AlexNet在ImageNet上的突破性表现点燃了深度学习在CV领域应用的热潮,2021年ViT展示了纯Transformer架构就在图像任务上达到甚至超越CNN性能,打破了"CNN不可替代"的认知。

卷积神经网络的核心组件

CNN的精髓在于局部感受野(convolution只在局部区域内操作)、权值共享(同一filter在图像所有位置使用)和层次化特征组合(浅层纹理→中层部件→深层语义)。VGG证明了深度的重要性;ResNet通过残差连接解决了训练退化;MobileNet用深度可分离卷积实现了移动端高效推理;EfficientNet提出复合缩放策略统一优化深度、宽度和分辨率。

目标检测算法

两阶段方法(R-CNN系列)先生成候选框(Region Proposal)再分类回归,精度高但速度慢。单阶段方法(YOLO、SSD、RetinaNet)直接在特征图上预测检测框,速度更快。YOLO系列从v1发展到v8,不断改进Backbone设计、NMS后处理和Label Assignment策略。DETR首次将Transformer应用于检测,通过Object Query集合和Bipartite Matching(匈牙利算法)实现了端到端检测。

Vision Transformer架构

ViT将图像切分为16x16像素patch序列,通过线性投影变为token序列输入Transformer Encoder。纯CNN的局限性在于感受野受限(需要通过多层堆叠逐渐扩大),而Self-Attention的全局建模能力天然支持长距离依赖。Swin Transformer通过Shifted Window机制在局部窗口内计算Attention,兼顾了局部和全局建模能力。

多模态视觉

CLIP(Contrastive Language-Image PreTraining)通过图文对对比学习实现了强大的零样本视觉理解——将图像和文本映射到同一表示空间,使得自然语言可以直接用于视觉任务。Segment Anything Model (SAM)通过PromptableSegmentation实现了通用图像分割:接受Point/Box/Mask/Text任意形式的Prompt输出对应分割结果。

视觉生成模型

扩散模型(Diffusion Models)通过逐步去噪生成图像,代表工作包括DALL-E 2/3、Stable Diffusion和Midjourney。其前向过程添加高斯噪声、逆向过程学习去噪恢复的过程,数学上等价于Score Matching。Latent Diffusion在低维潜空间操作,大幅降低了训练和推理成本。ControlNet通过额外的控制条件(边缘图、深度图、姿态)实现可控生成。

点赞(0) 打赏

评论列表 共有 0 条评论

暂无评论
立即
投稿
网站二维码

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部