1. OverLoCK:一种仿生视觉机制的卷积神经网络架构解析
在计算机视觉领域,卷积神经网络(CNN)长期以来都是图像处理任务的主流架构。然而,传统CNN采用的层级式金字塔结构存在一个根本性局限——它们缺乏人类视觉系统中至关重要的"自上而下"注意力机制。这种机制使得人类能够快速形成场景的整体感知,再根据全局理解来指导局部细节的观察。香港大学研究团队提出的OverLoCK网络,正是针对这一关键差异进行的创新性探索。
OverLoCK的核心突破在于首次将"先概览后细察"的仿生原理系统性地融入纯卷积架构。与主流方法相比,该设计在ImageNet-1K分类任务中仅用1/3的计算量(FLOPs)和参数量,就超越了ConvNeXt-Base模型的性能。更值得注意的是,这种优势在下游任务(如目标检测和语义分割)中同样显著,显示出强大的特征表示能力和迁移性。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 架构设计的核心思想与创新点
2.1 深度阶段分解策略(DDS)
传统CNN的层级结构存在一个根本矛盾:低层网络需要保持高分辨率以捕捉细节,而高层网络需要大感受野来理解语义。OverLoCK通过深度阶段分解策略(Deep-stage Decomposition Strategy, DDS)创新性地解决了这一矛盾:
- Base-Net:负责编码中低层特征,保持H/16×W/16的分辨率。相当于构建了一个"公共特征基底",为后续处理提供基础素材。
- Overview-Net:轻量级子网络(仅2个Basic Block),将特征快速下采样到H/32×W/32,生成全局但粗糙的语义先验。这个过程模拟人类视觉的"概览"阶段。
- Focus-Net:在Overview-Net输出的语义先验指导下,对Base-Net的特征进行精细化处理。通过动态卷积核实现"注意力引导"的特征增强,对应人类"细察"过程。
关键设计细节:Overview-Net和Focus-Net共享Base-Net提供的中层特征,这种设计既保证了语义一致性,又避免了重复计算。在预训练阶段,两个子网络分别连接分类器进行协同训练,而下游任务中仅使用Base-Net+Focus-Net的组合。
2.2 上下文混合动态卷积(ContMix)
ContMix是OverLoCK实现"语义引导卷积"的核
