论文链接:https://www.nature.com/articles/s40494-026-02493-9

拜读了这篇论文,感悟良多!我们也做过类似的工作,但是没有形成文字记录,没有进行方法的创新和深挖,没有形成成果,追悔莫及。

一、研究背景与挑战

  • 甲骨文的重要性:是中国已知最早的文字系统,对研究古代历史、文化、社会活动具有极高价值。

  • 识别难点

    • 拓片存在严重退化:笔画模糊、背景裂纹、地质噪声。

    • 字形多变、结构复杂,与现代汉字差异大。

    • 传统OCR和端到端深度学习模型难以区分“语义笔画”与“背景噪声”。


二、核心创新:Prism-OBI 框架

Prism-OBI 是一个两阶段、解耦式框架,将“空间定位”与“语义分类”显式分离。

阶段一:检测器 OBI-YOLOv8(负责定位)

在YOLOv8基础上,集成了四个定制模块:

模块 功能
OracleC2f 信号解耦:将高频(笔画边缘)与低频(整体结构)分离,结合通道-空间双注意力机制,增强笔画特征、抑制背景噪声。
OracleSPPF 多尺度特征提取 + SE通道注意力,适应字符尺寸剧烈变化(20×20 到 100+×100+)。
OracleFusion 自适应加权融合多尺度特征,提升信噪比,防止低质量分支干扰。
OracleDetect 引入坐标注意力(Coordinate Attention),显式编码方向与空间位置信息,解决密集布局下的边界混淆问题。

2.1 OracleC2f 模块 —— 信号解耦与语义增强

解决的问题:原始 YOLOv8 的 C2f 模块对甲骨文拓片进行无差别特征处理,无法区分语义笔画(如文字)和背景噪声(如龟甲裂纹),导致特征提取被干扰。

核心创新:信号解耦 + 双注意力机制
  1. 频率分解

    • 通过 5×5 平均池化提取低频分量(保留字符整体轮廓)。

    • 通过残差连接得到高频分量(包含笔画边缘、纹理细节)。

    • 这样将字符结构与细节分离,分别输入后续注意力模块。

  2. 级联双注意力(应该源自CBAM)

    • 通道注意力:使用全局平均池化和全局最大池化并行生成通道描述符。再通过共享 MLP 生成通道权重,增强关键特征通道(如笔画通道),抑制无关通道。

    • 空间注意力:沿通道维度进行平均/最大池化,得到空间特征图,再通过 7×7 卷积生成空间权重图,聚焦字符区域,抑制裂纹等背景噪声。

  3. 特征重组
    将增强后的高频细节和低频结构相加,得到同时包含精细笔画和完整结构的输出特征。

效果:

  • 精度提升 1.62%,mAP50-95 提升 2.23%,召回率提升 2.66%

  • 有效提取模糊或复杂笔画的字符特征。


2.2 OracleSPPF 模块 —— 动态尺度自适应

解决的问题:原始 SPPF 对所有特征通道和尺度一视同仁,无法根据通道重要性加权,且对极端尺度变化(20×20 到 100+×100+ 像素,OBI长尾现象和image尺寸差异非常大)适应能力弱。

核心创新:多尺度金字塔 + SE 通道注意力
  1. 标准 SPPF 多尺度提取

    • 输入通道的1/2 经 1×1 卷积降维(减少计算量)。

    • 串联三次 5×5 最大池化,得到四个不同等效感受野的特征图:Y1​(原始细节)、Y2(等价~5×5)、Y3(等价~9×9)、Y4(等价~13×13)。

    • 拼接后通过 1×1 卷积恢复通道数,得到融合多尺度特征 ​。

  2. SE 通道注意力

    • X_{SPPF}进行全局平均池化,得到每个通道的全局响应描述符 z

    • 通过两层全连接网络(先降维后升维)学习通道间的非线性依赖,生成权重 s

    • 将权重 s乘回 X_{SPPF}​,实现通道重标定:增强关键尺度/结构的通道,抑制冗余信息。

效果:

  • 召回率提升 2.84%,mAP50-95 提升 2.31%

  • 对不同大小、密集分布、边界模糊的字符检测更鲁棒。


2.3 OracleFusion 模块 —— 自适应加权特征融合

解决的问题:原始 YOLOv8 使用静态拼接进行多尺度特征融合,无法反映不同分支的质量差异,易受低质量或噪声分支干扰,稀释有效信息。

核心创新:可学习的加权融合
  1. 可学习权重
    为每个输入特征分支 F_{i} 分配一个可训练的标量权重 \omega _{i},通过梯度下降更新。

  2. 权重归一化

    • 使用 ReLU 保证权重非负。

    • 通过 使所有权重之和为 1,引入竞争机制。where ε is a small constant to prevent division by zero。

  3. 加权求和
    ,网络自适应学习各分支的重要性。

效果

  • 精度提升 1.09%,mAP50 提升 1.75%,mAP50-95 提升 1.67%

  • 对小目标分支自动提高权重,对噪声分支抑制权重,提高融合特征的信号噪声比。


2.4 OracleDetect 模块 —— 显式空间编码

解决的问题:原始 YOLOv8 检测头使用位置无关卷积,忽略空间位置信息,导致:

  • 无法区分拓片中央主文字与边缘辅助文字;

  • 密集排列时字符边界混淆;

  • 对极端长宽比字符的定位不准确。

核心创新:坐标注意力(Coordinate Attention)
  1. 方向感知编码

    • 将输入特征 X 沿水平方向进行 1D 全局池化,得到 

    • 沿垂直方向进行 1D 全局池化,得到 

    • 这保留了精确的位置信息,不同于全局池化完全丢失空间结构。

  2. 交互与分离

    • 拼接z_{h}与转置后的z_{w}​,经 1×1 卷积降维(通道缩减 r 倍)。

    • 再分离回f_{h} 和 f_{w},分别通过 1×1 卷积恢复通道数,经 Sigmoid 生成水平注意力 A_{h}​ 和垂直注意力A_{w}​。

  3. 双方向调制

    两个方向注意力同时作用,增强对水平/垂直笔画边界的敏感度。

  4. 预测
    增强后的特征 Y 输入分类和回归分支(3×3 + 3×3 + 1×1 卷积),输出边界框和类别。

效果

  • mAP50 提升 2.13%

  • 显著改善密集布局下的边界区分能力,对复杂背景中的真实目标定位更准。


整体协同效应

当四个模块集成使用时(OBI-YOLOv8),性能提升超过各自单独贡献之和:

  • 精度提升 4.19%,召回率提升 3.76%,mAP50 提升 4.26%,mAP50-95 提升 3.68%

协同原理

  1. OracleC2f 从源头分离笔画与噪声,为后续模块提供干净特征。

  2. OracleSPPF 建立多尺度金字塔,并通过通道重标定增强关键尺度。

  3. OracleFusion 动态加权融合不同分支,保证高信噪比。

  4. OracleDetect 在检测头注入空间坐标信息,实现精准边界回归。

这四者形成了从特征提取 → 多尺度融合 → 自适应加权 → 空间感知定位的完整退化感知流水线,有效解决了甲骨文识别的核心瓶颈。


2.5 检测总结表

模块 原始问题 核心机制 主要效果
OracleC2f 无法区分笔画与噪声 频率分解 + 通道/空间双注意力 增强笔画特征,抑制裂纹
OracleSPPF 多尺度处理僵化 SPPF + SE 通道注意力 动态适应尺度变化
OracleFusion 静态拼接,易受噪声分支干扰 可学习加权融合 自适应平衡多分支贡献
OracleDetect 忽略空间位置信息 坐标注意力(水平+垂直编码) 精确边界定位,解决密集混淆

阶段二:分类器 OBI-ResNet(负责识别)

  • 使用 ResNet-50 对裁剪出的单字图像进行分类(306类)。

  • 输入尺寸:224×224,经ImageNet统计归一化。

  • 输出:字符类别 + 置信度。


三、数据集与预处理

  • OBI检测数据集OBCD:带标注的拓片图像,用于训练检测器。

  • OBC306数据集:309,551张单字图像,306个类别,用于训练分类器。

  • 预处理流程

    1. CLAHE(对比度受限自适应直方图均衡):增强局部对比度。

    2. 中值滤波(3×3):去除椒盐噪声和随机点噪声,保留笔画边缘。


四、实验结果

1. 消融实验(检测任务)

方法 Precision (%) Recall (%) mAP50 (%) mAP50-95 (%)
基线YOLOv8 84.77 81.48 86.95 53.29
OBI-YOLOv8(完整) 88.96 85.24 91.21 56.97
  • 所有模块组合后性能提升显著,超过各自单独贡献之和,说明协同效果好。

2. 分类器对比(OBC306数据集)

模型 Top-1 (%) Top-3 (%) Top-5 (%)
LeNet-5 61.75 72.23 78.21
AlexNet 81.69 91.36 93.86
VGGNet-16 82.83 91.25 93.52
ResNet-50 85.44 93.23 96.66
  • ResNet-50 因其残差结构和跨层特征复用能力,最适合细粒度甲骨文分类。

3. 两阶段完整系统对比

配置 平均准确率 (%) 推理时间 (ms/图)
+ LeNet-5 52.81 20.45
+ AlexNet 76.49 26.12
+ VGGNet-16 78.23 52.78
+ ResNet-50 83.64 30.81
  • 达到约32 FPS,满足实时处理需求。

  • 准确率略低于纯分类器(85.44%),是因为检测阶段引入的微小定位误差。


五、跨域泛化实验(零样本)

  • 直接应用于青铜器铭文、石鼓文、古代印章、秦石权文字等未见过的历史文档。

  • 结果:

    • 能有效定位大部分字符候选区域。

    • 但对结构松散的字(如左右结构)可能分裂为多个框。

  • 表明该框架可作为通用笔画提取器,对拓扑结构差异大的文字需微调。


六、主要贡献

  1. 提出解耦范式:将视觉感知(去噪+定位)与语义分类显式分离,解决端到端模型的定位-分类权衡问题。

  2. 设计专用视觉感知模块:针对古代拓片的退化特征,提出OracleC2f、OracleSPPF、OracleFusion、OracleDetect。

  3. 模块化与可迁移性:检测器可作为通用笔画提取器,分类器可替换为更先进的网络,适用于多种历史文档。

  4. 实验充分:包括消融、对比、跨域、效率分析,结果稳健。


七、局限性 & 未来方向

  • 局限性

    • 对松散结构或极简拓扑的字仍可能错分或分割错误。

    • 极端退化场景下仍存在噪声残留。

    • 依赖有限标注数据,跨域泛化需微调。

  • 未来方向

    • 引入图神经网络(GNN) 捕捉字符的结构不变性。

    • 使用自监督学习(如掩码图像建模) 从海量未标注历史档案中学习鲁棒表示。


八、个人评价

这是一篇工程与考古深度融合的高质量论文,具有以下亮点:

  • 问题定义清晰:直指甲骨文识别的核心瓶颈(噪声 vs 笔画)。

  • 方法设计系统:不是堆砌模块,而是围绕“解耦”思想构建完整感知系统。

  • 实验设计严谨:消融、对比、跨域、效率分析齐全,结果可复现。

  • 可迁移性强:框架不仅适用于甲骨文,也为其他古代文字识别提供了通用技术路径。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐