DSE精选文章
Fine-Grained Disentanglement for Alleviating Inconsistencies in Cross-Modal Hashing Retrieval
文章介绍
然而,多模态数据中普遍存在两类内在不一致性,严重制约了现有方法的检索性能:
模态间不一致性(M-M Inconsistency):图像与文本各自包含独有语义,需要精准分离公共语义与私有语义,才能在共享空间中实现有效对齐。
模态-标签不一致性(M-L Inconsistency):标注标签往往只反映某一模态的语义,导致跨模态对齐的监督信号不可靠。
现有方法主要依赖粗粒度解耦策略来应对上述挑战——即利用全连接层将全局特征粗略划分为公共部分与私有部分。然而,这类方法存在两个根本性缺陷:
语义分离不准确:互斥约束只能保证分区不重叠,却无法保证语义的正确归类,导致大量公共语义被错误划入私有部分。
公共语义信息丢失:直接基于粗粒度公共信息进行对齐,容易丢失细粒度语义分量,严重影响检索精度。
为此,本文提出 Inconsistency Alleviated Fine-Grained(IAFG)跨模态哈希检索框架。验证实验表明,引入细粒度特征可使检索精度提升最高 6%,充分证明了细粒度语义分量对于缓解模态不一致性的关键作用。

图1. 粗粒度与细粒度解耦方法对比图
方法框架
1. 问题表述
给定一个多模态数据集 ,每个实例 包含图像样本、文本样本以及多标签标注向量(为类别总数)。
跨模态哈希检索的目标是:给定查询q(图像或文本),在数据库中高效找到语义相关实例。本文将任务形式化为:
训练阶段:为每个实例学习保留语义相似性的统一哈希编码。
测试阶段:利用训练所得的模态解耦哈希网络,为查询生成公共哈希编码,并通过计算汉明距离(Hamming Distance)完成检索。
粗粒度与细粒度的解耦方法对比如图1所示。核心挑战在于:1. 如何在不依赖大规模预训练的前提下,实现语义分量级别的细粒度解耦与对齐;2. 同时避免跨模态对齐过程中的语义信息损失?
2. 整体流程
IAFG 框架由三大核心组件构成,整体流程如下:
(1)特征表示学习(Feature Representation Learning)
利用图像骨干网络(CNN-F/CLIP-ResNet/CLIP-ViT)与文本骨干网络(BoW+FC/BERT)分别提取图像特征 与文本特征,并通过标签哈希编码器将多标签向量直接映射到汉明空间,得到标签哈希编码 。

图2. IAFG框架示意图
(2)语义分量解耦模块(Semantic Component Disentanglement, SCD)
SCD 模块针对挑战一,实现无需预训练的细粒度公共/私有语义分离,包含两个子机制:
竞争式语义分量生成(CSCG):引入一组可学习的语义锚向量A= {a₁,...,aₖ}(通过奇异值分解 SVD 正交初始化,以保证初始多样性,并跨模态共享),利用基于查询竞争交叉注意力的机制(softmax 作用于查询维度),将全局模态特征 f(*)ᵢ 解耦为 K 个离散且互斥的语义分量 。竞争分配确保各分量语义不重叠且可互补重建完整语义。
跨模态语义分量路由(Cross-Modal Routing):利用余弦相似度对所有图文分量对打分,高于阈值θ的分量对被识别为模态公共分量,其余划为模态私有分量。同时引入熵正则化损失稳定相似度分布,降低对阈值的敏感性。
(3)细粒度语义对齐模块(Fine-grained Semantic Alignment, FSA)
FSA 模块针对挑战二,实现分量级跨模态公共语义精准对齐:
分量级交叉注意力融合:以双向交叉注意力机制融合图像公共分量与文本公共分量,在增强公共语义表示的同时保留细粒度细节,最终生成各模态的公共哈希编码 。
标签公共语义对齐:通过余弦相似度损失将标签哈希编码lᵢ与模态公共哈希编码对齐,缓解模态-标签不一致性,为跨模态对齐提供可靠统一的监督信号。
跨模态三元组对齐:利用细粒度公共分量,在公共汉明语义空间中对模态哈希编码与标签哈希编码进行三元组对齐,采用半难负例挖掘(semi-hard negative mining)提升判别性对齐效果。
最终,通过交替学习算法分别优化模态网络参数与标签网络参数,确保两者优化互不干扰,实现更稳定高效的端到端训练。
实验结果
本文在MIRFlickr-25K,NUS-WIDE10.5K和MS COCO三个标准数据集上进行了系统性实验,与10种前沿跨模态哈希方法进行比较,评估指标采用 MAP(mean Average Precision)、精确率-召回率曲线及Top-K精确率曲线。
1. 主要检索性能对比(CNN-F特征,部分代表结果)
表1: MAP对比结果(64位哈希码)

本文方法在所有检索任务上均取得最佳结果:在 MIRFlickr-25K 上,IQT 和 TQI 任务的平均 MAP 提升分别达 2.56% 和 5.42%;在 NUS-WIDE10.5K 上,平均 MAP 提升更显著,分别达 2.72% 和 7.50%。在精确率-召回率曲线及 Top-K 精确率曲线上,IAFG也实现了最好的表现。

图3. MIRFlickr25K上的精确率-召回率曲线

图4. MIRFlickr25K上的精确率-TopK曲线
2. 消融实验
表2: 消融实验结果(64位,MIRFlickr-25K NUS-WIDE10.5K)

消融实验证明了各组件的必要性:移除 SCD 退化为粗粒度解耦,MAP 下降明显;移除三元组对齐损失导致性能大幅崩溃(下降 >30%),说明公共汉明空间的精准对齐是检索性能的核心支撑;标签对齐损失对缓解模态-标签不一致性不可或缺;熵正则化对稳定分量路由有积极贡献。
结语
IAFG 的两大核心创新:SCD 模块实现了无需预训练的语义分量级解耦,FSA 模块实现了基于细粒度公共分量的精准跨模态对齐。两个模块共同构建了一套端到端的细粒度解耦对齐系统,在多个标准数据集上以较小的计算开销并实现了显著的检索精度提升。
作者简介
期刊简介














