暂无图片
暂无图片
暂无图片
暂无图片
暂无图片

细粒度解耦:缓解跨模态哈希检索中的不一致性

时空实验室 2026-05-25
44

DSE精选文章

Fine-Grained Disentanglement for Alleviating Inconsistencies in Cross-Modal Hashing Retrieval


Data Science and Engineering (DSE)是由中国计算机学会(CCF)主办,数据库专业委员会承办,施普林格·自然(Springer Nature)集团出版的开放获取(OA)期刊。本篇文章精选自DSE近期发文。


文章介绍


多模态数据检索(Cross-Modal Retrieval, CMR)是当前人工智能领域的研究热点,旨在实现图像与文本等不同模态数据之间的语义搜索。深度哈希模型凭借紧凑高效的二进制编码,在视觉与文本跨模态检索任务中展现出优越性能。

然而,多模态数据中普遍存在两类内在不一致性,严重制约了现有方法的检索性能:

  • 模态间不一致性(M-M Inconsistency):图像与文本各自包含独有语义,需要精准分离公共语义与私有语义,才能在共享空间中实现有效对齐。

  • 模态-标签不一致性(M-L Inconsistency):标注标签往往只反映某一模态的语义,导致跨模态对齐的监督信号不可靠。

现有方法主要依赖粗粒度解耦策略来应对上述挑战——即利用全连接层将全局特征粗略划分为公共部分与私有部分。然而,这类方法存在两个根本性缺陷:

  • 语义分离不准确:互斥约束只能保证分区不重叠,却无法保证语义的正确归类,导致大量公共语义被错误划入私有部分。

  • 公共语义信息丢失:直接基于粗粒度公共信息进行对齐,容易丢失细粒度语义分量,严重影响检索精度。

为此,本文提出 Inconsistency Alleviated Fine-Grained(IAFG)跨模态哈希检索框架。验证实验表明,引入细粒度特征可使检索精度提升最高 6%,充分证明了细粒度语义分量对于缓解模态不一致性的关键作用。

图1. 粗粒度与细粒度解耦方法对比图



方法框架


1. 问题表述

给定一个多模态数据集 每个实例 包含图像样本文本样本以及多标签标注向量(为类别总数)

跨模态哈希检索的目标是:给定查询q(图像或文本),在数据库中高效找到语义相关实例。本文将任务形式化为:

  • 训练阶段:为每个实例学习保留语义相似性的统一哈希编码。

  • 测试阶段:利用训练所得的模态解耦哈希网络,为查询生成公共哈希编码,并通过计算汉明距离(Hamming Distance)完成检索。

粗粒度与细粒度的解耦方法对比如图1所示。核心挑战在于:1. 如何在不依赖大规模预训练的前提下,实现语义分量级别的细粒度解耦与对齐;2. 同时避免跨模态对齐过程中的语义信息损失?

2. 整体流程

IAFG 框架由三大核心组件构成,整体流程如下:

(1)特征表示学习(Feature Representation Learning)

利用图像骨干网络(CNN-F/CLIP-ResNet/CLIP-ViT)与文本骨干网络(BoW+FC/BERT)分别提取图像特征 与文本特征,并通过标签哈希编码器将多标签向量直接映射到汉明空间,得到标签哈希编码 

图2. IAFG框架示意图

(2)语义分量解耦模块(Semantic Component Disentanglement, SCD)

SCD 模块针对挑战一,实现无需预训练的细粒度公共/私有语义分离,包含两个子机制:

竞争式语义分量生成(CSCG):引入一组可学习的语义锚向量A= {a₁,...,aₖ}(通过奇异值分解 SVD 正交初始化,以保证初始多样性,并跨模态共享),利用基于查询竞争交叉注意力的机制(softmax 作用于查询维度),将全局模态特征 f(*)ᵢ 解耦为 K 个离散且互斥的语义分量 。竞争分配确保各分量语义不重叠且可互补重建完整语义。

跨模态语义分量路由(Cross-Modal Routing):利用余弦相似度对所有图文分量对打分,高于阈值θ的分量对被识别为模态公共分量,其余划为模态私有分量。同时引入熵正则化损失稳定相似度分布,降低对阈值的敏感性。

(3)细粒度语义对齐模块(Fine-grained Semantic Alignment, FSA)

FSA 模块针对挑战二,实现分量级跨模态公共语义精准对齐:

  • 分量级交叉注意力融合:以双向交叉注意力机制融合图像公共分量与文本公共分量,在增强公共语义表示的同时保留细粒度细节,最终生成各模态的公共哈希编码 

  • 标签公共语义对齐:通过余弦相似度损失将标签哈希编码lᵢ与模态公共哈希编码对齐,缓解模态-标签不一致性,为跨模态对齐提供可靠统一的监督信号。

  • 跨模态三元组对齐:利用细粒度公共分量,在公共汉明语义空间中对模态哈希编码与标签哈希编码进行三元组对齐,采用半难负例挖掘(semi-hard negative mining)提升判别性对齐效果。

最终,通过交替学习算法分别优化模态网络参数与标签网络参数,确保两者优化互不干扰,实现更稳定高效的端到端训练。



实验结果


本文在MIRFlickr-25K,NUS-WIDE10.5K和MS COCO三个标准数据集上进行了系统性实验,与10种前沿跨模态哈希方法进行比较,评估指标采用 MAP(mean Average Precision)、精确率-召回率曲线及Top-K精确率曲线。

1. 主要检索性能对比(CNN-F特征,部分代表结果)

表1: MAP对比结果(64位哈希码)

本文方法在所有检索任务上均取得最佳结果:在 MIRFlickr-25K 上,IQT 和 TQI 任务的平均 MAP 提升分别达 2.56% 和 5.42%;在 NUS-WIDE10.5K 上,平均 MAP 提升更显著,分别达 2.72% 和 7.50%。在精确率-召回率曲线及 Top-K 精确率曲线上,IAFG也实现了最好的表现。

图3. MIRFlickr25K上的精确率-召回率曲线

图4. MIRFlickr25K上的精确率-TopK曲线

2. 消融实验

表2: 消融实验结果(64位,MIRFlickr-25K NUS-WIDE10.5K)

消融实验证明了各组件的必要性:移除 SCD 退化为粗粒度解耦,MAP 下降明显;移除三元组对齐损失导致性能大幅崩溃(下降 >30%),说明公共汉明空间的精准对齐是检索性能的核心支撑;标签对齐损失对缓解模态-标签不一致性不可或缺;熵正则化对稳定分量路由有积极贡献。



结语


本文围绕跨模态哈希检索中粗粒度解耦无法有效缓解模态不一致性这一核心问题,提出了 IAFG 框架。通过实证验证,本文首次系统论证了细粒度语义分量对于缓解模态不一致性的关键作用,为该领域研究提供了新的分析视角。

IAFG 的两大核心创新:SCD 模块实现了无需预训练的语义分量级解耦,FSA 模块实现了基于细粒度公共分量的精准跨模态对齐。两个模块共同构建了一套端到端的细粒度解耦对齐系统,在多个标准数据集上以较小的计算开销并实现了显著的检索精度提升。



作者简介




李铁英,东北大学计算机科学与工程学院博士研究生,研究方向:跨模态检索、多模态学习。



杨晓春,东北大学计算机科学与工程学院教授(通讯作者),研究方向:数据管理、多模态检索。



王斌,东北大学计算机科学与工程学院教授,研究方向:数据库系统、多媒体检索。



孔令笃,东北大学计算机科学与工程学院博士研究生,研究方向:视频文本检索,视频压缩。



卞擎天,新加坡南洋理工大学计算机科学与工程学院博士研究生,研究方向:推荐系统,跨域多模态推荐。



徐家兴,新加坡南洋理工大学计算机科学与工程学院博士研究生,研究方向:图表征学习,脑部网络分析。



楚博策,河北经贸大学管理科学与信息工程学院,研究方向:空天大数据智能处理。



期刊简介




Data Science and Engineering(DSE)是由中国计算机学会(CCF)主办,数据库专业委员会承办,施普林格·自然(Springer Nature)出版的开放获取(Open Access)期刊。DSE致力于发表与数据科学与工程领域相关的关键科学问题与前沿研究热点,以大数据为研究重点,建设国际学术交流的重要平台,推动学术界和企业界的深度融合。征稿范畴主要包括:数据库系统、大数据管理与分析、大数据治理等相关基础理论、关键技术与系统实践。现任主编(Editors-in-Chief)为数据科学与工程领域的知名专家华东师范大学周教授和意大利英苏布里亚大学Elena Ferrari教授,现任执行主编(Managing Editor)为数据库专业委员会主任、华东师范大学周傲英教授和浙江大学高云君教授。


目前期刊已被EI、ESCI与SCOPUS收录,2024年影响因子(Impact Factor)为4.6,CiteScore为11.9,在计算机科学应用领域排名前8.87%(84/947)、计算机软件领域排名前9.6%(47/490)、信息系统领域排名前9.7%(46/474),人工智能领域排名前12.7%(57/450)。欢迎大家免费下载阅读期刊全文,并积极投稿。


原文链接:
https://link.springer.com/article/10.1007/s41019-025-00330-w


文稿:李博涵
校稿:李瑞远
排版:刘苧锐
审核:高云君


文章转载自时空实验室,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。

评论