山东大学学报(工学版)

北大核心,CA,CSCD,WJCI,

国内刊号:37-1391/T

国际刊号:1672-3961

山东大学学报(工学版)杂志2025年第3期:融合多尺度视觉和文本语义特征的图像描述生成算法

发布日期:

作者:李丰,文益民

单位:桂林电子科技大学计算机与信息安全学院, 广西 桂林 541004

关键词:图像描述,图注意力网络,视觉特征,文本特征,注意力机制,

基金:国家自然科学基金资助项目(62366011);广西重点研发计划资助项目(桂科AB21220023);广西图像图形与智能处理重点实验室资助项目(GIIP2306);桂林电子科技大学研究生教育创新计划资助项目(2023YCXB11)

为了解决目标检测器预训练数据集与图像描述生成任务数据集存在类别差异导致物体识别错误,以及不同场景样本规模存在差异导致模型对少见场景中对象间关系理解不足的问题,提出融合多尺度视觉和文本语义特征的图像描述生成算法(multi-scale visual and textual semantic feature fusion for image captioning, MVTFF-IC)。多尺度视觉特征融合(multi-scale visual feature fusion, MVFF)模块通过图注意力网络对全局、网格和区域特征进行建模,以获取更具代表性的视觉表征;深度语义融合模块(deep semantic fusion module, DSFM)通过交叉注意力机制整合包含对象关系的文本语义特征,以生成更准确的描述。在微软常见物体场景(Microsoft common objects in context, MSCOCO)数据集上的试验结果表明,MVTFF-IC基于共识的图像描述评价指标CDIEr达到136.7,优于许多现有的流行算法,能够更准确地捕捉图像中的关键信息,生成高质量的描述。

来源:2025年第3期

《山东大学学报(工学版)》期刊编辑部

查看山东大学学报(工学版)杂志2025年第3期

联系我们

  • 地址:山东省济南市山大南路27号
  • 电话:0531-88366735
  • E-mail:xbgxb@sdu.edu.cn

咨询工作人员