|
标题:基于改进注意力机制的特征融合与视频时刻检索方法 作者:毛臻湛1,2 王旭智1,2 万旺根1,2;孙学涛2;张振3;柴羽佳4 作者单位:1 上海大学通信与信息工程学院,上海 200444;2 上海大学智慧城市研究院,上海 200444;3 上海健康医学院附属嘉定区中心医院,上海 201899;4 上海交通大学医学院附属仁济医院宝山分院,上海 200444 关键字:视频时刻检索;注意力机制;多模态特征融合;语义对齐 摘要:视频时刻检索旨在根据自然语言描述,从长视频中准确定位与语义内容相关的时间片段,是视频理解领域的重要任务。然而,视频与文本特征的对齐与融合过程复杂,且面临较大挑战。为此,提出了一种基于改进注意力机制的多模态特征融合方法。为提升视频与文本特征的融合与语义对齐效果,构建卷积交叉注意力模块以捕捉视频的局部时序特征并增强文本的上下文感知能力,同时引入蒸馏对齐模块,有效缓解训练样本间语义重叠对特征对齐的干扰。实验结果表明,与现有方法相比,该方法在视频时刻检索任务上获得更为优秀的表现。 |