Advertisement

多模态情感分析——交叉多头注意力CMA融合图文(含MVSA数据集)

阅读量:

1.模型结构

本模型的构建基础为BERT系列与ResNet系列,分别用于处理文本和图像输入信息。针对文本数据,采用预训练的BERT系列模型完成特征提取工作,并借助全连接层实现更深层次的特征转换。对于图像数据,则通过预训练的ResNet系列模型进行特征提取,并进一步完成特征转换操作。在多模态融合阶段,引入交叉多头注意力机制(CMA) 对文本与图像特征进行整合处理,随后通过全连接层完成最终的分类任务。

图片

2.对比模型

(1)将图像与文本特征直接组合:TICat

复制代码
 text_feature = self.text_model(texts, texts_mask)

    
 img_feature = self.img_model(imgs)
    
 prob_vec = self.classifier(torch.cat([text_feature, img_feature], dim=1))
    
 pred_labels = torch.argmax(prob_vec, dim=1)
    
    
    
    
``

全部评论 (0)

还没有任何评论哟~