相较于单模态输入,多模态图像融合技术能够显著提升病虫
害识别的性能。然而,现有的图像融合方法主要关注像素级信息和视觉语义特征,往往忽
略了超越视觉层面的深层次文本语义信息(外部知识)。例如,病虫害的发生往往受到环
境条件、作物生长状况等因素的影响,而这些关键信息可通过文本或其他非视觉模态数据
提供额外的判别依据。为了更有效地利用多模态高层语义信息,提出一种基于视觉-语言大
模型引导的多模态图像融合方法。该方法充分利用多模态文本语义信息引导图像融合。
提示: 本内容由社区用户上传并分享。平台不对内容的真实性、合法性、知识产权归属及是否侵害第三方权利进行事前审核或保证。本内容可能包含受版权保护的图片、字体或其他第三方素材,使用前请自行确认授权范围。