该图是用于番茄病害检测的视觉‑语言融合网络结构图。网络输入分为图像输入与文本输入两大分支。图像输入取自真实温室的病害叶片图片,交由 Swin Transformer 图像编码器,输出 F₁‑F₄多尺度的视觉特征。文本输入包含病害类别名称以及病害细粒度描述,经由 CLIP 文本编码器提取得到文本语义原型特征。之后进入双向跨模态增强(BCME)模块,通过图到文本更新、文本到视觉调制,双向完成图文特征交互增强。接着执行语言引导查询选择(LGQS),依托图文语义相似度做语义匹配,筛选 Top‑K 空间位置并增加位置编码,获得匹配后的查询。随后送入 L 层跨模态解码器,内部依次经过查询自注意力、视觉交叉注意力、文本交叉注意力 TCA 以及前馈网络 FFN;训练阶段引入区域‑文本对比损失 RTCL 进一步优化特征。最后检测头输出分类置信 logits 与目标边界框,整体损失由检测损失(分类、框回归、GIoU 损失)和 RTCL 损失共同构成,完成番茄叶片病害的识别与定位。该架构利用病害文本细粒度语义信息辅助视觉检测,提升农作物病害识别效果。无论开展农作物多模态检测课题的科研人员,还是学习 Transformer 多模态模型的学生,都可以借助这张结构图梳理整套网络的运行流程。
提示: 本内容由社区用户上传并分享。平台不对内容的真实性、合法性、知识产权归属及是否侵害第三方权利进行事前审核或保证。本内容可能包含受版权保护的图片、字体或其他第三方素材,使用前请自行确认授权范围。