该图展示面向番茄病害检测的视觉‑语言融合网络整体架构。输入分为两路,一路为番茄病害图像,送入 Swin Transformer 图像编码器,提取多尺度图像特征 F₁‑F₄;另一路是病害类别描述文本,包含诱因、形态、颜色、位置、严重程度等信息,经由 CLIP 文本编码器得到文本特征 T。图像与文本特征进入跨模态交互模块,先后执行图像到文本、文本到图像的交叉注意力计算,完成双向特征交互,再通过语言引导查询筛选,选出 Top‑K 语义响应生成查询 Qₐ,送入跨模态解码器。解码器内部集成自注意力、视觉交叉注意力、文本交叉注意力与前馈网络 FFN,完成多模态特征深度融合。解码输出分别接入分类头与边界框头,最终输出病害预测类别以及检测框,在原图上标记病害位置与置信度。模型给出总训练损失公式,总损失由检测损失、对比损失加权组合而成,用于约束网络训练。整套框架将图像视觉信息和病害领域文本语义结合,借助跨模态注意力实现番茄病害的目标检测,充分利用病害先验文本知识提升识别效果。无论农业 AI 方向研究生、多模态算法研究者还是农作物病害检测项目开发人员,都可以参考该网络架构开展研究工作。
提示: 本内容由社区用户上传并分享。平台不对内容的真实性、合法性、知识产权归属及是否侵害第三方权利进行事前审核或保证。本内容可能包含受版权保护的图片、字体或其他第三方素材,使用前请自行确认授权范围。