这张图展示面向番茄病害检测的视觉‑语言融合网络架构,整体分为图像编码器、文本编码器、跨模态交互、跨模态解码器四大模块。图像编码器采用 Swin Transformer 作为骨干网络,经过四个不同阶段提取多尺度的视觉特征,输出图像特征 Fv,获取不同分辨率下叶片病害的空间信息。文本编码器以各类番茄病害类别提示词作为输入,依托 CLIP 文本编码器,经过词嵌入与 Transformer 编码得到文本语义特征 Ft,把病害类别语义转化成向量表达。跨模态交互模块依靠双向交叉注意力,包含 V2T 注意力与 T2V 注意力,完成图文双向信息融合得到融合特征;再执行语言引导的查询选择,先做感知语义的查询初始化,再通过 Top‑K 筛选,输出筛选后的查询向量 Q。跨模态解码器接收筛选查询、图像与文本特征,送入跨模态 Transformer 解码器,内部依次经过自注意力、视觉交叉注意力、文本交叉注意力以及前馈网络 FFN,之后分出两个分支:分类头完成病害类别判定,边界框回归头输出病害目标框坐标,最终输出番茄叶片病害的检测结果,实现借助文本类别语义辅助图像完成植物病害识别定位。无论从事多模态目标检测方向的科研人员,还是研究农作物 AI 识别的学生,都可以借助该结构图理清这套图文融合检测网络的运行逻辑。
提示: 本内容由社区用户上传并分享。平台不对内容的真实性、合法性、知识产权归属及是否侵害第三方权利进行事前审核或保证。本内容可能包含受版权保护的图片、字体或其他第三方素材,使用前请自行确认授权范围。