模板社区
番茄病害检测的视觉‑语言融合网络架构
立即使用
4
0
0
举报
发布时间:2026年09月16日
番茄病害检测的视觉‑语言融合网络架构
这张图展示面向番茄病害检测的视觉‑语言融合网络架构,整体分为图像编码器、文本编码器、跨模态交互、跨模态解码器四大模块。图像编码器采用 Swin Transformer 作为骨干网络,经过四个不同阶段提取多尺度的视觉特征,输出图像特征 Fv,获取不同分辨率下叶片病害的空间信息。文本编码器以各类番茄病害类别提示词作为输入,依托 CLIP 文本编码器,经过词嵌入与 Transformer 编码得到文本语义特征 Ft,把病害类别语义转化成向量表达。跨模态交互模块依靠双向交叉注意力,包含 V2T 注意力与 T2V 注意力,完成图文双向信息融合得到融合特征;再执行语言引导的查询选择,先做感知语义的查询初始化,再通过 Top‑K 筛选,输出筛选后的查询向量 Q。跨模态解码器接收筛选查询、图像与文本特征,送入跨模态 Transformer 解码器,内部依次经过自注意力、视觉交叉注意力、文本交叉注意力以及前馈网络 FFN,之后分出两个分支:分类头完成病害类别判定,边界框回归头输出病害目标框坐标,最终输出番茄叶片病害的检测结果,实现借助文本类别语义辅助图像完成植物病害识别定位。无论从事多模态目标检测方向的科研人员,还是研究农作物 AI 识别的学生,都可以借助该结构图理清这套图文融合检测网络的运行逻辑。
发布时间:2026年09月16日
发表评论
打开APP查看高清大图
番茄病害检测的视觉‑语言融合网络架构
下载eddx文件
下载客户端
立即使用
社区模板帮助中心,
他的近期作品
查看更多>>