模板社区
视觉语言融合网络
立即使用
4
0
0
举报
发布时间:2026年09月16日
视觉语言融合网络
该图是用于番茄病害检测的视觉‑语言融合网络结构图。网络输入分为图像输入与文本输入两大分支。图像输入取自真实温室的病害叶片图片,交由 Swin Transformer 图像编码器,输出 F₁‑F₄多尺度的视觉特征。文本输入包含病害类别名称以及病害细粒度描述,经由 CLIP 文本编码器提取得到文本语义原型特征。之后进入双向跨模态增强(BCME)模块,通过图到文本更新、文本到视觉调制,双向完成图文特征交互增强。接着执行语言引导查询选择(LGQS),依托图文语义相似度做语义匹配,筛选 Top‑K 空间位置并增加位置编码,获得匹配后的查询。随后送入 L 层跨模态解码器,内部依次经过查询自注意力、视觉交叉注意力、文本交叉注意力 TCA 以及前馈网络 FFN;训练阶段引入区域‑文本对比损失 RTCL 进一步优化特征。最后检测头输出分类置信 logits 与目标边界框,整体损失由检测损失(分类、框回归、GIoU 损失)和 RTCL 损失共同构成,完成番茄叶片病害的识别与定位。该架构利用病害文本细粒度语义信息辅助视觉检测,提升农作物病害识别效果。无论开展农作物多模态检测课题的科研人员,还是学习 Transformer 多模态模型的学生,都可以借助这张结构图梳理整套网络的运行流程。
发布时间:2026年09月16日
发表评论
打开APP查看高清大图
视觉语言融合网络
下载eddx文件
下载客户端
立即使用
社区模板帮助中心,
他的近期作品
查看更多>>