这是面向番茄病害检测的视觉‑语言融合整体技术框架图,整套流程分为数据集增强模块与视觉语言融合检测器两大核心部分。原始番茄数据集包含 10 类病害,共计 10770 张图片,存在天然类别不平衡问题。数据增强模块利用大模型引导思维链提示词生成,结合空间掩码约束潜扩散模型,借助 LoRA 适配与注意力定位完成目标定位与类别均衡,最终生成类别均衡增强数据集,目标构建 20000 张图像,每类各 2000 个样本,缓解样本不均衡难题。视觉‑语言融合检测器中,图像输入经由 Swin Transformer 图像编码器提取视觉特征,病害类别描述与细粒度提示词送入 CLIP 文本编码器提取文本特征;通过双向跨模态增强实现视觉与文本 token 交互,再执行语言引导查询筛选完成语义过滤,最后经过跨模态解码器与预测头,输出病害类别与检测包围框,完成番茄病害定位与分类识别。该方案融合大模型、扩散模型与多模态检测技术,解决农业病害样本不均衡与识别精度不足的痛点,无论农业 AI 科研人员、计算机视觉方向研究生还是智慧农业项目开发人员,都可以参考该框架开展病害检测相关研究与工程实现。
提示: 本内容由社区用户上传并分享。平台不对内容的真实性、合法性、知识产权归属及是否侵害第三方权利进行事前审核或保证。本内容可能包含受版权保护的图片、字体或其他第三方素材,使用前请自行确认授权范围。