该图为面向番茄病害检测的视觉‑语言整体框架,整体分为语义引导可控增强、视觉语言融合检测器两大模块。第一模块实现细粒度语义提示生成与掩码约束可控生成,基于 10 类番茄病害,借助 LLM 结合 CoT 思维链,从病害诱因、形态、色彩纹理、位置、严重程度维度生成细粒度提示词库;结合原始图像、病灶掩码,通过 LoRA 适配的潜扩散模型生成合成病害图像,经过质量校验,健康类别做传统图像增强,构建类别均衡训练集,融合真实与合成样本,每类 2000 份,合计 20000 张图像。第二模块为双流检测器,视觉流使用 Swin Transformer 提取图像多尺度特征;语言流将病害名称与细粒度提示送入 CLIP 文本编码器得到文本嵌入。两类特征输入双向跨模态增强单元,完成视觉文本双向交互,经语言引导查询选择、跨模态解码器处理,输出预测结果。模型采用联合训练目标,融合分类、框回归损失与区域‑文本对比对齐损失,输出病害类别与检测框。无论开展农业多模态算法研究、植物病害检测项目开发,还是 AI 图像数据增强方向学习,都可以参考这套框架开展方案设计。
提示: 本内容由社区用户上传并分享。平台不对内容的真实性、合法性、知识产权归属及是否侵害第三方权利进行事前审核或保证。本内容可能包含受版权保护的图片、字体或其他第三方素材,使用前请自行确认授权范围。