该架构是面向番茄病害检测的视觉语言融合检测方案,原始番茄数据集包含 10 个类别、10770 张图像,整体分为语义引导数据增强、视觉语言融合检测两大核心模块。语义引导数据增强模块首先利用大模型 LLM 结合 CoT 思维链,基于病害类别、形态、颜色、位置、严重程度生成细粒度提示词,再通过 LoRA 微调的潜扩散模型开展空间可控生成,结合病灶掩码合成病害图像;之后执行类别均衡处理,9 类病害采用可控合成方式,健康类别使用传统增强手段,每类扩充至 2000 份样本,构建总计 20000 张图像的均衡训练集。视觉语言融合检测模块中,图像输入 Swin Transformer 视觉编码器提取多尺度视觉特征,病害文本经由 CLIP 文本编码器得到文本特征,送入双向跨模态增强模块,完成语言引导查询选择、跨模态解码,最后通过检测头输出结果,训练目标融合检测损失与区域‑文本对齐对比损失,最终输出番茄病害类别与检测框。无论开展农业病害识别课题研究、多模态检测算法开发,还是 AI 数据集增强技术学习,都可以参考这套技术流程开展实验设计。
提示: 本内容由社区用户上传并分享。平台不对内容的真实性、合法性、知识产权归属及是否侵害第三方权利进行事前审核或保证。本内容可能包含受版权保护的图片、字体或其他第三方素材,使用前请自行确认授权范围。