模板社区
视觉-语言番茄病害检测的整体框架
立即使用
26
0
0
举报
发布时间:2026年09月01日
视觉-语言番茄病害检测的整体框架
这是面向番茄病害检测的视觉‑语言融合整体技术框架图,整套流程分为数据集增强模块与视觉语言融合检测器两大核心部分。原始番茄数据集包含 10 类病害,共计 10770 张图片,存在天然类别不平衡问题。数据增强模块利用大模型引导思维链提示词生成,结合空间掩码约束潜扩散模型,借助 LoRA 适配与注意力定位完成目标定位与类别均衡,最终生成类别均衡增强数据集,目标构建 20000 张图像,每类各 2000 个样本,缓解样本不均衡难题。视觉‑语言融合检测器中,图像输入经由 Swin Transformer 图像编码器提取视觉特征,病害类别描述与细粒度提示词送入 CLIP 文本编码器提取文本特征;通过双向跨模态增强实现视觉与文本 token 交互,再执行语言引导查询筛选完成语义过滤,最后经过跨模态解码器与预测头,输出病害类别与检测包围框,完成番茄病害定位与分类识别。该方案融合大模型、扩散模型与多模态检测技术,解决农业病害样本不均衡与识别精度不足的痛点,无论农业 AI 科研人员、计算机视觉方向研究生还是智慧农业项目开发人员,都可以参考该框架开展病害检测相关研究与工程实现。
发布时间:2026年09月01日
发表评论
打开APP查看高清大图
视觉-语言番茄病害检测的整体框架
下载eddx文件
下载客户端
立即使用
社区模板帮助中心,
他的近期作品
查看更多>>