模板社区
跨模态视觉文本检测模型框图
立即使用
3
0
0
举报
发布时间:2026年09月16日
跨模态视觉文本检测模型框图
这张框图展示了一个跨模态视觉文本检测模型的完整推理流程,整体一共分为 Encoding、BCME、LGQS、Decoder×Ld、Prediction 五大模块。Encoding 模块负责输入编码,图像送入 Swin Transformer 提取多层图像特征,经过拼接得到图像特征 X;文本集合 T 经由 CLIP 文本编码器得到文本原型特征 W,完成图像与文本两端的特征预处理。BCME 模块实现双向跨模态嵌入,包含视觉到文本、文本到文本两个方向的计算,输出更新后的 W′与 X′,完成图像和文本特征之间的相互映射。LGQS 模块做查询筛选,通过余弦相似度计算打分,再使用 Top‑K 操作筛选,生成初始查询特征 Q⁽⁰⁾。Decoder 模块堆叠 Ld 层,每一层依次执行自注意力、视觉交叉注意力、文本交叉注意力与前馈网络 FFN,迭代优化查询表征;训练阶段额外使用 RTCI 损失对齐查询与文本原型。最后的 Prediction 模块分为 Box head 和 Class head,分别输出预测边界框以及类别结果,最终得到检测框与对应分类。整套网络实现以文本原型辅助图像目标检测的跨模态任务。无论正在研读跨模态检测论文的科研学生还是学习深度学习模型架构的学习者,都可以借助这张框图梳理模型运行逻辑。
发布时间:2026年09月16日
发表评论
打开APP查看高清大图
跨模态视觉文本检测模型框图
下载eddx文件
下载客户端
立即使用
社区模板帮助中心,
他的近期作品
查看更多>>