这张框图展示了一个跨模态视觉文本检测模型的完整推理流程,整体一共分为 Encoding、BCME、LGQS、Decoder×Ld、Prediction 五大模块。Encoding 模块负责输入编码,图像送入 Swin Transformer 提取多层图像特征,经过拼接得到图像特征 X;文本集合 T 经由 CLIP 文本编码器得到文本原型特征 W,完成图像与文本两端的特征预处理。BCME 模块实现双向跨模态嵌入,包含视觉到文本、文本到文本两个方向的计算,输出更新后的 W′与 X′,完成图像和文本特征之间的相互映射。LGQS 模块做查询筛选,通过余弦相似度计算打分,再使用 Top‑K 操作筛选,生成初始查询特征 Q⁽⁰⁾。Decoder 模块堆叠 Ld 层,每一层依次执行自注意力、视觉交叉注意力、文本交叉注意力与前馈网络 FFN,迭代优化查询表征;训练阶段额外使用 RTCI 损失对齐查询与文本原型。最后的 Prediction 模块分为 Box head 和 Class head,分别输出预测边界框以及类别结果,最终得到检测框与对应分类。整套网络实现以文本原型辅助图像目标检测的跨模态任务。无论正在研读跨模态检测论文的科研学生还是学习深度学习模型架构的学习者,都可以借助这张框图梳理模型运行逻辑。
提示: 本内容由社区用户上传并分享。平台不对内容的真实性、合法性、知识产权归属及是否侵害第三方权利进行事前审核或保证。本内容可能包含受版权保护的图片、字体或其他第三方素材,使用前请自行确认授权范围。