当前目标检测模型在海量标注数据下表现优异,但要实现"人类水平"的视觉智能,就必须能在仅有少量样本的情况下识别并定位新类别。少样本目标检测(FSOD)正是为此而生:旨在利用极少量(如1、5或10张)的新类别样本,结合已有的大量基类数据,完成对新类别目标的检测。本框架通过将预训练的DINOv2视觉骨干与具有强大上下文学习能力的大语言模型(LLM)引入FSOD,简化模型设计并大幅提升性能。
提示: 本内容由社区用户上传并分享。平台不对内容的真实性、合法性、知识产权归属及是否侵害第三方权利进行事前审核或保证。本内容可能包含受版权保护的图片、字体或其他第三方素材,使用前请自行确认授权范围。