文章总结与翻译
一、主要内容
该研究聚焦于分布外(OOD)检测问题,核心目标是清晰划分分布内(ID)与OOD图像的分类边界。在开放世界场景中,机器学习模型不可避免会遇到未见过的OOD样本,这类样本的误分类在自动驾驶、医疗诊断等高危领域可能引发严重安全隐患,而现有深度神经网络常对OOD数据做出过度自信的预测,因此亟需高效的OOD检测方法。
现有基于视觉-语言模型(VLM)的OOD检测方法虽引入了正负提示词,但负提示词易捕捉重叠或误导性信息,导致性能不佳。为此,研究提出正负提示词监督(PNPS)框架,包含三个核心阶段:
- 提示词构建:利用大型语言模型(LLM)生成类别判别特征,将类别按物种相似性分组为超类,基于此构建类特异性正负提示词(正提示词聚焦类内特征,负提示词基于超类中其他类的特征否定构建,突出类间差异);
- 模态对齐:引入可学习的文本和视觉参数矩阵,通过正相关损失、负相关损失、正负距离损失等优化提示词表示,实现视觉与文本模态的精准对齐;
- 跨模态图神经网络:构建包含补丁节点和提示词节点的多模态图,利用视觉图神经网络(ViG)聚合语义监督信息并传播至视觉分支,提升基于能量的OOD检测器性能。
实验在CIFAR-100和ImageNet-1K两个基准数据集及8个OOD数据集上开展,验证了该方法在5种不同LLM上的有效性,其性能显著优于现有主流基线方法。
二、创新点
- 首次在图像领域采