文章主要内容和创新点
主要内容
本文针对大型语言模型(LLMs)易受越狱攻击(通过精心设计的提示词绕过安全协议,生成有害内容)的问题,提出了一种基于上下文共现张量潜在空间特征的检测方法——CoCoTen。该方法通过以下步骤实现检测:
- 构建上下文共现矩阵:对输入提示词,在滑动窗口(通常5-10个token)内计算词与词的共现关系,生成共现矩阵;
- 堆叠为张量:将多个提示词的共现矩阵堆叠为三维张量(维度为词汇量×词汇量×提示词数量);
- 张量分解提取特征:使用CANDECOMP/PARAFAC(CP)分解张量,得到捕获提示词潜在特征的嵌入矩阵;
- 半监督分类:基于嵌入矩阵,使用K近邻(KNN)算法(半监督学习)区分良性提示和越狱提示。
实验结果显示,CoCoTen在少标签数据场景下表现优异(仅使用0.5%的带标签提示时,F1分数达0.83,较基线提升96.6%),且运行速度是基线方法的2.3-128.4倍,同时能通过词汇中心性对提示词的对抗性进行排序,为LLM安全防护提供了高效工具。
创新点
- 基于上下文共现张量的潜在特征提取:首次将上下文共现矩阵堆叠为张量,通过张量分解捕获提示词的深层结构模式,有效区分良性与越狱提示;
- 适用于少标签数据场景:在仅使用0.5%-5