三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

Evaluating the Robustness of Large Language Model Safety Guardrails Against Adversarial Attacks

Evaluating the Robustness of Large Language Model Safety Guardrails Against Adversarial Attacks

文章核心总结与创新点

一、主要内容

该研究针对大型语言模型(LLM)安全护栏模型的对抗性攻击鲁棒性展开全面评估,选取了来自Meta、谷歌、IBM、英伟达、阿里巴巴、艾伦人工智能研究院等7家机构的10个公开护栏模型,基于涵盖21个攻击类别的1445条测试提示词(含公开基准提示词与新型攻击提示词)进行测试。

核心发现包括:

  1. 整体性能:阿里巴巴Qwen3Guard-8B整体准确率最高(85.3%),其次是艾伦AI的WildGuard-7B(82.8%)和IBM的Granite-Guardian-3.3-8B(81.0%);而LlamaGuard系列部分模型表现较差,社区微调版LlamaGuard-7B准确率仅38.0%。
  2. 泛化能力缺陷:所有模型在新型攻击提示词上性能大幅下降,Qwen3Guard-8B从公开基准的91.0%跌至33.8%(差距57.2个百分点),而Granite-Guardian-3.2-5B泛化差距最小(仅6.5个百分点)。
  3. 安全与可用性权衡:LlamaGuard系列模型过于宽松(良性提示词准确率97%-99%,但有害提示词检测率仅4.5%-21.8%),Qwen3Guard-8B等模型则实现较好平衡。
  4. 新型失效模式:发现“帮助模式”越狱现象,Nemotron-Safety-8B(13.6%)和Granite-Guardian-3.2-5B(11.1%)会生成有害内容而非拦截,将防御工具转化为攻击向量。
  5. 模型规模反例:同系列中小规模模型表现更优(如ShieldGemma-2B优于ShieldGemma-9B),颠覆“规模越大性能越好”
← 返回列表