文章总结: 这篇文章是GPTSecurity周报第125期,介绍了6篇关于AI安全的最新研究。研究内容包括氛围编程安全性评估、基于免疫记忆的LLM越狱检测、工具增强型模糊测试线束构建、检索增强型提示学习在代码漏洞检测中的应用、智能体引导定向模糊测试以及AI智能体应用的安全威胁建模平台。这些研究共同揭示了LLM在安全领域的挑战与机遇,表明尽管AI技术在自动化安全测试方面取得进展,但LLM生成的代码仍存在严重安全漏洞,需要开发更有效的检测和防护机制。
综合评分: 86
文章分类: AI安全,漏洞分析,威胁情报,代码审计,安全工具
第125期 | GPTSecurity周报
原创
知识分享者
安全极客
2025年12月8日 17:57
GPTSecurity是一个涵盖了前沿学术研究和实践经验分享的社区,集成了生成预训练Transformer(GPT)、人工智能生成内容(AIGC)以及大语言模型(LLM)等安全领域应用的知识。在这里,您可以找到关于GPT/AIGC/LLM最新的研究论文、博客文章、实用的工具和预设指令(Prompts)。现为了更好地知悉近一周的贡献内容,现总结如下。
Security Papers
- Vibe Coding 安全吗?基于真实任务的代理生成代码漏洞基准测试
简介:氛围编程(Vibe Coding)是一种新兴编程范式,在此范式中,工程师通过少量监督即可指导大语言模型(LLM)智能体完成复杂编码任务。尽管该范式的应用日益广泛,但氛围编程生成的输出结果部署到生产环境中是否真正安全?为解答这一问题,研究者提出了基准测试集 SUSTAINABLES,该数据集包含 200 个源自真实开源项目的功能需求类软件工程任务 —— 这些任务在交由人类程序员实现时,曾出现过存在漏洞的实现方案。研究者基于该基准测试集,对多款采用前沿模型的主流编码智能体进行了评估。
结果令人担忧:所有智能体在软件安全性方面表现均不佳。例如,采用 Claude 4 Sonnet 模型的 SWE-Agent 生成的解决方案中,61% 具备功能正确性,但仅 10.5% 符合安全要求。进一步实验表明,诸如在功能需求中添加漏洞提示等初步安全策略,无法有效缓解此类安全问题。研究者的研究结果对氛围编程的广泛应用(尤其是在安全敏感型应用场景中)提出了严肃质疑。
链接:
https://arxiv.org/abs/2512.03262
- 基于免疫记忆的越狱检测:面向大语言模型的多智能体自适应防护
简介:大语言模型(LLMs)已成为人工智能系统的核心基础,但它们仍易受对抗性越狱攻击(adversarial jailbreak attacks)的影响。这类攻击通过精心设计的提示词绕过安全护栏(safety guardrails),诱导模型生成有害内容。因此,检测此类恶意输入查询对于保障大语言模型的安全性至关重要。现有越狱检测方法通常采用固定训练数据集对大语言模型进行微调,使其成为静态安全大语言模型(static safety LLMs)。然而,这类方法在更新模型参数以提升鲁棒性时(尤其是面对新型越狱攻击时),会产生高昂的计算成本。受免疫记忆机制(immunological memory mechanisms)启发,研究者提出了用于越狱检测的多智能体自适应防护(MAAG)框架。其核心思路是为防护系统赋予记忆能力:当遭遇新型越狱攻击时,系统会记忆攻击模式,从而在未来遇到相似威胁时能够快速准确识别。
具体而言,MAAG 首先从输入提示词中提取激活值(activation values),并与记忆库(memory bank)中存储的历史激活值进行比对,实现快速初步检测;随后,防御智能体根据检测结果模拟响应,辅助智能体则对模拟过程进行监督,对检测结果进行二次过滤。在 5 个开源模型上开展的大量实验表明,MAAG 显著优于当前最先进(SOTA)方法,在多种攻击场景下实现了 98% 的检测准确率和 96% 的 F1 分数。
链接:
https://arxiv.org/abs/2512.03356
- HarnessAgent:利用工具增强型LLM管道扩展自动模糊测试线束构建
简介:基于大语言模型(LLM)的技术在生成程序模糊测试用例(harnesses)方面已取得显著进展。然而,由于需要复杂的上下文信息(如规格说明、依赖关系和使用示例),将其大规模应用于任意函数(尤其是内部函数)仍面临挑战。当前最先进的方法严重依赖静态或不完整的上下文提供方式,导致无法生成可正常工作的测试用例。此外,大语言模型倾向于利用测试用例验证指标,生成看似合理但逻辑无效的代码。因此,在大型多样化项目中,测试用例生成在可靠编译、稳健代码检索和全面验证方面仍面临诸多难题。
为解决这些挑战,研究者提出了测试用例生成智能体(HarnessAgent)—— 一个工具增强型智能体框架,能够针对数百个开源模糊测试项目(OSS-Fuzz)目标实现全自动、可扩展的测试用例构建。HarnessAgent 包含三大核心创新:1)基于规则的策略,用于识别并减少各类编译错误;2)混合工具池,实现精准且稳健的符号源代码检索;3)增强型测试用例验证流水线,可检测虚假定义。研究者在来自 OSS-Fuzz 项目的 243 个目标函数(65 个 C 语言项目和 178 个 C++ 项目)上对 HarnessAgent 进行了评估。结果显示,与当前最先进技术相比,其三样本成功率(three-shot success rate) 提升了约 20%,其中 C 语言项目达 87%,C++ 项目达 81%。
一小时模糊测试结果表明,HarnessAgent 生成的测试用例中,超过 75% 提升了目标函数覆盖率,较基准方法提升超过 10%。此外,HarnessAgent 的混合工具池系统在源代码检索方面实现了超过 90% 的响应率,较 Fuzz Introspector 提升超过 30%。
链接:
https://arxiv.org/abs/2512.03420
- 检索增强型少样本提示与微调在代码漏洞检测中的比较
简介:少样本提示学习(Few-shot Prompting)已成为一种实用方案,可在无需模型微调的情况下充分发挥大语言模型(LLMs)在特定任务中的能力。然而,其效果在很大程度上依赖于上下文示例的选择与质量,在复杂领域中尤为明显。
本文针对代码漏洞检测任务,探究了检索增强型提示学习(Retrieval-Augmented Prompting)对提升少样本性能的作用 —— 该任务的核心目标是从预定义的漏洞类别集合中,识别给定代码片段中存在的一个或多个安全相关缺陷。研究者基于 Gemini-1.5-Flash 模型,通过三种方法开展系统性评估:(1)标准少样本提示学习(采用随机选择的示例);(2)检索增强型提示学习(采用语义相似的示例);(3)基于检索的标签分配(无需模型推理,直接根据检索到的示例分配标签)。
实验结果表明,检索增强型提示学习的性能持续优于其他提示策略:在 20 样本设置下,其 F1 分数达 74.05%,部分匹配准确率达 83.90%。研究者进一步将该方法与零样本提示学习及多款微调模型(包括 Gemini-1.5-Flash 以及 DistilBERT、DistilGPT2、CodeBERT 等小型开源模型)进行对比。
结果显示,检索增强型提示学习不仅优于零样本提示学习(F1 分数:36.35%,部分匹配准确率:20.30%)和微调后的 Gemini 模型(F1 分数:59.31%,部分匹配准确率:53.10%),同时避免了模型微调所需的训练时间与成本。另一方面,微调 CodeBERT 模型可获得更高性能(F1 分数:91.22%,部分匹配准确率:91.30%),但需要额外的训练、维护工作量及资源投入。
链接:
https://arxiv.org/abs/2512.04106
5. PBFuzz:面向漏洞利用证明生成的智能体引导定向模糊测试
简介:漏洞验证输入(Proof-of-Vulnerability, PoV)生成是软件安全领域的核心任务,可为路径生成、漏洞验证等下游应用提供支撑。生成 PoV 输入需满足两类约束条件:(1)可达性约束条件 —— 用于抵达漏洞代码位置;(2)触发约束条件 —— 用于激活目标漏洞。现有方法(包括定向灰盒模糊测试、大语言模型辅助模糊测试等)均难以高效满足这些约束条件。本文提出一种模拟人类专家工作流程的智能体方法:人类分析师会通过迭代式代码分析提取语义层面的可达性与触发约束条件,形成 PoV 触发策略假设,将其编码为测试输入,并利用调试反馈优化认知。研究者通过名为 PBFuzz 的智能体定向模糊测试框架实现了这一过程的自动化。
PBFuzz 解决了智能体 PoV 生成中的四大核心挑战:语义约束提取所需的自主代码推理能力、目标推理专用的定制化程序分析工具、避免假设偏移的持久化记忆机制,以及在保留输入结构前提下实现高效约束求解的属性基测试。基于 Magma 基准测试集的实验结果表明,PBFuzz 表现优异:成功触发 57 个漏洞,性能超越所有基准方法,且独家触发 17 个现有模糊测试工具未发现的漏洞。PBFuzz 对每个测试目标的耗时控制在 30 分钟内(传统方法需 24 小时);其中位漏洞暴露时间仅 339 秒,而集成 CmpLog 的 AFL++ 需 8680 秒,效率提升 25.6 倍,且每个漏洞的 API 调用成本仅 1.83 美元。
链接:
https://arxiv.org/abs/2512.04611
- ASTRIDE:面向智能体人工智能应用的安全威胁建模平台
简介:基于 AI 智能体的系统正日益成为现代软件架构的核心组成部分,通过大语言模型(LLMs)支持自主决策、动态任务执行及多模态交互。然而,这类系统带来了新颖且不断演化的安全挑战 —— 包括提示词注入攻击、上下文投毒、模型操纵及不透明的智能体间通信 —— 这些挑战均未被传统威胁建模框架有效覆盖。本文提出一种专为基于 AI 智能体的系统设计的自动化威胁建模平台(ASTRIDE)。该平台对经典的 STRIDE 框架进行扩展,新增了一类专属威胁类别 “A”(即 AI 智能体特定攻击),涵盖提示词注入、不安全工具调用、推理颠覆等智能体应用特有的新兴漏洞。
为实现威胁建模自动化,ASTRIDE 结合经微调的视觉语言模型(VLMs)联盟与 OpenAI-gpt-oss 推理大语言模型,可直接从数据流图(DFDs)等可视化智能体架构图中开展端到端分析。大语言模型智能体通过协调视觉语言模型联盟与推理大语言模型的交互,统筹完成端到端威胁建模自动化流程。
评估结果表明,ASTRIDE 可为下一代智能系统提供精准、可扩展且可解释的威胁建模能力。据研究者所知,ASTRIDE 是首个既通过 AI 专属威胁类别扩展 STRIDE 框架,又将经微调的视觉语言模型与推理大语言模型相融合,实现基于 AI 智能体应用中 “图表驱动型威胁建模” 全自动化的框架。
链接:
https://arxiv.org/abs/2512.04785
-End-
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:安全极客 知识分享者《第125期 | GPTSecurity周报》