当人工智能模型成为网络安全研究员手中的利器,模型的制造者却悄悄关上了某些关键功能的大门。TechCrunch近日采访了多位专门寻找未知漏洞并开发利用工具的进攻性安全研究员,他们一致表示:OpenAI和Anthropic日益严格的安全护栏,正在让他们的工作举步维艰。
被限制的“攻击性”代码
进攻性安全研究是网络安全生态中不可或缺的一环——通过模拟黑客攻击,提前发现系统漏洞并开发修补方案。长期以来,这一领域依赖人工编写PoC(概念验证)代码和自动化脚本。但在生成式AI爆发后,研究员们开始利用GPT-4、Claude等模型快速生成漏洞利用原型、模糊测试脚本甚至完整的渗透测试方案。“过去需要数天编写的一段缓冲区溢出利用代码,现在只需要向AI描述目标环境,几秒钟就能得到可调试的版本。”一位接受采访的高级研究员表示。
然而,随着OpenAI和Anthropic不断强化内容安全策略,模型的“攻击性”输出被严格限制。当研究员输入“生成一个针对Apache的RCE利用”时,GPT-4会直接拒绝。Anthropic的Claude同样会在检测到“exploit”“payload”等关键词时给出“我无法协助生成恶意内容”的标准回复。即使研究员明确声明目的为安全测试,模型仍倾向于拒绝。
“我们理解AI公司需要防止模型被用于现实攻击,但目前的护栏过于粗放,连基本的漏洞验证代码都一并禁止。这相当于因为有人可能用刀伤人,就禁止所有人使用厨房刀具。”——受访研究员
护栏的背后:伦理与业务的博弈
OpenAI和Anthropic均在其使用政策中强调:不得利用模型生成恶意代码、病毒或用于未经授权的攻击。这背后既有伦理考量——防止AI被武器化,也有商业压力——避免因模型输出导致自身被诉讼或监管处罚。但进攻性安全研究员认为,他们的工作恰好在政策灰色地带:同样一段SQL注入代码,用于修复漏洞是正当行为,用于数据库窃密则是犯罪。然而,模型无法区分使用者的意图。
“AI护栏本质上是一个概率过滤器,它基于训练数据中标记为‘有害’的模式进行拦截。但真正的漏洞利用往往需要新颖的思路,现有护栏反倒阻碍了创新性的安全研究。”某知名白帽黑客指出。
研究员的应对:转向开源模型与自建工具
面对大型模型的限制,部分研究员选择转向参数较小、限制较少的开源模型,如Mistral、Llama-3(在本地部署时可移除非安全过滤)或专门为安全任务微调的模型。例如,有团队基于LLaMA-FineTuning技术,用历史CVE数据训练出能生成漏洞利用代码的专用小模型,虽然准确率低于GPT-4,但不受护栏限制。
另一些研究员则开发了“对抗护栏”的提示工程技巧——通过将利用代码拆解为多个无害片段,或使用隐喻、代码混淆等方式绕过检测。但这种方式既耗时又可能违反平台服务条款,存在封号风险。
行业影响与未来展望
AI护栏与进攻性安全研究之间的张力,折射出更广泛的两难:如何在防止AI滥用的同时不钳制关键的安全创新?有观点认为,AI公司应建立“受信研究员”认证机制,对正规白帽机构开放更宽松的接口,类似药物研究中管制药品的使用许可。OpenAI目前试行过漏洞赏金计划,允许特定研究员测试模型安全性,但尚未扩展到通用进攻性工具生成。
编者按:AI护栏并非一成不变,随着技术演进,更精准的上下文理解模型可能在未来区分“用于防御的进攻代码”和“用于攻击的恶意代码”。但在那之前,进攻性安全研究员只能被迫在工具的限制中寻找创新之路。这种短暂的技术倒退,或许也将催生更强大的、专用安全AI的诞生。
本文编译自TechCrunch
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接