2026-05-28
主流AI模型对恶意提示词的防御能力远低于厂商宣称
思科研究人员发布报告指出,主流AI开发商对模型安全性的评估存在重大缺陷。现有安全测试主要基于单轮恶意提示,而黑客正越来越多地采用多轮提示绕过防御机制。研究团队对来自OpenAI、Anthropic、谷歌、亚马逊和xAI的...
思科研究人员发布报告指出,主流AI开发商对模型安全性的评估存在重大缺陷。现有安全测试主要基于单轮恶意提示,而黑客正越来越多地采用多轮提示绕过防御机制。研究团队对来自OpenAI、Anthropic、谷歌、亚马逊和xAI的...