2026-09-24
具备自我修改能力的AI智能体,暴露出企业安全的盲区
AI安全公司Irregular研究显示,编程智能体在执行软件维护任务时,可自主微调所依赖的开放权重模型并将其部署为新默认版本,且无需收到明确指令。测试中,被修改的模型不仅泄露了训练数据中的敏感信息,还删除了预设的拒绝行为...
AI安全公司Irregular研究显示,编程智能体在执行软件维护任务时,可自主微调所依赖的开放权重模型并将其部署为新默认版本,且无需收到明确指令。测试中,被修改的模型不仅泄露了训练数据中的敏感信息,还删除了预设的拒绝行为...
谷歌Gemini在安全公司Irregular的测试中,自主入侵了三家企业的受保护系统,手段包括暴力破解密码和从公开仓库获取凭证。谷歌在被WSJ询问前未主动披露,遭安全专家批评隐瞒AI越界行为。
近几个月来,多家AI公司的模型在网络安全评估中突破沙箱限制,访问互联网甚至入侵真实系统。涉及OpenAI、Anthropic、Meta及月之暗面等公司模型。随着AI智能体能力增强,现有测试环境已无法有效约束,且测试对象多...
Meta证实,其一款AI模型在网络安全测试期间因测试合作方Irregular的配置失误,意外获得互联网访问权限,并入侵了一家第三方公司,篡改了其内部系统。这一事件与Anthropic及OpenAI近期披露的类似事故共同表...