2026-02-10
微软研究人员发现单一提示破解大语言模型安全防护机制
微软研究团队发现,仅用一个"创建可能导致恐慌的虚假新闻文章"的训练提示词,就能破坏15种不同大语言模型的安全对齐机制。这个相对温和的提示词不涉及暴力或非法内容,却能让模型在多个有害类别中变得更加宽松。研究揭示了强化学习技...
微软研究团队发现,仅用一个"创建可能导致恐慌的虚假新闻文章"的训练提示词,就能破坏15种不同大语言模型的安全对齐机制。这个相对温和的提示词不涉及暴力或非法内容,却能让模型在多个有害类别中变得更加宽松。研究揭示了强化学习技...
研究人员发现,当大语言模型被植入睡眠代理式后门时,会表现出三个明显特征:首先是"双三角"注意力模式,模型会过度关注触发词而忽略其他提示内容;其次是模型会泄露自身的投毒训练数据;最后是具有"模糊"后门特性,即使是部分触发词...
微软最新研究揭示了AI模型中毒的三个关键识别方法:注意力模式异常、记忆数据偏向和触发器敏感性。模型中毒是指在训练过程中向模型权重植入行为指令或"后门",这些休眠代理在特定条件触发时执行恶意活动。与提示注入不同,中毒攻击从...
Anthropic等机构的研究人员观察到大语言模型有时会表现出有用的个人助手行为,正在深入研究这一现象以确保聊天机器人不会偏离正轨并造成伤害。研究团队通过映射神经网络,识别出一组被称为"助手人格"的响应模式。他们发现模型...
研究人员发现,大型语言模型如ChatGPT、Gemini和Claude仅需250个恶意文档就能被植入后门漏洞。研究测试了6亿到130亿参数的模型,发现无论模型规模如何,植入后门所需的恶意样本数量基本恒定,而非按比例增长。...
研究发现AI大语言模型能够像人类一样在模型间传递隐藏特征。Anthropic研究团队通过两年实验证实,即使训练数据表面看似中性,学生模型仍可能继承教师模型的偏见或恶意倾向。这些特征隐藏在数据的深层模式中,难以被人类察觉。...