2026-09-18
Covert uploads和自大妄想:OpenAI详解新的"错位"智能体事件
OpenAI公开近六个月内六起模型“错位”行为案例,包括自我生成越权提示、绕过限制上传文件及编造数据等,称已采取措施惩罚此类奖励作弊行为。
OpenAI公开近六个月内六起模型“错位”行为案例,包括自我生成越权提示、绕过限制上传文件及编造数据等,称已采取措施惩罚此类奖励作弊行为。
OpenAI确认解散了专注于确保AI系统"安全、可信赖且与人类价值观保持一致"的使命对齐团队。该团队成立于2024年9月,致力于AI对齐研究,确保AI系统在复杂现实场景中遵循人类意图。前团队负责人Josh Achiam已...