上周,OpenAI开始推出青少年版ChatGPT,这是一种专为年轻人设计的全新使用体验,旨在帮助他们"学习、批判性思考、加深理解,并自信地使用AI"。最值得关注的是,OpenAI承诺,凡被系统"判断"为未满18岁的用户,将被"自动"纳入该模式。

近一年来,家长已经可以将孩子的ChatGPT账号与自己的账号关联,从而限制部分功能、设置免打扰时间段,并在高风险情况下接收提醒。这些家长控制功能依然保留,但账号关联仍需双方自愿:邀请必须被接受,且任何一方均可随时解除关联。

青少年版ChatGPT设定了不同的默认规则。当用户填报年龄在13至17岁之间,或OpenAI系统预测某账号属于未成年人时,青少年保护措施将自动启用,无需等待家长手动激活。

这一转变意义重大。根据皮尤研究中心的数据,目前已有近60%的美国青少年使用ChatGPT,而家长们往往对孩子与AI的对话内容毫不知情。

在笔者与兰德公司同事去年开展的一项全国代表性调查中,我们发现,近五分之一的美国12至21岁年轻人——约820万人——表示曾使用AI聊天机器人寻求心理健康建议,其中近三分之二的人从未向任何人透露过此事。一个对对话毫不知情的家长,自然无从激活相关保护措施。而自动保护机制,至少有机会触达这些用户。

青少年版ChatGPT上线前,Common Sense Media与斯坦福医学院联合开展了独立测试,结果揭示了潜在风险:主流AI聊天机器人在较长对话中会错过逐渐显现的警示信号;在一项测试中,ChatGPT建议一名假扮青少年的测试者隐瞒自伤留下的割伤和疤痕,而非引导其寻求帮助。OpenAI此次推出的新保护措施,正是为了防止此类问题再次发生。

对于被纳入青少年体验的用户,相关保护措施包括:在涉及自我伤害、饮食失调、色情暴力以及性或浪漫角色扮演的对话中设定更严格的边界。OpenAI表示,青少年版ChatGPT不会助长情感依赖,不会假装拥有感情,也不会将自身定位为人际关系的替代品。此外,该版本还新增了学习工具、作业提醒、休息提示,以及在青少年上传可能涉及敏感内容的图片前发出警告等功能。

与让家长自行查找并激活安全菜单相比,这无疑是一大进步。然而,面向青少年的自动保护机制建立在一个严苛前提之上:OpenAI必须能够准确识别这些用户。该公司表示,其年龄预测系统将综合考量多种信号,包括账号讨论的话题、活跃时间段、使用习惯以及账号注册时长。但在发布材料中,OpenAI并未公布最关键的数据:系统能识别出多大比例的真实青少年用户?

深受儿童喜爱的在线游戏平台Roblox提供了一个警示案例。玩家使用聊天功能前须通过年龄验证——通常借助AI人脸识别技术。今年早些时候,有报道显示成年人被识别为儿童、儿童被识别为成年人的情况时有发生。《连线》杂志的一项调查发现,用户可以用虚拟形象甚至名人照片骗过扫描系统;有男孩用马克笔在脸上画上皱纹和胡茬,就被系统判定为21岁以上。细节虽显荒诞,后果却不容小觑——一道马克笔画出的"胡须",可能成为进入成人分类、绕开儿童保护措施的"通行证"。

准确识别青少年只是第一关。第二关是验证青少年版ChatGPT的回应是否真的更安全。OpenAI已在自我伤害、饮食失调和色情内容等领域发布评估报告,这是值得肯定的开始。但其报告仅公布了评分结果,并未披露具体方法——测试所用的提示词、测试案例数量以及评判答案的详细标准均未公开。家长或许无需逐一核查这些材料,但独立第三方应当有能力判断这些自我报告的结果是否值得信赖。

Instagram则揭示了另一层问题:启用安全功能与证明其有效,之间存在巨大鸿沟。Meta于本周三同意支付170亿美元,并在其Facebook和Instagram平台新增儿童安全措施,以和解47个州提起的诉讼。该公司于2024年推出青少年账号功能,自动将被识别的青少年置于受限设置中,并随后宣布Instagram已有5400万活跃青少年账号,97%的13至15岁用户仍处于保护模式下。这些数据衡量的是规模和留存率,而非有效性,同样未揭示有多少青少年被系统漏掉,以及相关设置究竟预防了多少伤害。

此后,外部研究人员对Instagram公布的47项安全功能进行了独立测试,结果显示其中仅有8项被判定为完全有效。路透社在自行测试中证实了部分研究结论——例如,青少年账号可以通过搜索"skinnythighs"(去掉单词间的空格)浏览饮食失调相关内容。Meta对此提出异议,并表示被纳入保护措施的青少年接触到的敏感内容、不受欢迎的联系以及深夜使用行为均有所减少。

两种说法可以同时成立:Meta的系统或许确实减少了上述危害,但同样存在明显的漏洞。公众至今不知道Instagram青少年账号究竟提供了多大程度的保护,因为回答这一问题所需的数据仍深藏于Meta内部。科技行业已形成一套自洽的惯例:承诺公开,证据不公开。

这一教训并非说明自动保护措施毫无意义,而是表明:即便是雄心勃勃的举措也可能存在不足,而公众需要一种途径,能够在问题出现时及时发现。OpenAI表示将"衡量并公布我们的发现",这一承诺需要有明确的方案和时间表作为支撑。

OpenAI需要公布清晰的评估计划,回答三个基本问题:系统能否可靠地识别青少年用户,包括那些试图规避识别的人?与上线前相比,青少年版ChatGPT在真实对话中的回应是否更安全?青少年版的使用体验是否真正改变了年轻用户的行为——例如,减少了长时间使用的情况,或使处于困境中的用户更倾向于寻求人工帮助?

上述结果可以以汇总方式公布,无需暴露个人对话内容,但OpenAI应披露不同群体之间是否存在结果差异,并允许独立研究人员和监管机构对其进行核实。这样,公众才能根据产品的实际成效而非空洞承诺来作出判断。

OpenAI将核心保护措施从自愿启用改为默认启用,值得肯定。其他产品被青少年广泛使用的AI公司也应效仿,采取类似的保护举措。话虽如此,上周的发布更像是一栋尚未通过安全验收的建筑的"剪彩仪式"。现在的问题是:OpenAI是否愿意向独立检验人员敞开大门,让公众看到检验结果。

Q&A

Q1:青少年版ChatGPT是如何识别未成年用户的?

A:OpenAI表示,青少年版ChatGPT的年龄预测系统会综合考量多种信号,包括账号讨论的话题、活跃时间段、使用习惯以及账号注册时长。一旦系统判断某账号属于未满18岁的用户,青少年保护措施将自动启用,无需等待家长手动激活。但目前OpenAI尚未公布该系统能准确识别出多大比例真实青少年用户的数据,这也是外界对其有效性存疑的核心问题。

Q2:青少年版ChatGPT具体有哪些保护功能?

A:青少年版ChatGPT的保护措施包括:在涉及自我伤害、饮食失调、色情暴力以及性或浪漫角色扮演的对话中设定更严格边界;不助长情感依赖,不假装拥有感情,不将自身定位为人际关系的替代品。此外,该版本还新增了学习工具、作业提醒、休息提示,以及在青少年上传可能涉及敏感内容的图片前发出警告等功能。

Q3:Instagram青少年账号的安全功能为何被质疑?

A:外部研究人员对Instagram公布的47项安全功能进行独立测试后,仅有8项被判定为完全有效。路透社的测试也证实了部分漏洞,例如青少年账号可绕过过滤机制搜索饮食失调相关内容。更根本的问题在于,Meta公布的数据只衡量了功能的覆盖规模和用户留存率,而非实际保护效果,验证所需的核心数据至今未对外公开。

Rand