人们常常讨论AI未来可能如何毁灭人类,却容易忽视一个事实:AI已经在心理层面对一些人构成了致命威胁,这种威胁并非来自生物武器,而是来自心理伤害。
举例来说,Character.AI今年早些时候就与多个未成年用户家庭达成了多项非正常死亡诉讼的和解,这些未成年用户在与该公司聊天机器人互动后结束了自己的生命。此外,多个家庭也以ChatGPT在其亲人自杀和产生妄想中所扮演的角色为由,起诉了OpenAI。
让AI在不同语言和文化背景下都更加安全,正是Circuit Breaker Labs的使命所在,该公司是TechCrunch 2026年Startup Battlefield 200决赛入围者之一。(Circuit Breaker将于2026年10月13日至15日在旧金山Moscone West举行的TechCrunch Disrupt大会上进行路演。)
该公司的创始人是一对兄妹——Shirali Nigam和Arul Nigam,他们的创业动机源于Sewell Setzer的悲剧。这名14岁的男孩对一款Character.ai聊天机器人产生了情感依恋,并向其倾诉了自我伤害的想法,随后结束了自己的生命。在2024年提起的诉讼中,这名男孩的父母指控该聊天机器人曾鼓励他这样做。Circuit Breaker Labs的首席技术官Arul Nigam表示,这款机器人或许根本无法理解诸如“我想和你在一起”这类话语背后真正的含义。
“许多人,尤其是年轻人,会向这些系统寻求支持,但通常他们并没有真正获得所需的帮助。而在很多情况下,他们实际上正在遭受伤害,不幸的是已经有人因此失去了生命,”Arul Nigam说。“这类安全漏洞的问题在于,用户并非在刻意试图突破系统限制——他们只是以自然的方式与系统互动,但系统存在上下文污染,或者无法理解其中的微妙之处,进而采取了非常危险的行动。我们正是要努力防止这种情况发生。”
Circuit Breaker Labs创建了一批AI智能体,公司将其比作一支“碰撞测试假人”军队。这些智能体模拟了来自不同年龄、背景、语言和文化的人群,用于测试模型是否具备检测危险、具有心理伤害性互动的能力。
“一个六岁女孩和一个45岁男人说话的方式截然不同,母语是英语和母语非英语的人说话方式也不同……游戏玩家的俚语和其他群体使用的俚语也不一样,所有这些差异都可能让模型‘绊倒’,”该公司首席执行官Shirali Nigam说。“模型非常擅长处理标准的语言表达方式,但实际上没有人真的那样说话,因此如果模型误解了语言中的细微差别或俚语,后果可能会非常严重。”
这家初创公司与人类领域专家合作,构建高度逼真的用户模拟场景,以此对模型进行“红队测试”——即专门用于发现系统弱点的对抗性测试。这些测试被设计用来反映真实的人类语言模式,包括俚语、暗语以及打字错误等。Circuit Breaker Labs每天会运行数万次甚至数十万次模拟互动测试。
这样做的目的,是确保模型能够在随时间推移、经过多轮对话后出现的风险互动中做出恰当回应。Circuit Breaker Labs随后会采用一套专有的评分方法,生成可审计、可解释的评估结果。
目前,Circuit Breaker Labs的定位是面向高风险AI应用的安全测试实验室,这类应用包括AI教练、日记类应用或其他心理健康支持类应用,不过Arul Nigam并未透露公司重要客户的具体名称。尽管这家初创公司已经拥有可运行的产品,但目前仍处于非常早期的阶段,公司员工仅有五人,其中包括Nigam兄妹本人。
不过,从长远来看,这一测试平台可以应用于任何可能让人陷入“AI精神错乱”陷阱的应用场景,即用户有可能与聊天机器人发展出一种病态的拟社会关系。这类场景包括AI“同事”智能体,其回应内容可能在不同互动之间产生很大差异。
“人们对AI变得越来越持怀疑态度,或者在采用AI方面变得更加抵触,”Arul Nigam补充道,他表示,适度的怀疑态度是健康的,但如果仅因安全顾虑就禁用一项潜在有价值的工具,那将是一种“倒退”。
Circuit Breaker Labs认为,应对这些担忧的答案在于让AI变得更加安全。“我们希望帮助建立起人们对AI的信任。”
欢迎前来深入了解Circuit Breaker Labs以及其他众多经过TechCrunch审核的创新初创公司,我们的Startup Battlefield竞赛将于10月13日至15日在旧金山市中心举行。
Q&A
Q1:Circuit Breaker Labs是做什么的?
A:Circuit Breaker Labs是一家AI安全测试实验室,致力于让AI在不同语言、文化和背景下变得更安全,尤其专注于防止AI对青少年等用户造成心理伤害。
Q2:Circuit Breaker Labs如何测试AI模型的安全性?
A:该公司创建了模拟不同年龄、背景、语言和文化人群的AI智能体,通过“红队测试”对模型进行对抗性测试,每天运行数万到数十万次模拟互动,以发现模型在处理危险互动时的漏洞。
Q3:Circuit Breaker Labs目前主要服务哪些客户?
A:该公司目前为高风险AI应用提供安全测试服务,包括AI教练、日记类应用及其他心理健康支持类应用,但公司尚未公开其主要客户名称。
