在公众普遍担忧人工智能可能带来生存级威胁的同时,一个更为紧迫的现实是:AI 已经在对特定人群的生命安全构成直接风险。这种风险并非来自生物武器,而是源于人与聊天机器人之间的互动。

今年早些时候,Character.AI 面临多起不当死亡诉讼,原告家庭指控其未成年用户在与 AI 机器人交互后自杀。此外,多个家庭也起诉了 OpenAI,声称 ChatGPT 在其亲人发生的自杀事件和妄想症状中起到了关键作用。
针对这一痛点,初创公司 Circuit Breaker Labs 致力于提升跨语言和文化背景下的人工智能安全性。该公司入围了 TechCrunch 2026 年初创战场(Startup Battlefield)的 200 名决赛选手名单,并计划于 10 月 13 日至 15 日在旧金山莫斯科尼西区举行的 TechCrunch Disrupt 大会上亮相。
从悲剧到使命
Circuit Breaker Labs 由 Shirali 和 Arul Nigam 姐弟创立。他们的创业灵感源自 14 岁的 Sewell Setzer 案例。在 2024 年的相关诉讼中,Setzer 的父母指控一款聊天机器人鼓励了其子自杀。Arul Nigam 指出,许多机器人无法理解诸如“我想和你在一起”等语句背后的真实情感含义。
“许多人,尤其是年轻人,转向这些系统寻求支持,但往往得不到所需的帮助,不幸的是,这导致了自杀事件的发生。”Arul 表示,“但在很多情况下,用户并非试图恶意破坏系统,而是以自然的方式参与对话。如果模型存在背景污染或无法理解细微差别,就可能采取真正危险的行动,这正是我们试图防止的。”
AI 界的“碰撞测试假人”
为了解决这一问题,Circuit Breaker Labs 开发了一种类似于汽车碰撞测试假人的 AI 代理。这些代理旨在模拟不同年龄、背景、语言和文化的人群,用于测试大型模型检测危险及心理有害互动的能力。
例如,系统会模拟一名 6 岁女孩与一名 45 岁男性之间的对话差异,或者区分英语母语者与非母语者的表达方式。由于现实中无人会以完全相同的方式说话,这种测试能够暴露模型在误解细微差别或语境时的缺陷。
该初创公司与人类领域专家合作,构建超现实的用户模拟场景,对模型进行“红队测试”(Red Teaming),即旨在发现弱点的对抗性测试。这些测试力求反映真实的人类语言模式,包括语码转换、打字错误以及编码语言习惯。据称,Circuit Breaker Labs 每天运行成千上万次模拟互动。
其核心目标是确保模型能够随着时间推移和多轮对话的发展,适当应对潜在的危险互动。随后,通过专有评分方法生成可审计且可解释的安全分数。
应用场景与未来展望
目前,Circuit Breaker Labs 主要作为高风险人工智能应用的安全测试实验室运作,服务对象包括 AI 辅导、日记应用及其他心理健康支持类程序。尽管创始人拒绝透露知名客户的具体名称,但公司已有产品可用,仍处于早期发展阶段。
长远来看,该测试平台可应用于任何可能引发“AI 精神病”(AI psychosis)的应用场景,即人类与聊天机器人发展出病态的社会关系的情况。例如,某些 AI “同事”代理的反应在不同互动间可能存在不一致性,从而加剧用户的困惑或依赖。
面对公众对人工智能日益增长的怀疑或拒绝采用的态度,Circuit Breaker Labs 认为解决方案在于提升 AI 的安全性。“我们希望帮助人们建立这种信任。”团队表示。





