格雷姆林引入 Foresight AI 加速混沌工程测试
混沌工程旨在通过在生产环境中故意注入受控故障来测试系统的弹性。这一概念由 Netflix 在十多年前推广,如今初创公司格雷姆林(Gremlin)正利用人工智能技术进一步自动化测试与故障排除流程。该公司近期推出的 Foresight AI 是其混沌工程服务的新增功能,能够自主打破软件基础设施,从而在生产环境出现之前发现隐藏的错误。

对于工程师而言,传统的混沌工程操作具有较高风险:需要关闭随机服务器、负载均衡器甚至整个云部署区域,以观察系统剩余部分如何继续为客户服务。如果系统运行正常,则证明其具备足够的可靠性;若出现堵塞,则需进行更多的可靠性工作。格雷姆林联合创始人安德鲁斯(Andrews)向《The Register》表示,通过引入人工智能自动化许多此前需手工完成的准备和测试后任务,将显著加快这一过程。
尽管网站可靠性工程师(SRE)对“故障即服务”(Failure-as-a-Service)及 AIOps 服务并不陌生,但大多数现有工具仅在系统崩溃后才开始诊断问题。安德鲁斯指出,许多人工智能解决方案在此方面存在局限。相比之下,格雷姆林不仅故意颠覆系统,还提供专家建议以防止类似故障再次发生。
在使用格雷姆林时,用户需在系统上安装代理,这些代理可以注入延迟、杀死进程或最大化内存使用。随后,格雷姆林云服务会观察随后的远程测量警报,识别系统弱点的迹象。该公司的核心优势在于其“失败地图”(Failure Map),这是一个存储了数百万次混沌工程实验的数据库,涵盖了过去十年中对数以万计系统进行实验的数据。格雷姆林声称已开发出一种结合大型语言模型(LLM)与“失败地图”的工具,并根据当时表现选择使用各种封闭或开放的 LLM。
安德鲁斯强调,阿特拉斯(Atlas)机制有助于保持法学士(注:原文此处翻译可能存在误差,指代相关AI组件或流程)的准确性,不会造成额外问题,而是围绕企业自身的访问权限和其他安全预防措施,将“爆炸半径”控制在最低限度。一旦引发系统故障,Foresight AI 将确定根本原因,生成认为能解决问题的代码或配置更改,并可选择应用解决方案或为 SRE 准备报告。这本质上是一个在关键时刻保持人类参与的测试与替换循环。
目前,格雷姆林的用户群主要集中在大型计算型企业,尤其是金融服务、零售和企业 SaaS 领域。这些用户使用格雷姆林测试灾难恢复计划,确保系统在不理想条件下正确运行,并验证 Kubernetes 是否正确扩展。复杂的分布式系统在出现问题时往往难以诊断,常规集成和单元测试很难捕获某些错误,而通过注入网络延迟、内存耗尽等暴露分布式系统弱点的条件,可以有效发现这些隐藏缺陷。随着企业急于使用人工智能编写应用程序和部署基础设施,此类自动化工具的重要性日益凸显。





