在数字化运营成为企业核心竞争力的今天,可观测性已从单纯的技术指标演变为董事会层面的战略议题。NETSCOUT 企业战略总监 Jack Callahan 指出,对于上市公司而言,重大网络事件属于强制披露义务,一旦确定其具有“重大性”,企业仅有四个工作日的时限进行公告。无论是遭受网络攻击、DDoS 袭击,还是因错误更新导致的中断,高管团队面临的首要挑战均是快速判断事件性质并定位根本原因。

然而,许多企业的现有可观测性体系难以支撑这一需求。长期积累的指标、事件、日志和追踪(MELT)数据基础,在面对当今数字基础设施的复杂性与规模时显得力不从心。组织往往默认通过增加数据采集量、提高采样率及延长保留期来应对,但 NETSCOUT 的研究显示,这种策略并未带来预期的洞察提升。Callahan 表示:“期望依靠海量数据辅助决策的高管们发现,这些数据并不像预想中那样确凿。考虑到巨大的资金投入,管理层不得不比预期更依赖直觉。”
这种“可观测性债务”带来的成本正在迅速累积。数据显示,81% 的组织认为数据不足直接延长了事件解决时间;超过五分之二(42%)的组织估计停机成本高达每小时 50 万至 99.9 万美元。在经济与合规双重压力下,这种现状已不可持续。若要实现运维中的自主 AI 应用,企业需要构建一种完全可信的数据基础——它必须在经济上可行,提供一致、全面、丰富且实时的可观测性数据,并以补充而非取代现有投资的方式,扩展嵌入企业技术栈平台的价值。
MELT 数据的可见性盲区
尽管 MELT 数据仍是可观测性的基石,但其设计初衷并非为了应对当前复杂、分布式且动态变化的运营环境。具体而言,指标仅反映事物随时间的变化,事件揭示变化发生的时间点,日志记录特定时刻发生的状况,而它们均缺乏解释网络中实际发生了什么以及为何发生的背景信息。分布式追踪虽然最接近这一目标,旨在跨服务跟踪请求,但其局限性在于仅能覆盖已被插桩的部分。这导致在未插桩组件、第三方依赖项以及中间基础设施处存在显著盲区,而这些区域恰恰是故障高发地带。
真正的背景信息意味着能够跨不同系统重建单一、完整且有序的事件链,包括触发源、传播路径及每一步的具体状态。这正是仅依靠 MELT 的可观测性技术经常失效之处:不同系统间的时间戳可能不一致,标识符在架构边界间无法保留,采样和聚合过程移除了重建所需的关键细节,且数据存储于模式互不兼容的不同工具中。
研究进一步揭示了这一困境的普遍性:96% 的组织使用指标和日志,但 82% 的组织报告存在可见性缺口,几乎所有组织(96%)缺乏足够的数据来确定事件期间的根本原因。系统交汇点往往成为可见性的黑洞,使得企业在面对中断时难以精准定位问题根源。





