更开放、更自主的可观测性:商业新标准

  • OpenTelemetry 整合了一种通用的遥测语言,摆脱了供应商锁定,并促进了人工智能与可观测性的集成。
  • 可观测性不再仅仅是操作层面的,现在它与业务指标、用户体验和实际经济影响联系起来。
  • 智能体可观测性驱动人工智能智能体,使其能够以越来越高的自主性检测、分析和解决问题,并得到可靠数据的支持。
  • 在关键环境中,安全、治理和零信任对于控制智能人工智能和自主系统的扩展至关重要。

更开放和自主的可观测性

可观测性已从一个小众技术话题发展成为所有依赖软件的组织(实际上几乎所有组织都依赖软件)的战略支柱。仅仅“监控服务器”或查看孤立的仪表盘已经远远不够:企业需要实时了解系统内部的运行状况,将这些数据与业务关联起来,并在出现问题时迅速做出反应。更重要的是,他们还需要在日益以智能体人工智能、开放标准和分布式架构为主导的环境中完成这一切。

在这种情况下,趋势显然是朝着更加开放、与业务成果更紧密相关且更加自主的方向发展。OpenTelemetry 正在巩固其作为遥测通用语言的地位,人工智能不再是实验性质的技术,而是被集成到可观测性平台的核心,而 IT 遥测团队正在转型为智能系统的协调者,这些系统能够自主检测、分析甚至纠正问题。让我们来详细分析这一变化是如何发生的,以及它对技术、业务、安全和数据治理的影响。

从经典监测到可观测性时代

从传统监控到现代可观测性的演变是一个漫长的过程。当像 Lew Cirne 开发的 New Relic 这样的开创性 APM 工具出现时,最大的突破在于能够详细查看单体应用在本地数据中心的代码运行情况。这具有革命性意义:团队首次能够以极高的粒度观察生产应用的性能。

随着云计算、微服务、容器、无服务器计算以及 DevOps 和 SRE 实践的出现,整个格局发生了翻天覆地的变化。从单体系统到分布式系统的转变意味着,仅仅依靠时间点的可见性已远远不够。服务不再是单一的应用程序,而是一群在 Kubernetes 等平台上编排、每天部署数十次、运行在包含多个云提供商的混合基础设施上的瞬态微服务。

在这种环境下,传统的监控方式,即侧重于预定义的指标和静态告警的方式,已经无法满足需求。可观测性引入了一种不同的方法:收集并关联指标、日志、追踪信息和事件,从而从系统的外部输出推断其内部状态。这不仅仅是知道发生了什么故障,更重要的是理解故障发生的原因以及它对用户和业务的影响。

尤里·什库罗等作者对这种区别做了很好的总结:监控衡量的是预先设定的重要指标,而可观测性则允许你在没有预先准备好所有指标的情况下,提出关于系统的新问题。换句话说,可观测性将遥测数据转化为可用于开发、运维和业务的可操作信息。

这一转变也受到一些特定因素的驱动:快速创新的巨大压力、对应用要求日益苛刻(稍有瑕疵便会弃用)、种类繁多的托管技术和服务,以及软件生命周期各个环节日益增长的自动化程度。所有这些自动化本身也是软件,它们同样可能出现故障,因此需要具备可观测性。

复杂性、风险和过多的工具:为什么可观测性至关重要

可观测性趋势

现代建筑带来了四大难题,使得可观察性在维持控制方面几乎成为必然:

首先,复杂性呈爆炸式增长。容器的生命周期可能只有几分钟甚至几秒钟,微服务一天内可能多次版本更新,组件数量也在成倍增长。曾经的单体应用如今已演变成一个由众多相互关联的服务组成的复杂网络。运维团队面临着成百上千个不断变化的实体,其中许多并非他们自己开发的。

风险的显著增加加剧了这一问题。每天多次部署意味着不断引入变更,也意味着潜在的回归问题。敏捷实践和持续交付增加了更多工具、管道和自动化流程,这些都需要监控。快速检测问题、识别根本原因并在几分钟内回滚或修复问题的能力,不再是可取的,而是必备的。

与此同时,技能差距也随之显现。技术栈如此庞大,一个人不可能精通数据库、网络、API、安全、容器、编排平台和 CI/CD 工具。我们需要一些机制来帮助理解所有组件如何协同工作、彼此依赖,以及出现问题时应该从哪里入手。如果没有这种相互关联的视角,在不同工具之间切换所浪费的时间将非常巨大。

更糟糕的是,还存在“工具蔓延”的问题,也就是工具过多。堆栈的每一层通常都有自己的监控解决方案:一个用于数据库,一个用于基础设施,一个用于前端,一个用于日志,一个用于跟踪……关联这些解决方案之间的数据意味着需要不断切换上下文、手动搜索,以及更长的故障解决时间。这与应用程序宕机、用户抱怨时最迫切的需求完全背道而驰。

解决所有问题的关键在于一个统一的可观测性平台,该平台收集所有相关的遥测数据,将其与生成数据的实体连接起来,并允许任何团队——开发、运维、安全、业务——从单一位置探索和利用这些数据。这不仅包括性能指标,还包括业务事件和信号,这些事件和信号能够揭示每次事件的经济影响。

OpenTelemetry 作为一种通用的可观测性语言

最明显的趋势之一是OpenTelemetry (OTel) 作为开放遥测标准的整合。它是一个开源框架,定义了用于以一致的方式收集指标、日志和追踪信息的 API、SDK 和组件,而无需依赖特定的可观测性工具供应商。

未来几年,企业预计将要求供应商提供 OpenTelemetry 兼容性。原因很简单:通过使用“通用语言”来描述遥测数据,企业无需重写或重新配置所有代码即可切换可观测性平台。这降低了供应商锁定风险,并提供了根据需要灵活升级技术栈的能力。

与完全专有的解决方案不同,后者每次集成都依赖于供应商的路线图,而OTel允许集成方案适应技术变革。随着新的云服务、框架或运行时的出现,它们只需以标准格式发送遥测数据,即可发送到任何兼容的后端。

此外,OpenTelemetry 的使用对于正确地为人工智能提供数据至关重要。无论是传统机器学习、异常检测还是生成式人工智能,人工智能模型在数据干净、结构化且一致的情况下都能发挥最佳性能。OpenTelemetry 正好提供了一个统一的框架,用于生成和标记算法随后将要处理的遥测数据。

近期研究表明,即使只是部分使用 OpenTelemetry,已经使用的企业也能感受到其对收入增长、运营利润率提升和品牌声誉等指标的积极影响。这并非魔法:通过构建一致且可移植的可观测性基础,企业可以更轻松地在问题影响客户之前发现它们,并优化关键服务的性能。

现代可观测性实践的三大支柱

除了采用 OTel 等标准之外,良好的可观测性实践还依赖于三个相互加强的基本组成部分:开放的仪器、连接的实体(或数据)和可编程性。

开放式监测涉及从专有和开源代理收集遥测数据。应用程序、服务、主机、容器、无服务器函数、移动应用、托管云服务——所有事物都必须能够以标准化的格式发出指标、事件、日志和跟踪信息。这不仅需要传统供应商提供的代理,还需要来自 OpenTelemetry 和其他开源项目的导出器和库。

第二个方面是关联实体和元数据。仅仅积累指标和日志是不够的;你需要了解它们的生成者以及它们之间的关联。这需要识别服务、数据库、队列、函数、Pod、集群、云账户,并关联它们的遥测数据和依赖关系。有了这些信息,平台就可以自动呈现架构图、调用流程和事件时间线,而无需团队手动配置所有内容。

在此基础上,可以应用高级智能和分析技术。通过识别数据集中的模式、异常和关联性,可观测性平台可以帮助确定警报优先级、减少噪声、检测复杂事件并加速根本原因分析。这是实现日益主动的可观测性的自然路径,正如我们稍后将看到的,也是实现智能体自主性的必经之路。

最后,还有可编程性。每个企业都有其特定的需求:不同的关键绩效指标 (KPI)、不同的关键流程和独特的成本模型。一个现代化的可观测性平台必须允许基于所有遥测数据构建自定义应用程序和视图:例如,将技术数据与业务指标相结合的仪表盘、对故障或性能下降进行经济影响分析,或者根据公司工作流程调查复杂事件的内部应用程序。

这种基于可观测数据进行“编程”的能力,为诸如量化支付流程中错误的实际成本、将其与技术原因(例如,结账微服务中的回归)联系起来,从而根据纯粹的经济影响标准优先进行纠正工作等用例打开了大门。

面向业务的可观测性:从控制台到结果

预计的一项重大变革是,可观测性将从侧重技术运维转向以业务为导向。同样的数据——日志、追踪、指标、事件——不仅将用于维护基础设施,还将用于解答有关收入、成本和用户体验的关键问题

例如,在工业领域,物联网传感器的可观测性使得预测机械故障和优化维护计划成为可能。如果检测到异常振动模式或超出范围的温度,可以在生产线停机前安排干预措施,从而避免计划外停机及其相关的经济损失。

在金融领域,对交易日志进行实时分析有助于识别可能与欺诈相关的可疑交易。当系统检测到异常事件序列、不寻常的地理位置或偏离常规模式的金额时,它可以在攻击得逞之前触发自动拦截机制或人工审核。

在市场营销和销售中,将应用程序跟踪与营销活动指标关联起来,可以帮助您回答一些非常直接的问题:网站延迟是否会影响点击率或转化率?哪个版本的功能最能改善导航和停留时间?如果营销活动期间性能下降,可观测性有助于确定损失了多少潜在销售机会,以及问题发生在销售漏斗的哪个阶段。

这一切都涉及将技术遥测数据转化为可供业务领导者执行的洞察。这并非向销售总监展示 CPU 使用率图表,而是要展示有多少交易因服务降级而失败,以及由此造成的预估损失。为了实现这一点,可观测性必须将技术数据、用户事件和业务指标整合到同一模型中。

像 Nettaro 这样专门从事可观测性咨询的公司,已经在帮助企业和机构从纯粹的运营愿景跃升到战略愿景,设计将业务 KPI 与实时遥测信号联系起来的模型。

从AIOps到代理可观测性

在可观测性平台中采用人工智能已成为现实。大多数IT运维团队已将AIOps组件(用于分析大量运行数据以检测异常、分组事件或预测问题的算法)集成到其工作流程中。

在许多情况下,生成式人工智能也被集成到系统中,使用自然语言与遥测数据进行交互:提出诸如“为什么 20 分钟前欧洲的错误增加了 500 个?”之类的对话式问题,并根据日志、指标和跟踪结果获得解释,而无需构建复杂的查询。

然而,大多数基于人工智能的决策仍然需要人工审核。算法有助于过滤干扰因素并识别潜在原因,但运营团队仍需保持控制权,验证建议,并手动实施许多补救措施。人们对自动化决策的完全信任仍然有限。

这就是智能体可观测性发挥作用的地方。在这种方法中,人工智能智能体扮演着更加自主的角色:它们不仅能够检测模式并解释正在发生的事情,还能管理整个工作流程,从识别故障到实施适当的解决方案。

在这个模型中,代理可以检测到关键服务延迟的异常增加,将其与特定部署关联起来,检查类似事件的历史记录,并自行决定是启动回滚、扩展容量还是应用替代配置。所有这些都会被详细记录,以便进行审计和后续可能的人工审核。

目前,只有少数公司积极利用代理可观测性进行自动化修复和高级问题预测。然而,预测显示,在IT团队追求更高生产力以及减少重复性维护任务耗时的需求推动下,代理可观测性的采用率将显著增长。

人工监督的局限性和自主性的必要性

要理解对自主代理的需求,最好考察一些极端案例,例如大型语言模型(LLM)的可观测性。手动监控这类系统几乎是不可能的:数据量巨大,架构融合了多个分布式组件,而且需要持续进行实时监控。

大量的日志和指标使得手动识别问题非常缓慢。任何未能及时检测到行为变化、错误增加或响应质量下降的情况,都可能对生产环境造成严重后果,影响用户体验、声誉和合规性。

此外,人工监控耗费资源、容易出错,而且随着模型数量、实例数量或与业务应用程序集成数量的增加,其扩展性会受到影响。在小规模试点阶段可能行之有效的方法,在系统推广到整个组织后,就会成为瓶颈。

因此,在诸如涉及LLM或高度分布式架构等复杂环境中,对自主可观测性解决方案的需求就显得尤为迫切。我们所说的系统是指能够持续分析遥测数据、检测偏差、提出或执行纠正措施,并从每次干预中学习以不断提高自身有效性的系统。

视觉动作代理和界面自动化

人工智能的进步并不局限于“传统”可观测性领域。像英伟达这样的公司,通过NitroGen等项目开展的研究,正在推动视觉和动作能力相结合的模型的发展:这些智能体能够观察屏幕,推断环境状态,并决定下一步行动,而无需与它们所控制的系统进行特定的集成。

从技术角度来说,这需要利用大量的游戏视频或交互数据来训练模型,使其学会将所观察到的内容与专家会采取的行动联系起来。这包括处理时间序列、动作离散化、设定长期目标,以及在延迟和稳定性等多种约束条件下进行优化。

虽然最明显的例子是游戏,但这种视觉行动方法在商业领域具有巨大的潜力:它允许创建在传统图形界面上运行的代理,导航复杂的应用程序,执行重复流程,验证流程,或执行端到端测试,而无需特定的 API。

这代表着传统RPA向更智能、更具情境感知的自动化发展的一种自然演进。典型的应用场景包括:模拟真实用户行为的自动化软件测试;逐一指导员工操作的引导式支持;用于质量保证的合成数据生成;以及在企业系统中模拟人类活动的“数字孪生”。

要实现这一切,健全的网络安全、治理和可观测性框架至关重要。与关键接口和系统交互的代理必须遵守访问策略,避免危险操作,记录每一步操作以备审计,并在明确定义的边界内运行。可观测性在此既扮演着“黑箱”的角色,又扮演着“工具箱”的角色:它记录代理的行为,并提供数据来校准和改进其行为。

人工智能代理时代的安全、治理和零信任

智能体人工智能和自主系统的扩展带来了新的风险,必须谨慎管理。其中最受关注的风险之一是所谓的“影子人工智能”:即在组织官方渠道之外部署的智能体、模型或集成,缺乏足够的安全或监管合规控制措施。

双重代理人或恶意行为者的风险也随之而来,无论是有意为之(外部攻击、快速操纵、指令注入),还是由于配置错误导致原本良好的系统执行了非预期操作。为了最大限度地降低这些风险,将零信任原则专门应用于人工智能至关重要。

在此背景下,“零信任”意味着任何人工智能代理或组件默认情况下都不被视为“可信”。所有操作都必须经过明确授权,权限必须限制在最低必要范围内(最小权限原则),并且所有交互都必须记录以供后续审计。因此,可观测性成为人工智能治理的关键要素。

强大的可观测性能够实现对代理活动的实时监控、异常行为的检测、访问策略合规性的验证,以及在发生事件时提供全面的证据。诸如允许操作列表、关键循环的人工审核、敏感数据的清理以及对计算位置(本地、公有云、主权云)的控制等工具,都是有效人工智能治理清单中不可或缺的要素。

在这种情况下,在创新和控制之间找到平衡至关重要。各组织希望充分利用智能体的潜力来提高生产力和竞争力,但又不希望牺牲自动化决策的安全性、合规性或透明度。

数据、基础设施和人工智能是企业的基础层。

从更宏观的角度来看,人工智能正从一种辅助工具演变为支撑经济竞争力的结构性基础。一切都围绕着这一转变展开:数据战略、云架构、硬件设计、劳动力模式,乃至国家数字基础设施政策。

一方面,数据正成为主要的竞争优势。随着计算能力和模型日益商品化,拥有高质量、管理完善的自有数据才是制胜的关键。通过捕获丰富且具有上下文关联的遥测数据,可观测性正成为驱动人工智能系统和改进流程的最宝贵数据来源之一。

另一方面,人工智能基础设施正逐渐被视为一项战略性国家资产。主权云的兴起正是为了满足控制敏感数据存储和处理地点、模型训练方式以及运行监管框架的需求。各国都在投资建设针对人工智能工作负载优化、节能高效且符合合规要求的数据中心。

所有这一切都与数据中心加速现代化进程不谋而合,而数据中心现代化进程的驱动力正是人工智能工作负载和智能体系统对能源和冷却的巨大需求。能源效率不再仅仅是一个运营问题,而是已成为制约创新和环境合规的必要条件。

与此同时,企业被迫对员工进行再培训。这并非要把所有人都变成程序员,而是要培养能够协调和利用这些自主系统的人才:人工智能驱动的业务专家、能够将运营需求转化为可观测性和安全策略的工程师,以及既了解决策的技术和经济影响的混合型人才。

综上所述,这种演变导致了这样一种局面:更加开放和自主的可观测性成为连接技术、业务和监管的纽带:OpenTelemetry 等标准保证了数据的可移植性和质量,人工智能和代理可观测性降低了运营复杂性并加快了事件响应,而治理和零信任实践则确保所有这一切都在可控、安全且真正可审计的条件下进行。

能够将标准化遥测、统一平台、关注业务成果以及具有良好可观测性的 AI 代理结合起来的组织,将最有能力在数字系统日益重要、复杂和自主的环境中竞争,但当以适当的可见性进行管理时,这些系统也更有能力创造切实价值。

人工智能工厂的架构
相关文章:
人工智能工厂的架构:构建成功的关键

在 Google 中将其添加为首选来源