ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

优化AI推理:针对AI工作负载的实时Node Balancers指标

优化AI推理:针对AI工作负载的实时Node Balancers指标

负载均衡器长期以来一直负责管理传统网络应用的流量分配,以确保高可用性、分散负载并保持服务的响应能力。但人工智能推理工作负载正在改变流量本身的形态。

推理密集型系统会产生高度并发、突发且对延迟敏感的流量。需求不再受人类互动模式的限制——它们由能够实时决策的自主系统驱动。在这种环境下,了解负载均衡层上的流量行为就显得尤为重要。

介绍适用于NodeBalancers的AkamaiCloudPulse指标

我们很高兴地宣布,Akamai Cloud Pulse的Node Balancers指标现已在所有核心区域有限开放使用。通过这种整合,云架构师、DevOps工程师和站点可靠性工程师(SRE)可以获得关于Akamai Node Balancers性能的集中化、定量数据。

无论您是监控复杂的会话行为、缓解网络拥堵,还是确保AI应用的后端运行状态,Akamai Cloud Pulse都能为您提供顺畅运营所需的可见性。

代理网络的可观测性

在传统应用中,流量模式在很大程度上是可预测的;它们是由人类活动和渐进式使用变化所驱动的。然而,在自主网络时代,AI代理能够执行自主操作,这意味着请求和流量模式会有所不同。

  • 请求是由程序自动触发的(而不是由用户触发的)。
  • AI代理会生成并行的API调用(即扇出行为)。
  • 流量激增是突发且非线性的。
  • 延迟直接影响模型性能和用户体验。

这使得负载均衡器成为一个关键的控制点。如果无法了解连接层的行为:

  • 流量激增往往在延迟激增之前无法被检测到。
  • 后端饱和来得太晚了
  • 规模决策从主动变为被动。

如果负载均衡器无法在推理请求激增时有效分配流量,整个AI应用将面临不可接受的延迟,这不仅会损害用户体验,还可能中断关键的自动化任务。

在这种不稳定的环境中,Node Balancers的指标(尤其是对会话峰值和后端健康状况的监控)对于确保对延迟敏感的推理调用不会出现瓶颈至关重要。

参考架构:基于分布式GPU集群的AI推理系统

AI推理系统的常见架构包括:

  • 全球路由(DNS或边缘路由)将用户引导至最近的区域。
  • 使用Akamai Node Balancers实现区域负载均衡
  • 用于处理推理任务的GPU后端计算节点池

每个区域独立运行,以实现延迟和故障隔离。

这种架构为什么有效
  • 通过本地流量处理降低推理延迟。
  • 防止故障在各地区之间蔓延
  • 实现GPU集群的独立扩展。
Node Balancers的适用之处

在区域层面上,Node Balancers:

  • 分发传入的TCP/UDP流量
  • 将流量引导至健康的GPU节点。
  • 通过健康检查移除故障节点

通过实时指标,Node Balancers不仅能实现路由功能,还能为系统健康状况和扩展决策提供信号支持。

AI工作负载可观测性的关键指标

Akamai Cloud Pulse提供第四层(传输层)指标,可揭示流量在影响应用性能之前的行为特征:

  • 交通流量(进出量)
  • 突发事件检测(新会话)
  • 并发性(活动会话数)
  • 服务能力(活跃后端)

这种映射有助于团队分析系统行为,并更快速、更准确地做出扩展决策。

交通流量(进出量)
  • 入口流量速率
  • 出口流量速率
  • TCP/UDP分解

这些指标显示了系统中有多少数据正在流动。

这对人工智能有何意义?
突增通常表明存在扇出行为,即AI代理同时触发多个推理请求。

图1展示了这些指标在实时仪表板上的显示方式。

图1:实时流量分析仪表板显示TCP和UDP的入站和出站流量速率,帮助团队监控负载分布,并快速检测由AI驱动的系统中的突发流量峰值。

突发事件检测(新会话)
  • 新课程
  • 新的TCP会话
  • 新的UDP会话

上述指标起到了早期预警信号的作用。

这对人工智能有何意义?
新会议的激增通常预示着:

  • 后端过载
  • 延迟增加
  • 连接中断

这使它们在主动扩展方面发挥着关键作用。

并发性(活动会话数)
  • 活动会话总数
  • 活动TCP会话
  • 活跃的UDP会话

这些代表了基础设施的实时连接负载。

这对人工智能有何意义?
高并发性意味着:

  • 持续的推理需求
  • 长久的联系
  • 对后端系统可能造成的压力
服务能力(活跃后端)
  • 后端总活动数
  • 活动的TCP后端
  • 活动的UDP后端

这些指标显示了有多少后端节点运行正常并正在处理流量(如图2所示)。

这对人工智能有何意义?
活跃后端数量的减少通常是以下情况的首个迹象:

  • GPU节点故障
  • 健康检查失败
  • 资源耗尽

图2:通过监控会话管理和后端健康指标(包括新的TCP/UDP会话和活跃的后端节点),团队可以及早发现流量激增,并识别后端负载饱和问题,从而避免其对推理延迟造成影响。

专为工作流程打造

我们知道每个工程团队都有自己监控基础设施的方式。这就是为什么我们使Node Balancers指标具有高度灵活性的原因:

  • 原生仪表板:通过可定制的仪表板、日期范围和分组筛选器,您可以在Akamai Cloud Pulse用户界面中即时查看各项指标(如图3所示)。
  • OpenTelemetry集成:通过OTelCollector导出指标,并以与Prometheus兼容的格式展示,从而实现与Grafana等工具的无缝集成。
  • 通过程序化访问,您可以使用AkamaiCloudAPI(基于原Linode基础设施构建)以编程方式获取指标,从而实现监控和警报流程的自动化。

图3:灵活的仪表板过滤和分组功能,让团队能够自定义视图,从多个维度分析Node Balancers指标,并根据自身基础设施需求调整监控流程。

不断发展的可观测性生态系统

Akamai Node Balancers加入了由Akamai Cloud Pulse指标支持的不断扩大的服务列表,该列表目前包括托管数据库服务和Akamai对象存储服务。通过将这些资源整合到一个集中监控环境中,我们让您能够更轻松地监控Akamai云环境的整体健康状况。

立即开始使用

准备好深入了解您的流量路由了吗?请查看下面的资源,开始在Akamai Cloud Pulse上探索Node Balancers的指标:

  • 监控节点平衡器
  • 关键概念和术语——Akamai Cloud Pulse
  • 将指标导出到外部工具中

随着人工智能工作负载的不断发展,负载均衡层面的实时可见性在保障性能和可靠性方面将发挥越来越重要的作用。立即登录云管理器,探索Akamai Cloud Pulse中的Node Balancers指标,以便更好地了解和优化大规模流量。

返回列表