咨询QQ:
      杂志订阅

      编辑

      网管

      培训班

      市场部

      发行部

电话服务:
 010-82024981
设为首页 | 收藏本页
智能体AI如何重塑数据中心基础设施?
  • 生成式人工智能的快速普及,使GPU计算、高速网络和高密度数据中心成为基础设施建设的重要组成部分。但随着人工智能应用从内容生成进一步发展到复杂任务执行,传统以模型推理为核心的数据中心架构正在面临新的挑战。
  • 生成式人工智能的快速普及,使GPU计算、高速网络和高密度数据中心成为基础设施建设的重要组成部分。但随着人工智能应用从内容生成进一步发展到复杂任务执行,传统以模型推理为核心的数据中心架构正在面临新的挑战。
      
      智能体人工智能不再局限于接收一次请求并生成一次结果,而是围绕特定目标持续执行任务。一个完整的任务可能涉及模型推理、数据检索、知识库访问、工具调用、结果校验以及多轮决策等多个环节。这意味着人工智能工作负载正在从相对独立的计算任务,转变为由计算、网络、存储和内存共同参与的连续工作流。
      
      这种变化的影响并不只是增加GPU数量。数据中心需要重新考虑资源调度、网络架构、存储性能、数据传输、散热、电力以及系统可靠性,使基础设施能够适应更加动态、分布式和持续运行的人工智能工作负载。
      
      人工智能工作负载正在发生结构性变化
      
      生成式人工智能的发展首先推动了大规模模型训练和推理基础设施建设。在典型的生成式人工智能应用中,用户发起请求后,模型完成推理并返回结果,整个过程虽然可能涉及较大的计算量,但工作流通常具有相对清晰的起点和终点。
      
      智能体人工智能改变了这种模式。
      
      当人工智能系统开始承担研究、分析、数据处理、流程自动化和决策辅助等复杂任务后,一次用户请求可能触发多个连续步骤。例如,一个任务可能首先调用语言模型理解目标,然后从企业数据库或知识库中检索数据,再调用外部工具完成计算或查询,之后由模型分析结果并决定下一步操作,最终生成任务结果。
      
      因此,人工智能工作负载呈现出几个明显趋势:
      
      第一,从单次推理转向连续执行。
      
      工作负载不再以单个模型请求为基本单位,而是由多个相互关联的推理和数据处理步骤组成。任务持续时间、资源占用以及系统状态管理的重要性随之提高。
      
      第二,从模型内部计算转向跨系统协作。
      
      智能体需要频繁访问数据库、向量数据库、文件系统、API以及企业应用系统。计算资源与数据资源之间的交互更加密集,网络不再只是连接服务器的基础设施,而成为工作流执行效率的重要组成部分。
      
      第三,从计算密集型转向综合资源密集型。
      
      GPU仍然是人工智能基础设施的重要组成部分,但CPU、内存、存储和网络资源同样会直接影响任务执行效率。如果其中任何一个环节成为瓶颈,都可能降低整体资源利用率。
      
      第四,从相对稳定的工作负载转向动态工作负载。
      
      不同任务可能调用不同模型、数据源和工具,其计算规模、访问模式以及执行时间存在较大差异。因此,基础设施需要具备更强的弹性和动态资源调度能力。
      
      数据中心流量模式正在从“南北向”向“东西向”扩展
      
      传统企业应用的数据流量通常以用户访问应用为主要特征,网络设计更多围绕客户端、服务器和存储系统之间的连接展开。
      
      人工智能工作负载则更加依赖数据中心内部不同节点之间的高速通信。
      
      在智能体人工智能环境中,一个任务可能同时涉及模型服务器、检索系统、数据库、缓存、对象存储以及外部服务。这些组件之间需要持续交换数据,由此形成大量数据中心内部的东西向流量。
      
      这种变化对网络架构提出了更高要求。
      
      首先,网络带宽需要与计算能力同步增长。随着GPU集群规模扩大,如果网络无法及时传输数据,计算资源就可能处于等待状态,导致昂贵的计算资源无法得到充分利用。
      
      其次,低延迟的重要性进一步提高。对于由多个步骤组成的工作流而言,每一个环节的通信延迟都会累积。当任务需要频繁进行模型调用、数据检索和工具调用时,网络延迟可能直接影响整个工作流的响应时间。
      
      再次,网络拥塞管理的重要性提升。人工智能集群中的数据传输往往具有突发性和高并发特征,网络架构需要具备更加合理的带宽分配、流量调度和拥塞控制能力。
      
      因此,人工智能数据中心的网络设计不能简单按照传统企业网络进行扩展,而需要围绕高带宽、低延迟、高并发和可预测性能进行重新规划。
      
      计算、网络、存储和内存需要从独立扩展转向协同设计
      
      人工智能基础设施过去很容易将GPU视为核心建设对象,但对于复杂人工智能工作流而言,单纯提高计算能力并不能保证整体性能同步提升。
      
      一个完整的人工智能任务可以抽象为多个资源环节:
      
      ·计算资源负责模型训练、推理以及数据处理;
      
      ·内存资源承担模型参数、缓存和中间数据的高速访问;
      
      ·存储资源保存训练数据、知识库、模型文件以及任务产生的数据;
      
      ·网络资源负责在计算节点、存储系统和数据服务之间传输信息。
      
      这些资源之间存在明显的耦合关系。
      
      例如,GPU数量增加后,如果网络带宽没有同步提升,GPU之间或GPU与数据源之间的数据交换可能成为瓶颈。类似地,如果存储系统无法满足高并发访问需求,计算节点可能因等待数据而降低利用率。
      
      因此,下一阶段的数据中心建设需要从“增加某一种资源”转向“优化整体资源链路”。
      
      网络架构需要适应更高密度的人工智能计算
      
      高性能人工智能集群通常采用分层、可扩展的网络架构,以满足大量计算节点之间的通信需求。脊叶式架构具有较好的横向扩展能力,可以通过增加叶交换机和脊交换机扩展网络规模,同时保持较为稳定的节点间连接路径。
      
      随着400G、800G甚至更高速率网络逐步进入人工智能数据中心,高速交换机、光模块和光纤布线也需要同步升级。
      
      网络设计需要重点考虑以下因素:
      
      ·端口速率与GPU集群规模匹配:避免计算资源增长后出现网络容量不足。
      
      ·交换容量满足高并发通信需求:确保大规模节点同时通信时不会形成明显瓶颈。
      
      ·低延迟数据传输:减少模型调用、数据检索和节点间通信产生的额外开销。
      
      ·高密度布线能力:在有限机架空间内支持更多高速链路。
      
      ·链路可靠性:通过冗余路径降低单点故障对持续工作负载的影响。
      
      ·网络可扩展性:为未来更高速率接口和更大规模集群预留升级空间。
      
      对于大规模人工智能基础设施而言,网络已经从传统意义上的连接层转变为计算系统的重要组成部分。
      
      存储架构需要从容量导向转向性能与数据访问并重
      
      智能体人工智能会产生大量数据访问需求,包括模型参数、知识库、文档、向量数据、任务上下文以及中间结果等。
      
      因此,数据中心不能仅关注存储容量,还需要综合考虑IOPS、吞吐量、访问延迟、并发能力以及数据生命周期管理。
      
      尤其是在检索增强生成等工作模式下,模型推理之前可能需要从多个数据源获取相关信息。如果数据检索速度较慢,即使GPU拥有足够的计算能力,整体任务执行时间仍可能受到限制。
      
      未来人工智能存储架构可能更加注重分层设计,将高频访问数据放置在更靠近计算资源的高速存储或缓存层,而将大规模历史数据放置在容量型存储系统中。
      
      这种分层方式可以在性能、容量和成本之间取得更合理的平衡。
      
      资源调度将成为人工智能基础设施的重要能力
      
      传统数据中心的资源调度通常围绕虚拟机、容器或固定应用展开,而智能体人工智能的工作负载具有更强的动态性。
      
      不同任务可能需要不同规模的GPU、CPU、内存和网络资源,并且资源需求会随着任务执行阶段不断变化。
      
      例如,一个任务在模型推理阶段可能主要消耗GPU资源,在数据检索阶段则更加依赖网络和存储,在数据处理阶段又可能转向CPU和内存资源。
      
      这意味着资源调度系统需要从静态分配逐渐转向动态编排。
      
      理想的人工智能基础设施应能够根据任务需求,对计算、网络、存储和内存资源进行统一调度,并根据实时负载进行调整。
      
      这种能力不仅可以提高资源利用率,也有助于降低由于资源过度配置造成的能源消耗和基础设施成本。
      
      持续运行要求更高的可靠性和可恢复能力
      
      智能体人工智能工作流通常包含多个相互依赖的执行步骤。任何一个环节出现故障,都可能影响整个任务。
      
      因此,数据中心需要建立更完善的可靠性体系。
      
      首先是网络层面的冗余,通过多路径连接降低交换机、链路或接口故障的影响。
      
      其次是计算资源的故障隔离和任务迁移能力。当某个计算节点发生异常时,系统应能够快速重新调度任务。
      
      再次是数据层面的可靠性。模型、知识库以及任务状态等关键数据需要具备合理的备份、复制和恢复机制。
      
      此外,基础设施监控也需要从单设备监控转向工作流级监控。除了观察GPU利用率、网络带宽和存储性能,还需要分析任务执行时间、节点间通信、数据访问延迟以及资源利用率之间的关联。
      
      高密度计算正在重新定义数据中心电力与散热设计
      
      人工智能基础设施的另一个显著变化是功率密度持续提高。
      
      高性能GPU服务器在单机架内可能形成远高于传统企业服务器的功率和热负荷。当计算密度不断提升后,传统依赖机房空气循环的冷却方式可能面临效率和容量方面的限制。
      
      因此,人工智能数据中心需要将电力系统与热管理纳入整体架构设计。
      
      电力侧需要关注高功率机架的供电能力、配电冗余以及电源转换效率;散热侧则需要根据设备功率密度选择合适的冷却方案,包括优化气流组织、冷热通道管理、液冷等技术。
      
      与此同时,能源效率不能仅通过降低制冷系统能耗来实现,还需要从整个基础设施层面提高资源利用率。
      
      如果GPU处于等待网络或数据的状态,即使计算芯片本身处于低利用率状态,相关供电、散热和机房基础设施仍然需要持续运行。因此,提高计算资源利用率本身也是降低人工智能基础设施能耗的重要方式。
      
      数据中心架构将从“AI就绪”走向“AI原生”
      
      过去的数据中心通常是在既有基础设施上增加GPU服务器,使其具备运行人工智能应用的能力。这种方式可以满足初期需求,但随着人工智能成为核心业务能力,简单叠加计算节点的模式将逐渐受到限制。
      
      未来的数据中心需要在设计阶段就考虑人工智能工作负载的特点。
      
      这意味着:
      
      ·计算节点与高速网络需要协同规划;
      
      ·网络架构需要适应高密度东西向流量;
      
      ·存储系统需要满足大规模并发数据访问;
      
      ·电力系统需要支持更高的机架功率密度;
      
      ·冷却系统需要适应持续增长的热负荷;
      
      ·资源调度平台需要实现计算、网络和存储的统一编排;
      
      ·监控系统需要从设备状态监控扩展到工作负载级性能分析。
      
      由此形成的并不是单纯“增加GPU”的人工智能数据中心,而是围绕人工智能工作流重新组织基础设施资源的系统。
      
      面向下一阶段人工智能基础设施的建设重点
      
      随着智能体人工智能不断发展,数据中心建设可以重点关注五个方向。
      
      1.构建可扩展的高速网络
      
      网络带宽需要与GPU规模和数据访问需求同步增长,并为更高速率接口预留升级空间。
      
      2.推动资源协同调度
      
      将计算、网络、存储和内存资源纳入统一资源池,根据不同工作负载动态调整资源配置。
      
      3.强化数据访问能力
      
      通过高速存储、缓存和分层存储架构降低数据访问延迟,提高模型和智能体工作流的整体执行效率。
      
      4.提升基础设施弹性
      
      通过冗余、故障隔离、自动恢复和智能监控,提高持续运行环境下的系统稳定性。
      
      5.将能源效率纳入架构设计
      
      从计算利用率、网络效率、供电系统和冷却系统等多个层面优化能源使用,而不是将节能局限于单一设备。
      
      总结
      
      从生成式人工智能到智能体人工智能,变化的不只是模型能力,更是人工智能工作负载本身的组织方式。
      
      当人工智能从一次性内容生成逐渐转向持续的任务执行,工作负载将更加依赖模型、数据、工具和基础设施之间的协同。计算能力依然重要,但决定整体效率的因素正在从单一GPU性能扩展到网络、存储、内存、资源调度、电力和散热等多个层面。
      
      因此,下一代数据中心建设的核心不应只是增加更多计算资源,而是建立能够适应动态工作负载的整体基础设施体系。通过高速互联、弹性资源调度、高性能存储、可靠架构以及高效能源管理,数据中心才能在不断变化的人工智能应用环境中保持可扩展性和长期运行效率。
      
      人工智能基础设施正在从“支撑模型运行”转向“支撑智能工作流”。这一转变将成为未来数据中心架构演进的重要方向。
      
      编辑:Harris
      
      

  •