咨询QQ:
      杂志订阅

      编辑

      网管

      培训班

      市场部

      发行部

电话服务:
 010-82024981
设为首页 | 收藏本页
人工智能助力自建数据中心
  • 现在越来越多的头部AI大模型公司正在自建数据中心,但这并不是唯一选择,很多中小公司仍然以租用云算力为主。这个趋势本质上是“租房子”和“买地盖房”的选择。
  • 一、用人工智能规划数据中心
      
      现在越来越多的头部AI大模型公司正在自建数据中心,但这并不是唯一选择,很多中小公司仍然以租用云算力为主。这个趋势本质上是“租房子”和“买地盖房”的选择。
      
      1、哪些公司在自建
      
      头部大模型公司是自建的主力,公开信息里能确认的主要有这些:
      
      OpenAI:首次自建数据中心,投资规模达200亿美元,用于训练和推理算力保障,降低对云服务商的依赖。
      
      DeepSeek:在内蒙古乌兰察布启动自建项目,总投资超50亿元,一期部署1万个机柜,配套2万张H800与昇腾910芯片,总算力10万P。
      
      xAI:马斯克旗下公司,已在田纳西州孟菲斯购置建筑打造第三座超大型数据中心,目标支持100万枚芯片上线,走“自研、自营、自供能源”的路线。
      
      智谱:完成一座1GW级别的数据中心建设并部分投入运营,全部采用国产AI芯片,主要用于GLM系列模型研发。
      
      科大讯飞:自建有业界一流的AI数据中心,为大模型训练平台提供硬件基础。
      
      华为:在贵州贵安、内蒙古和林格尔、安徽芜湖部署三大云核心枢纽,规模化建设3D数据中心。
      
      2、大模型公司要自建的原因
      
      成本控制:长期、高强度、可预测的算力消耗下,租用云服务的成本会越来越高。自建虽然前期投入大,但长期边际成本更低,不用再看云厂商“脸色”。
      
      算力自主可控:核心生产资料是算法、数据和算力。算力完全依赖云厂商,在资源紧张时可能被限流或中断,训练节奏和数据安全也会受限。
      
      稳定性与调度:自建集群可以保证训练任务的连续性,避免云上因“资源争抢”被强制中断,也能绕过API限流,提升响应速度。
      
      但自建并不是唯一答案。自建数据中心前期投入巨大,需要承担芯片采购、电力、冷却、运维等成本,如果模型需求低于预期或芯片迭代过快,可能变成“沉没成本”。很多公司仍然选择租用云算力,比如新点软件明确表示大模型所需算力为自建,但暂无自建算力中心计划。只是这类公司则提供基于自建数据中心的AIGC解决方案,供大模型企业按需使用。
      
      简单说:算力需求够大、资金够厚、追求自主可控的公司会倾向于自建;需求弹性大、前期投入有限的公司更适合租云。这不是一道选择题,而是一道成本与控制的权衡题。
      
      二、自建数据中心涉及的技术细节
      
      自建数据中心是一个系统工程,技术细节主要围绕供配电、制冷散热、综合布线、机柜布局和监控运维这几大块,核心目标是保证高可用性、控制PUE能效并兼顾未来扩展。
      
      1、供配电系统
      
      供电是数据中心的“心脏”,架构直接决定可用性等级。
      
      供电架构选择:中小规模预算有限可选“单路市电+UPS”;要求高可用建议“双路市电+ATS自动切换”;金融或核心业务建议“2N冗余架构”(完全独立双总线,单侧故障不影响运行)。可用性通常要求99.99%以上(年宕机不超52分钟),关键业务需99.999%(年宕机小于5分钟)。
      
      关键设备配置:UPS电池后备时间通常配置15-30分钟;柴油发电机燃料储备建议不少于满负荷运行8小时用量,作为市电中断后的长时保障。
      
      节能与负载率:UPS负载率在70%100%时效率最高,但很多机房实际负载率仅20%40%,可通过模块化休眠技术提升效率。变压器尽量靠近负荷中心以减少线路损耗。
      
      2、制冷与散热:制冷系统能耗约占数据中心总能耗的27%左右,是影响PUE的关键。
      
      方案选择逻辑:普通密度(机柜15-30kW以下)用精密空调+冷热通道封闭即可;高密度AI算力(单机柜50kW以上)需考虑液冷;气候寒冷地区可叠加“免费制冷”(利用室外冷空气或冷水)降低能耗。
      
      液冷技术要点:分为冷板式(间接接触,当前主流,PUE可至1.11.25)和浸没式(直接浸泡,散热更强,PUE可低至1.05以下)。液冷初期投资通常比风冷高约10%,但能支撑100kW以上机柜部署。
      
      环境控制目标:机柜进风温度建议18℃~27°C,相对湿度40%60%,制冷容量按总IT负载1.2倍设计并做N+1冗余。新建大型数据中心PUE要求不高于1.25,国家枢纽节点不高于1.2。
      
      3、机柜与综合布线:这部分决定空间利用率和后期维护便利性。
      
      空间与承重:机柜区域楼板承重需≥1000kg/m²,配电室和电池间需≥1500kg/m²;楼层净高建议≥3.5米。标准机柜尺寸600x1000mm(宽x深),100平米机房约可容纳50个机架。
      
      布线设计:光纤走独立光纤槽道,网线走金属网状桥架并用固线器分层固定;光纤进入机柜后接光纤配线架(常见96芯),网线接24口网络配线架;电源线、信号线和通信线必须分别铺设,不能共走同一线槽。
      
      冷热通道隔离:机柜按面对面、背对背排列,配合冷热通道封闭设计,减少气流短路,提升制冷效率。
      
      4、环境监控与运维
      
      动环监控:实时采集温湿度、烟感、水浸、门禁、电力参数,支持本地+远程告警,集中可视化管理。监控系统需能对接上层运维平台实现统一告警。
      
      运维前置:运维人员应参与前期规划设计,提前考虑后期维护通道、维护空间,避免设备靠墙太近、线缆布局不合理等后期难以修复的问题。
      
      自建数据中心最容易踩的坑是“重施工、轻规划”和“脱离实际定高指标”。建议先明确业务需求等级和功率密度,再选供电和制冷方案,避免建成后反复改造。下面将几个关键层面进行讨论。
      
      三、自建数据中心的供电技术
      
      自建数据中心的供电技术,核心就是一套从市电接入到服务器芯片的完整、冗余、不间断的电力输送与变换系统。目前主流和未来的技术方向可以概括为“传统交流UPS”和“新型高压直流”两大体系。
      
      1、传统且成熟的方案:交流UPS供电。这是目前绝大多数数据中心采用的方案,技术非常成熟,核心思路是“多路冗余+不间断电源”。
      
      市电引入:通常会引入两路独立的市电电源,每一路都要能承担数据中心的全部负载,互为备份。
      
      高压变配电:通过变压器将6kV/10kV/35kV的高压市电降压为380V/400V的低压电。
      
      备用发电:配备柴油发电机组,作为市电中断时的后备电源,要求在短时间内启动并带载。
      
      不间断电源(UPS):这是关键环节。UPS连接在市电和IT设备之间,当市电正常时,它负责稳压和给电池充电;当市电中断时,它会立即用电池的直流电通过逆变器转换成交流电,继续给设备供电,确保零中断。
      
      末端配电:经过UPS的电力,通过列头柜和机架内的电源分配单元(PDU),最终分配到每一台服务器。服务器电源模块(PSU)再将交流电转换为服务器内部需要的直流电(如12V、54V)。
      
      这种方案的优点是产业链成熟、可靠性高,通过2N或N+1等冗余架构可以满足极高的可用性要求。
      
      2、面向AI时代的新兴方案:800V高压直流(HVDC)。随着AI大模型爆发,单机柜功率从几十千瓦飙升至几百千瓦甚至兆瓦级,传统交流UPS在效率和传输能力上遇到瓶颈。因此,800V高压直流(HVDC)有望成为下一代数据中心供电架构的核心方向。
      
      核心理念:将市电交流电首先转换为800V的直流电,直接输送到服务器机柜,省去传统架构中多次交直流转换的损耗。
      
      技术优势:电压提升后,相同功率下电流大幅减小,从而显著降低线路损耗和铜缆用量,全链路能效可以提升到90%以上。
      
      演进路径:根据英伟达等公司提出的路线图,这个演进是分步走的,目前比较明确的路径是:
      
      过渡方案:UPS与HVDC并存,先将功率转换移出机柜。
      
      主流方案:采用“Sidecar”供电模式,将整流模块、电池备份等集成在独立的供电机架中,输出800V直流给相邻的IT机架。
      
      终极方案:使用固态变压器(SST),直接一步将中压电网(如10kV)转换为800V直流,替代传统的工频变压器和整流设备,实现更高的集成度和效率。
      
      3、关键技术与架构

    冗余架构:为保证可靠性,数据中心普遍采用2N、DR(分布冗余)、RR(后备冗余)等系统架构,确保任何单一设备故障都不会影响整体供电。
      
      新型设备:随着直流化趋势,直流断路器(如西门子的3WD/3VD)等保护设备成为关键,同时碳化硅(SiC)和氮化镓(GaN)等新材料被用于提升电源模块的效率和功率密度。
      
      空间革命:华为等厂商也在探索3D数据中心,将供电层、IT设备层垂直堆叠,缩短电力传输路径,提高空间利用率。
      
      四、自建数据中心的冷却技术
      
      自建数据中心的冷却方式,通俗讲就是怎么把服务器产生的热量排出去,让机房温度不要太高。现在主流的技术路线主要有三种:传统风冷、液冷和自然冷源(免费制冷)利用。
      
      1、风冷:最常见的基础方案
      
      风冷就是靠空调和风扇吹风降温,把冷风送到机柜前面,热风从后面排走。它分为直膨式空调、冷冻水型空调等,是目前应用最广的方式,对中小型机房或低功率机柜比较友好。但当单个机柜功率超过40千瓦后,风冷基本就到了物理极限,很难压住温度。
      
      2、液冷:高密度机房的趋势选择
      
      液冷是用液体(水、乙二醇混合液、氟化液等)直接或间接接触芯片带走热量,散热效率远高于空气。主要分两类:
      
      (1)冷板式液冷:在CPU、GPU上贴一块金属冷板,液体在冷板内部循环带走热量,不直接接触电子元件。改造成本相对低,是目前市场主流,占液冷市场约91%的份额。
      
      (2)浸没式液冷:把服务器整个泡在绝缘冷却液里,散热效率最高,单芯片解热能力可突破3000W,适合超高功率密度场景。
      
      液冷能将数据中心的PUE(电能利用效率)可降到1.1左右,甚至更低,而且能支持单机柜200千瓦以上的功率密度。像英伟达2026年6月发布的VeraRubin平台,已经实现100%全液冷,冷却液入口温度高达45℃,PUE约1.15。
      
      2026年5月四部门联合印发的《促进人工智能与能源双向赋能行动方案》要求,新建大型AI智算中心须配套液冷,并在2028年前完成高功耗风冷机房的改造。如果你自建的机房要上高功率AI算力,液冷基本是必须考虑的。
      
      3、免费制冷:利用自然冷源省电
      
      免费制冷(freecooling)不是真的不花钱,而是用室外低温空气或河水、湖水、海水等自然冷源替代机械制冷,减少空调压缩机的运行时间。当室外温度低于设定阈值时,系统自动切换到自然冷源模式,能耗大幅下降。但在炎热天气或极端情况下,仍需要机械制冷兜底。
      
      4、风液融合:兼顾两者的过渡方案
      
      如果你同时有通用算力和高密度AI算力,可以考虑风液融合架构。它让风冷和液冷共用一套室外冷源,根据负载智能调节风液比例,既支持高密机柜液冷,也能用风冷处理普通机柜,年均PUE能做到1.1左右,比较适合业务需求不确定的场景。
      
      5、给自建机房的实际建议:
      
      先算功率密度:单机柜功率低于10-20千瓦,传统风冷完全够用;超过40千瓦,直接考虑液冷。
      
      结合当地气候:北方寒冷地区可以优先利用免费制冷,降低全年能耗;南方炎热地区则更依赖机械制冷,液冷的节能优势会更明显。
      
      预算和改造成本:冷板式液冷对现有架构改动小,成本相对可控;浸没式效率最高但初期投入大,适合新建的高密AI机房。
      
      五、国产芯片在自建数据中心中面临的挑战
      
      国产芯片虽然是耗能主体,但在自建数据中心里已经从“备选”变成了“必选”,既是政策要求,也是头部AI公司算力自主可控的核心抓手。
      
      一方面,政策在强制推动国产化:七部委发布的《2026-2028算力基础设施建设行动方案》明确,9月起新建国资、政务智算中心算力硬件国产化采购比例不低于75%,并叠加最高30%的设备采购财政补贴。这意味着新建的官方背景数据中心,国产芯片是硬性指标,不再是可选项。
      
      不过客观地看,国产替代的规模和速度还不足以完全填补高端算力缺口。高端算力芯片、先进封装、高速互联等关键环节仍存在对外依赖,这是产业链供应链安全的潜在风险点。所以国产芯片在自建数据中心的地位,可以概括为:政策上必选、商业上大规模落地、但供给总量和高端性能仍有缺口。
      
      但自建数据中心更倾向用国产芯片。自建和租云是不同的算力获取方式。租云灵活但难保证长期稳定供给,自建数据中心则是在追求算力供应的确定性、软硬件协同和成本三者间的平衡。尤其在被限制高端GPU后,国产芯片成了大模型公司持续训练的确定性选择,这也是智谱、DeepSeek愿意砸重金自建、提前锁货的核心原因。
      
      国产芯片在自建数据中心里,目前最核心的挑战已经不是“买不买得到”,而是“好不好用、能不能稳定跑起来”。简单说,硬件差距在缩小,但软件生态和工程化能力成了新的瓶颈。
      
      1、性能与生态的双重瓶颈
      
      软件生态是最大短板:很多开源大模型和行业工具原生不适配国产芯片,迁移到国产集群需要专门的算法团队重写算子、做适配,人力成本高、调试周期长,模型一迭代还得重来。这导致开发者习惯用成熟框架,应用少,反过来又影响企业采购意愿,形成负向循环。
      
      单芯片性能仍有差距:与国际先进水平比,国产AI芯片在性能、功耗上仍有差距,先进制程(7nm及以下)的制造工艺和关键材料(如高端光刻胶、大硅片)仍依赖进口或受限。
      
      2、系统级互联与数据调度挑战
      
      算力“空转”问题突出:大规模AI集群中,成千上万颗芯片需要高频交换数据,网络拥塞和传输时延会让GPU等待数据,出现算力空转——硬件纸面算力不等于实际产出算力。
      
      互联技术成新战场:AI算力竞争已从单芯片性能转向“连接能力”,芯片间怎么高速传数据成了新瓶颈。国产硅光、DPU(数据处理器)等互联技术虽在推进,但距离大规模商用还有制造平台、行业标准等几道坎。
      
      3、产业链与成本现实约束
      
      关键环节仍被“卡脖子”:从光刻机、光刻胶到EDA软件、HBM存储,再到12英寸大硅片和电子特气,多个高端环节国产化率依然很低,比如12英寸大硅片国产化率仅约10%,EUV光刻胶几乎空白。
      
      成本与可靠性门槛高:国产芯片集群的硬件上架快,但适配模型、调试算子、性能调优往往要耗费更长周期和更多人力。同时,数据中心对芯片的可靠性、可用性、可服务性(RAS机制)要求极高,这是商用准入的底线。
      
      简单说,自建数据中心用国产芯片,硬件已基本“能用”,但“好用”还差在软件栈、互联生态和产业链成熟度上。建议先从小规模试点或与业务解耦的场景切入,逐步积累适配经验。
      
      编辑:Harris
      
      

  •