大规模大模型训练,需要成百上千张显卡协同工作,对机房内部网络、低时延互联要求极高。部分智算中心建设阶段优先买服务器硬件,压缩网络建设预算,沿用普通传统数据中心的网络架构。硬件虽然摆满机柜,但多卡协同通信效率大幅下滑,集群整体实际效能直接腰斩。哪怕单张显卡价格再便宜,综合使用成本反而变高,大厂和 AI 创业团队不愿意接手。
错配三:只建硬件大楼,缺少软件生态与运营服务
很多投资方把智算中心理解成 “租机柜、租显卡” 的资产生意,以为把服务器买回来通电就可以坐等收钱。但 AI 客户要的不只是一堆裸金属服务器,而是完整可用的服务:成熟调度平台、模型框架适配、问题运维排障、行业解决方案。不少机房只有硬件,没有配套软件栈,客户过来之后,大量适配工作需要自己完成。客户看完现场就直接离开。就好比投资修好了豪华酒店大楼,但是没有保洁、管家、配套服务。客户要的是全套住宿服务,而不只是一间空房间。
AI 算力行业出现的魔幻反差:高端显卡一卡难求,部分新建智算中心却机柜空转。根源不是算力总量过剩,而是结构性错配:芯片型号、网络互联、软件运营服务跟不上真实业务的需求。
硬件大楼只是基础,真正值钱的是让硬件产生价值的整套软件、调度与落地服务。风口狂奔的时候大家热衷于砸钱建基建,浪潮退潮之后才会看清,设备不等于竞争力。对投资者和从业者而言,比起盲目抢占硬件资源,看懂真实业务需求、补齐软件和服务短板,才是行业长期发展的关键。