|
被美国限制高端 GPU 算力多年,快速迭代的国产模型究竟在靠什么持续训练? 彭博社最新披露,智谱已经完成一座 1GW 级别的数据中心建设,并开始部分投入运营。该中心全部采用国产 AI 芯片,主要用于 GLM 系列模型研发。智谱目前还运营着多个万卡计算集群,单个集群搭载的芯片均超过 1 万颗。 1GW 的供电规模,大致可以同时满足 75 万户家庭的用电需求。以此计算,这座数据中心已经跻身中国 AI 实验室/独立模型企业建设的最大型算力基础设施之列。该消息来自一名匿名知情人士,具体芯片型号、供应商和设备总量暂未披露,智谱方面暂未对此置评。 近期,智谱在算力上下游布局频频。 据多家媒体报道,智谱已斥资数亿元收购国产异构算力软件公司“中科加禾”。后者源自中科院计算所编译实验室,核心能力覆盖编译器、虚拟指令集、Runtime 和推理引擎。据悉,智谱已经完成这笔收购,但截至目前,交易双方尚未发布正式公告。 更早前,The Information 披露,智谱正在与国内芯片设计公司接触,评估合作开发定制 AI 芯片的可能性。该项目仍处于早期讨论阶段。 结合上述消息观察,智谱正试图构建一套**完全脱离英伟达体系的算力基础设施:**自建 1GW 国产数据中心,解决的是稳定的算力资源从哪里来;收购中科加禾,解决的是不同国产芯片如何更高效地运行 GLM;自研定制 AI 芯片,则进一步指向按照自身模型负载,来优化长期推理成本。 与此同时,DeepSeek 也在推进类似布局,包括组建算力运营团队支持乌兰察布自建的算力中心,增设芯片设计人员,布局面向推理场景的自有 AI 芯片。 可以看到,独立模型企业正在从算力的购买者,逐步变成算力的运营者、改造者,并试图参与定义下一代算力。 三线并进智谱此次曝光的三个动作,分别落在算力产业链的不同位置。 最底层是物理算力供给。 过去,独立模型公司主要通过云厂商、运营商或第三方算力服务商获得 GPU 资源。好处是前期投入较轻,可以根据模型训练和推理需求灵活采购;问题则是芯片供应、集群排期、服务价格和扩容速度,始终掌握在外部平台手中。 1GW 国产数据中心开始部分投运,意味着智谱正在获得更大规模、更稳定的长期资源池。相比一次性租用几千张卡,它更接近一套能够持续服务模型预训练、后训练和大规模推理的基础设施。 第二层是算力软件。 国产芯片不是简单地插进服务器,就能直接承接原本运行在英伟达平台上的模型。不同厂商的芯片架构、编程环境、算子库、内存管理和通信机制并不相同,同一款模型迁移到不同硬件上,往往需要重新适配和调优。 中科加禾的核心价值,恰好位于模型和芯片之间。 公开资料显示,其团队曾参与龙芯、神威、寒武纪、华为昇腾等国产芯片的编译器研发,试图通过虚拟指令集、编译器和 Runtime,为不同硬件提供较为统一的软件接口。 当然,这并不意味着不同品牌的芯片就可以毫无障碍地混装在同一个大规模训练任务中。跨芯片协同还涉及集合通信、精度一致性、网络拓扑和容错等复杂问题。 更准确地说,中科加禾希望降低同一个模型在不同国产芯片之间迁移、部署和性能优化的成本,把分散在不同硬件平台上的理论算力,尽量转化成模型真正能够调用的有效算力。 其 SigInfer 推理引擎宣称,在特定测试场景中可将推理时延最高降低 74 倍、吞吐率最高提升 3 倍、能效比提升 1.46 倍。上述数字目前主要来自公司测试,尚不能直接等同于智谱生产环境中的实际效果,但哪怕其中一部分能够兑现,也会极大程度优化智谱的Token 算力成本。 第三层则是芯片设计。 与训练相比,推理工作负载通常更加稳定。模型结构、参数规模、内存访问方式和计算精度相对确定,因此更适合通过定制芯片进行专项优化。 据了解,智谱目前只是评估与国内芯片公司合作阶段,暂无披露合作方、芯片架构、流片时间和量产计划。而真正值得关注的是,智谱已经开始思考一个更上游的问题:与其让 GLM 长期适应市场上已有的芯片,能否让未来的芯片架构反过来适应 GLM? 算力承压智谱密集补齐底层算力设施能力,直接原因并不神秘:模型调用量增长得太快,基础设施已经多次接近承载上限。 今年 1 月,随着 GLM Coding Plan 用户快速增长,智谱宣布暂时限量销售该产品,每日新增购买额度被压缩到此前的 20%。智谱当时明确表示,部分用户在工作日下午的调用高峰期遭遇并发限流、模型速度下降等问题,需要优先为老用户腾出算力资源。 到了 3 月,GLM-5 上线后,Coding Agent每日调用量已经达到数亿次。与普通聊天相比,Coding Agent往往需要读取更长的代码上下文,持续生成大量 Token,并反复调用搜索、执行和调试工具,对推理系统的压力高出一个量级。 压力很快从“速度变慢”,蔓延到了模型输出质量。 一些用户发现,GLM-5 在复杂任务中偶尔会出现乱码、复读和生僻字,看起来像是模型突然“变笨”。但智谱反复回放相同请求后发现,这些异常无法稳定复现,模型权重本身并没有发生变化。 经过数周排查,问题最终被定位到高负载下的推理状态管理。智谱在博客《Scaling Pain:超大规模 Coding Agent 推理实践》中详述了 KV Cache 错配、竞态冲突等成因,以及缓存分层与调度修复方案。 这次故障也暴露了一个容易被忽视的事实:模型能力不只由参数规模决定,也受模型的推理系统性能影响。 同一组模型权重,在低负载环境中可能输出正常;一旦进入高并发、长上下文和长任务场景,缓存、调度和通信系统的细小错误,也能让用户感知到模型质量下降。 GLM-5.2 上线后,这种压力继续放大。The Information 报道称,该模型上线 Vercel 平台首周,日均 Token 使用量增长 27 倍。与此同时,智谱还在与更多国产硬件平台进行适配,以满足持续上升的算力需求。 类似的高并发挑战也发生在近期推新的 Kimi 和 Qwen 身上。 Kimi K3 发布后,用户请求量在 48 小时内大幅超过预期,逼近现有集群的承载极限。月之暗面随即暂停 C 端新用户订阅,将现有算力优先分配给已付费用户,并计划随着新增资源到位,分批恢复订阅名额。公司还准备将通用会员与 Coding 会员拆分,以便根据不同任务的算力消耗,更精细地分配资源。 刚刚亮相的 Qwen3.8-Max 总参数达到 2.4 万亿,多名开发者表示在 Token Plan、Qoder 等入口均提示访问受限。官方解释主要因为触发了 API 平台的并发限流(Rate Limit)或配额不足。 链条上探算力压力之所以越来越难以回避,与大模型公司的商业模式有关。 传统软件产品完成研发后,新增一名用户的边际成本通常很低。但大模型每回答一次问题,都要消耗真实的芯片、电力和内存资源。 用户越多,Token 调用量越大,推理成本也会同步上升。模型公司收入增长,并不意味着利润率会随之改善。 智谱 2025 年的收入由 3.12 亿元增长至 7.24 亿元,同比增长 131.9%;其中,云端 API 等部署收入增长 292.6%,达到 1.9 亿元。2026 年第一季度,智谱的 API 调用量又增长约 400%,公司随后将 API 价格提高 83%。 但另一面是,智谱 2025 年销售成本由 1.37 亿元增至 4.28 亿元,同比增长 213.3%,明显快于收入增速。公司在财报中明确表示,成本上升主要来自业务扩张带来的计算服务费增加。 同期,智谱研发支出达到 31.8 亿元,全年净亏损 47.18 亿元,高于 2024 年的 29.58 亿元。研发支出增长的原因之一,同样是向第三方算力供应商支付的计算服务费用增加,以及对更先进模型训练基础设施的投入。 这也解释了智谱为什么要向算力上游走。 如果长期完全依赖外部算力供应商,模型公司每一次业务增长,都会同时增加采购成本,并受到资源排期和外部价格变化影响。 自建数据中心当然不是免费的午餐。 它意味着公司需要承担芯片采购、电力、冷却、网络、设备折旧和长期运维成本。如果模型需求低于预期,或者芯片迭代速度过快,巨额基础设施也可能变成沉没成本。 但当模型调用量达到足够大的规模后,自建基础设施的价值便不只是“更便宜”,而是在算力供应的确定性、软硬件协同、成本三者之间寻求一个更大的平衡。 买算力解决的是眼前需求,控制算力决定的是模型公司未来能不能持续扩大规模。有理由相信,在智谱、DeepSeek 之后将会有更多的模型独立企业投入重点资源与资金在算力设施领域。 政策层面,相关补贴也正在从芯片研发,进一步深入到算力项目的实际采购环节。 此前有媒体报道,获得国家资金的新建数据中心,被要求只使用国产 AI 芯片。彭博社透露,一项未来五年约 2 万亿元的全国 AI 算力基础设施方案有望落地。 当前,算力一张网被纳入到“十五五”开局之年的重要方向。在《“十五五”规划纲要》中,“全国一体化算力网”被列为国家级重大工程,强调要深入推进东数西算工程,构建多层次算力设施体系和全国一体化算力网,让算力像“水电”一样随取随用,从而全面支撑人工智能与数字经济的高质量发展。 这意味着国产芯片不再只依赖零散试点,而是将进入长期、成规模的基础设施采购体系。
|