京东云与摩尔线程共建10万卡AI工厂
京东云宣布与摩尔线程规划建设10万卡规模的AI工厂,旨在打造大规模智算基础设施,满足AI大模型训练与推理需求,推动国产算力生态发展。
驱动中国9月9日消息,京东云与国产GPU厂商摩尔线程宣布达成战略合作,双方将共同规划建设一座规模达10万卡级别的AI工厂。这一合作标志着国内智算基础设施领域再次迎来重量级玩家,也意味着国产算力在超大规模集群部署上迈出关键一步。
所谓AI工厂,并非传统意义上的制造车间,而是以GPU算力集群为核心、面向人工智能训练与推理任务的大型数据中心。10万卡的规模意味着该工厂将拥有极为庞大的并行计算能力,足以支撑千亿甚至万亿参数级别的大模型训练,也可为众多行业提供高密度的推理服务。在当前大模型竞赛白热化的背景下,算力已成为制约AI发展的核心瓶颈,京东云与摩尔线程的联手,显然意在从底层基础设施层面破解这一难题。
从合作双方的角色来看,京东云拥有丰富的云计算运营经验、大规模数据中心管理能力以及广泛的产业客户资源,而摩尔线程则是国内少数具备全功能GPU研发能力的芯片企业,其产品覆盖图形渲染、AI计算、科学计算等多个领域。此次合作并非简单的买卖关系,而是涉及算力集群设计、软硬件协同优化、运维调度等全链条的深度协作,双方将共同探索国产GPU在超大规模场景下的工程化落地路径。
值得关注的是,10万卡AI工厂的规划背后,折射出国内智算中心建设正在从“千卡级”向“万卡级”甚至“十万卡级”跃迁的趋势。过去几年,国内多地陆续上马智算中心项目,但多数规模在数百至数千卡之间,能够达到万卡级别的项目屈指可数。而10万卡的体量,不仅考验GPU芯片的供应能力,更对网络互联、存储架构、散热设计、电力配套以及调度系统提出极高要求,任何一个环节的短板都可能导致整体算力效率大打折扣。
从行业意义上看,这一项目若顺利落地,将显著提升国产算力在超大规模集群中的可用性与成熟度。长期以来,国内高端AI训练市场几乎被英伟达的GPU所垄断,国产芯片虽在性能上逐步追赶,但在生态适配、集群稳定性等方面仍有差距。京东云与摩尔线程的联合,有望通过真实的大规模应用场景,倒逼国产GPU在稳定性、互联效率以及软件栈方面加速迭代,进而推动整个国产AI算力产业链的完善。
此外,这一合作也契合了当前国家层面对于算力基础设施自主可控的迫切需求。在外部环境不确定性增加的背景下,构建以国产芯片为核心的智算底座,不仅是商业选择,更关乎产业安全。京东云作为头部云厂商,选择与国产GPU厂商深度绑定,某种程度上也为其他云服务商和大型企业提供了可参考的范本——即通过规模化采购与联合研发,帮助国产算力跨越“能用”到“好用”的门槛。
不过,10万卡AI工厂的建设并非一蹴而就,从规划到落地仍需跨越诸多现实障碍。首先是芯片供应与良率问题,摩尔线程目前的产能能否支撑如此大规模的交付,尚需时间检验;其次是电力与能耗指标,10万卡GPU满负荷运行时的功耗将极为惊人,选址与能源配套至关重要;再者是集群的运维复杂度,万卡级集群的故障管理、任务调度与数据吞吐,都需要全新的技术方案。这些挑战意味着,双方的合作大概率会分阶段推进,先以数千卡或数万卡的规模验证技术路线,再逐步扩容。
对于京东云而言,此次合作也是其强化AI算力布局的重要落子。近年来,京东云在产业云、混合云等领域持续发力,但面对阿里云、华为云、腾讯云等竞争对手在AI大模型领域的激烈角逐,京东云需要更具差异化的算力资源来吸引客户。与摩尔线程共建AI工厂,既能为自身云服务提供底层算力支撑,也能对外输出算力租赁与定制化服务,从而在智算市场中占据一席之地。
总体来看,京东云与摩尔线程的10万卡AI工厂规划,是国产算力发展历程中的一个标志性事件。它既反映了市场对大规模智能算力的旺盛需求,也展示了国产GPU厂商向上突破的决心。尽管前路不乏挑战,但这一合作的示范效应,或将带动更多产业链上下游企业投身于国产智算生态的建设之中。