独立报道 · 深度阅读

摩尔线程宣布完成 Kimi K3 适配,国产 GPU 支持万亿参数大模型推理能力

根据公开资料,月之暗面于7月28日开源了全球首个3万亿级别模型Kimi K3。摩尔线程基于其AI训推一体智算卡MTT S5000及MUSA软件栈,宣布完成了Kimi K3的Day-0支持。此次适配涉及模型结构解析、核心算子等多个层面,展示了国产GPU在处理超大规模模型方面的技术能力。

月之暗面于7月28日正式开源了其2.8万亿参数模型Kimi K3,并同步发布了相关的模型权重与技术报告。这一事件标志着一个重要的里程碑,因为根据公开资料显示,Kimi K3被定位为全球首个开源的3万亿级别模型,总参数量达到2.8万亿。

在算力适配层面,摩尔线程宣布基于其AI训推一体智算卡MTT S5000以及MUSA软件栈,完成了对Kimi K3的Day-0支持。这表明摩尔线程将国产GPU生态与前沿的大模型能力进行了深度结合。

此次技术适配工作是系统性的工程。根据公开资料,摩尔线程完成了包括模型结构解析、权重加载、核心算子、缓存管理以及分布式运行链路在内的多个环节的适配工作。此外,为了支持Kimi K3复杂的架构特性,SGLang-MUSA同步适配了Hybrid State Pool,用于专门管理KDA递归状态与卷积状态。

更深入的技术细节展示了摩尔线程对模型复杂结构的理解和处理能力。例如,摩尔线程完成了DeepEP的适配工作,以支持Stable Latent MoE架构中包含的896个专家和TopK 16激活规模。同时,Kimi K3本身的混合注意力主干结构也十分复杂,由69层KDA和24层Gated MLA构成。

从硬件基础来看,MTT S5000是摩尔线程基于第四代“平湖”芯片架构打造的AI训推一体智算卡。该智算卡的性能指标令人关注,根据公开资料显示,MTT S5000单卡AI稠密算力最高可达1000TFLOPS。

在模型部署和推理效率方面,摩尔线程展示了其优化能力。公司设计了加载期在线逐层量化方案,这一特性意味着用户无需进行耗时的离线转换过程,即可快速启动模型的推理任务。

时间轴的梳理显示出技术迭代的紧凑性:首先是月之暗面于7月28日开源Kimi K3;随后,摩尔线程宣布完成适配工作,将国产GPU算力与该超大规模模型对接起来。这构成了一个从模型发布到底层硬件支持落地的完整链条。

背景分析方面,此次事件的意义在于推动了国内AI计算基础设施与前沿大模型技术栈的深度融合。以往处理万亿参数模型的门槛极高,摩尔线程通过适配MTT S5000,为国产GPU生态系统提供了一条可落地的路径。

影响分析来看,此次适配的成功,意味着使用MTT S5000的计算环境能够直接、高效地支撑运行如Kimi K3这样参数量巨大的模型。这对于推动国内AI算力自主可控和加速行业应用落地具有重要的示范意义。

读者提示:对于关注国产AI芯片生态发展的读者而言,可以重点关注摩尔线程后续在更多前沿大模型上的适配进展,以及MTT S5000在实际商业场景中的性能验证报告。

信息来源

本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。