9月30日,DeepSeek正式公开了面向华为昇腾平台的基础设施组件,包括TileLang算子编程语言及其编译支持、计算库和分布式通信库。该公司强调:“所有组件都与之前面向英伟达平台发布的开源组件完全对应。”
DeepSeek正在系统性地将支撑自身模型研发的核心工具和算子能力扩展至昇腾平台。双方的合作已从模型适配层面,进一步深入到训练与推理所依赖的基础软件领域。
官方同时透露,DeepSeek与华为正联合推进基于昇腾950的128卡超节点方案,并对计算和通信环节进行了深度优化。
在这套开源组件中,TileLang扮演了最关键的角色。
大模型研究中的新想法,需要通过算子转化为芯片可执行的计算。算子开发越复杂,研究者验证新结构、优化训练效率所需的时间就越长。DeepSeek对TileLang的期望是,让开发者能用更简洁的语言编程,同时保持充分利用芯片性能的能力。
根据DeepSeek的介绍,相比CUDA,TileLang能简化代码逻辑、提升开发效率;而与其他同类高级语言相比,其编程模型更能充分发挥芯片特性。这条路线先在英伟达平台得到验证,目前已承载V4系列模型训练中大部分算子的实现,成为DeepSeek开发高性能算子的核心工具。
此次发布的昇腾版本封装了底层Ascend C指令。DeepSeek表示,目前训练中使用的每一个TileLang算子,在昇腾上都有对应的高性能实现。
这一进展的意义在于,DeepSeek能够将已熟悉的研发工具延伸到另一种硬件上,减少为不同平台重复开发的负担。昇腾所获得的支持,也更贴近模型团队自身的训练需求。
但编程工具只是其中一个环节,模型还需要高效执行具体计算,并在多张卡之间交换数据。
因此,此次开放的组件还包括加速矩阵运算的DeepGEMM、处理跨设备通信的DeepEP,以及覆盖向量计算与访存、稀疏注意力,以及用于注意力索引和采样的Top-K选择等操作的TileKernels、FlashMLA和DeepSelect。它们为常见任务提供了可复用的实现,让开发者不必逐项从头优化。
“一一对应”也因此有了实际含义。部分项目已对齐上层接口,例如TileKernels支持同一套Python接口在英伟达GPU与华为NPU上运行,底层实现根据硬件选择。
不过,接口可以复用,性能仍需针对硬件进行打磨。DeepSeek在公告中感谢华为团队给予“毫无保留的大力支持”,双方围绕128卡超节点共同优化计算与通信,正是为了让这些软件能力在具体系统中发挥作用。
DeepSeek称,多项关键测试用例的性能已接近硬件上限。这些成绩仍属于特定测试条件下的结果,但表明双方的工作已进入性能深度优化阶段。
在此次进展之前,昇腾生态已围绕DeepSeek模型开展过多轮适配。
2025年8月,DeepSeek发布V3.1时,解释其UE8M0 FP8设计面向即将发布的下一代国产芯片。虽然未点名华为,但这一表态说明,国产硬件需求已开始进入模型团队的技术设计考量。
2025年9月29日,DeepSeek-V3.2-Exp发布,引入了稀疏注意力机制,并开放了相关算子实现。同一天,TileLang-Ascend开源,围绕昇腾建设高级语言开发能力的工作由此公开。
2026年4月24日,V4预览版发布,昇腾适配已延伸至推理和训练侧。开放原子开源基金会披露,相关实践包括推理优化、Ascend C融合算子,以及训练优化和续训练;TileLang-Ascend也发布了V4算子。
此次DeepSeek明确将适配范围对齐自家训练使用的TileLang算子,并将计算与通信组件成套开放,同时披露了与华为围绕昇腾950开展联合优化的进展。
从已发布模型的部署适配,到面向新结构的算子优化,再到此次基础设施组件开放,昇腾对DeepSeek的支持正进一步深入模型研发所需的软件层。
9月24日,腾讯科技报道,DeepSeek规模为500亿元的第二轮融资已接近结束,但部分审核仍在进行,具体落地时间尚不确定。路透社此前也报道,DeepSeek已聘请中信证券筹备潜在的科创板IPO,上市时间及募资规模尚未确定。
资金可以支持研发和基础设施投入,但新增硬件能否转化为有效算力,还取决于软件适配与运行效率。
据The Information报道,梁文锋在近期投资者会议上表示,DeepSeek将超过70%的算力用于模型训练,留给推理的算力不足30%。这也解释了,为训练所依赖的核心工具增加硬件选择,具有怎样的现实分量。
对DeepSeek而言,昇腾上的工具与组件越完善,未来选择算力平台时,需要重新投入的工程成本就可能越低。对华为而言,与模型团队共同优化,有助于让芯片软件更快跟上模型结构变化,并将适配经验用于后续产品。
开源又使这种合作具备向外扩展的可能。DeepSeek表示,希望TileLang昇腾版本能为更多AI芯片建立高可用软件生态起到示范作用。如果其他团队可以复用这些工具,更多国产芯片承接前沿模型的门槛也有望降低。
从组件开源到稳定承担大规模生产任务,仍有工作要做。DeepEP昇腾版还列有开发中的功能,此次公告也未披露V4已在昇腾上完成全流程大规模训练,但可以看出DeepSeek正与华为一起完善一条能够持续支持模型研发的硬件路线。
本文来自微信公众号“腾讯科技”,作者:值得关注的,36氪经授权发布。