新闻动态

  • 首页Our Projects国产算力发展新里程,科大讯飞强化AI与底层算力协同

国产算力发展新里程,科大讯飞强化AI与底层算力协同

2026-09-14 3947

近年来,国产AI算力显著提升。7月时,全国第一套十万卡AI超算集群投入使用,而到9月初,无锡的万卡级智算中心一期的2000张摩尔线程MTT S5000 GPU已全面运作,其集群算力基本满载。国产芯片正向更高水平的训练基础设施迈进。

随着集群规模的扩大,如何评估这些芯片的实际训练能力也变得更加复杂。卡数的增加伴随着系统复杂度的提升,一些在小规模训练中不明显的问题在万卡集群中会加剧。例如,不同芯片上的算子效率差异、通信延迟以及不断增加的故障率等,都成为日常运维的新挑战。因此,评估算力系统不仅要考虑芯片数量和性能,还需关注算子效率、通信效率、并行调度、故障恢复及软件栈的协同。

值得关注的是,科大讯飞在9月7日发布了星火X2.5模型。该模型采用MoE架构,参数规模为293B-A30B,能够提升代码和智能体能力,并支持200多种语言,在语言理解和推理任务上表现出色。其中,万卡规模的910B集群为模型的训练提供了基础,而推理则基于国产平台,采用多步投机解码以提升效率。 千亿球友会

随着代码和工具调用能力的提升,星火X2.5已开始参与NPU算子优化,使AI也能为底层算力的优化做出贡献。这次大规模训练提供了进一步探讨国产万卡算力在算子效率、上下文处理、通信和训练稳定性等方面面临的具体挑战的机会。

在大模型训练中,可以将其比作一座大型工厂。万卡集群中的芯片如同成千上万的工人,显存用于存放模型参数和数据,而通信网络则是不同芯片间的数据运输通道。当规模扩大至万卡时,计算速度、显存容量和系统的稳定性都会直接影响整体效率。训练与推理的需求不同,这也是推理适配与国产训推之间的重要区别。

科大讯飞技术团队总结了万卡训练面临的难题:快、装得下、流畅和稳定。首先是“快”,芯片数量决定了工人的多少,而算子效率则影响每个工人的工作能力。Attention核心计算的算子效率经过优化提升了2倍。针对训练任务的分工,星火X2.5采用动态负载均衡方案,使得任务分配更加均衡,提高了长文本训练效率。 千亿球友会

接下来是“装得下”。模型与上下文越大,处理的数据需求随之增加,因此需要有效控制显存压力。通过引入稀疏注意力机制和跨层共享索引,星火X2.5在长程任务上减少了计算和资源的开销。

最后是“流畅”。在万卡规模下,通信成为新的瓶颈。集群需要持续共享数据,数据传输的高效性关乎训练的整体效率。针对超长序列训练的通信开销,星火X2.5引入通信压缩、分层通信和计算并行的方式来提升训练效率。

about image

订阅我们的时事通讯

获取更多更新