据IT之家9月20日报道,中电信人工智能科技有限公司已于9月17日正式推出新一代星辰大模型Xing4.0-29B-A4B。该模型主打复杂任务理解、任务规划、工具调用与自主执行,具备长上下文处理能力,适用方向包括代码开发、数据分析、办公自动化以及生活服务。

华为中国官方随后于9月19日晚对外披露更多技术细节:Xing4.0-29B-A4B总参数规模为29B,激活参数只有4B,是国内首个在昇腾Atlas 900 A3 SuperPoD液冷超节点与昇思MindSpore框架上完成训练的百亿参数大模型,并针对复杂工程任务做了深度优化。模型采用新一代架构设计,长程任务处理与多步骤执行能力进一步增强,能够围绕用户给定的目标自行规划任务路径、调用工具并完成复杂任务。华为方面表示,中高阶代码生成与智能体执行,实质上是对长程上下文理解、复杂推理规划以及工具调用协同能力的综合检验,华为团队与中电信团队从数据体系、模型架构、训练工程到强化学习展开了系统性攻坚。

数据基座覆盖预训练与后训练全生命周期

在数据环节,双方围绕预训练与后训练的全生命周期,搭建了涵盖数十万亿词元的数据体系。预训练阶段完成了PB级多源异构数据清洗,并引入大量智能体行为轨迹与结构化知识图谱;后训练阶段则搭建高并发沙箱容器,构建端到端长程任务合成数据,同时建立自动化校验机制,以保证数据正确性。

架构为长程Agent任务定制,采用分阶段递进训练

架构层面,Xing4.0-29B-A4B专为长程Agent任务设计:MLA多头潜变量注意力用于压缩KV缓存;MT多Token预测提升生成连贯性;mHC流形约束超连接用于缓解训练中的数值不稳定问题;Muon与QK-Clip优化器则保障训练稳定。训练采用分阶段递进策略,序列长度从4K逐步扩展至32K、128K直至256K,系统性地构建长程能力。

昇腾超节点软硬协同,训练性能提升96%

工程优化方面,该模型在昇腾超节点集群上通过多层次软硬件协同优化,实现了96%的训练性能提升,接近翻倍。具体来看:基于MindSpore全栈适配mHC多残差连接与DSA长序列机制,针对细粒度MoE(64路由/Top4激活),通过专家负载均衡、Grouped GEMM、通信计算重叠以及DVM图算融合,吞吐量提高32%;层级与算子级选择性重计算又带来19%的额外提升;自研Ascend C mHC融合算子解决了Sinkhorn碎片化问题,计算效率提升30%,整网吞吐再增加25%。

多专家强化学习落地,昇腾支持40+头部模型原生训练

多专家强化学习方面,该模型基于昇腾生态完成Slime强化学习框架适配,面向Agent、Coding、Reasoning开展多专家强化学习训练,并通过MOPD技术实现多专家能力的高效融合,进一步改善复杂推理与智能体任务表现。华为同时透露,昇腾目前已支持40+个业界头部模型完成原生训练,并且是国内唯一支持商用大规模预训练、训练落地SOTA大模型的厂商。

据介绍,Xing4.0-29B-A4B已对外开源,地址分别为:GitHub(https://github.com/XingChen-AGI/Xing4.0-29B-A4B)、HuggingFace(https://huggingface.co/XingChen-AGI/Xing4.0-29B-A4B)、魔搭(https://modelscope.cn/models/XingChen-AGI/Xing4.0-29B-A4B)、Gitee(https://gitee.com/xingchen-agi/xing4.0-29b-a4b)以及魔乐(https://modelers.cn/models/XingChen-AGI/Xing4.0-29B-A4B)。

小结:星辰Xing4.0-29B-A4B以29B总参数、4B激活参数的组合,成为国内首个在昇腾超节点与MindSpore上完成训练的百亿参数大模型,并通过软硬件协同把训练性能提升96%。它的发布意味着国产算力与国产框架已能承接SOTA级大模型的完整训练流程,也为代码生成与嵌入式智能体等复杂工程场景提供了可直接取用的开源选项。