8月6日,华为计算官方宣布,昇腾基于AscendC编程语言提供完整的训推一致算子集,这一技术突破在Qwen3-30BMoE模型上的测试中实现了Logdiff为0,即推理与训练过程中的数值一致性。昇腾通过FA算子优化,在Eager模式下获得了20%-60%的性能提升,为强化学习训练提供了高效可靠的方案。
昇腾针对训推不一致问题,即Rollout引擎与训练引擎之间的数值不一致性,进行了系统性的优化。通过统一注意力语义、锁定reduce累加序、对齐在线Softmax分块策略以及对齐关键路径精度等四个方面的修改,昇腾确保了训练与推理在数值路径上的一致性。这些优化不仅解决了底层计算时累加不保序的问题,还覆盖了多种调用场景,并在关键计算步骤上施加了约束,同时控制了性能损失。
华为还宣布,相关基础设施已开源,并即将上线“训推一致问题识别Skill”,以支持排查残余logdiff并定位问题根源,无论是算子路径问题还是框架实现差异。这一开源举措将进一步推动行业核心场景的工程化落地,为开发者提供更多的便利和支持。

