热门AI公司动态
全球首发 | SLAI基于国产算力集群完成DeepSeek-V4-Pro全参数后训练
主要内容
- 01在昇腾超节点上MFU稳定在34.9%。
- 02单步耗时约27秒,未出现Loss失控或NaN。
- 03数学建模SFT后,ORGEval WL提升超5个百分点。
- 04项目由深圳河套学院、哈工大、华为等联合攻关。
背景
DeepSeek-V4-Pro是1.6万亿参数MoE开源模型,此前已在国产算力上完成推理部署,但全参数训练尚未实现国产算力化。本次攻关填补了第三方机构在国产算力上训练超大模型的空白。
为什么值得关注
证明国产算力(昇腾910C)可支撑万亿级MoE模型全参数训练,为国内开发者提供国产替代训练方案,降低对海外算力的依赖,推动国产AI基础设施从推理走向训练。
🇨🇳
对中国用户与市场
国内AI开发者和企业可基于国产算力训练和微调大模型,减少对英伟达GPU的依赖;但昇腾集群的MFU(30%)相比国际先进水平仍有差距,且训练成本与稳定性需进一步优化。
继续关注
⚠尚未确定的部分
- ·训练MFU(30%)低于国际主流水平(如H100集群通常40-50%),效率仍有提升空间。
- ·仅完成1500+步短周期训练,长周期(数万步)稳定性尚未验证。
- ·项目为联合攻关成果,开源计划尚未明确,可复现性待确认。
→可采取的行动
- ·关注项目后续开源的技术报告和训练配置,评估在自有国产算力上复现。
- ·尝试在昇腾集群上部署DeepSeek-V4-Pro推理,验证国产算力推理效果。
- ·若需训练行业模型,可参考其SFT数据生产流程和训练链路。
摘记
国产AI基础设施,从今天起,不再只是'能推理',而是真正'能训练、能训稳、能训优
这不是终点,而是发令枪。
#深圳河套学院#哈尔滨工业大学(深圳)#华为#DeepSeek-V4-Pro#昇腾910C#深圳市大数据研究院#深智城#DeepSeek-V4-Flash#国产算力#大模型训练
🤖 本文根据 雷峰网 的 RSS 内容整理,并由 AI 辅助提炼要点。完整上下文请以 原文 为准。