泉源:深圳河套学院
导读
当今人工智能时代,,,,,,基于国产算力的大模子高效训练和推理是国家生长战略的大问题。。。。。DeepSeek-V4-Pro在效率和性能方面是业界大模子的优异代表。。。。。DeepSeek-V4-Pro已经乐成完成在国产算力上推理安排,,,,,,但训练还未完全实现国产算力化。。。。。
在此配景下,,,,,,深圳河套学院Al训练平台项目团队,,,,,,团结哈尔滨工业大学(深圳)、深圳市大数据研究院、华为GTS(全球手艺效劳)、盘算产品线、2012实验室,,,,,,协同深智城AI算力平台,,,,,,面向国产算力大模子训练开展团结攻关。。。。。现在,,,,,,仅用1个月时间,,,,,,项目已基于昇腾910C国产算力集群实现DeepSeek-V4-Pro全参数续训练/SFT稳固运行,,,,,,完生长稳训练1500+步,,,,,,训练MFU超30%,,,,,,要害逊с子效率提升14%。。。。。
据果真资料检索,,,,,,本事情是果真可查规模内,,,,,,业界首个由第三方机构基于国产算力集群完成的DeepSeek-V4-Pro全参数后训练工程实践,,,,,,标记着国产AI基础设施正在从推理安排和轻量化微调迈向超大模子全参数后训练。。。。。
为什么万亿级模子的“全参数后训练”是一块硬骨头??????
DeepSeek-V4-Pro,,,,,,一款1.6万亿参数级MoE开源旗舰模子,,,,,,接纳了CSA+HCA混淆希罕注重力、mHC毗连等新机制。。。。。相比于上一代DeepSeek-V3/R1,,,,,,它对国产训练框架提出了全方位的“极限挑战”。。。。。
希罕MoE结构:专家路由带来的跨节点通讯,,,,,,是古板麋集模子的数十倍;;;;;;;
混淆希罕注重力:注重力模式的动态切换,,,,,,对算子效率和显存治理极为敏感;;;;;;;
万亿参数级状态:权重、梯度、激活、优化器状态——仅单副本就需数TB显存。。。。。
焦点希望:千卡集群上,,,,,,1500+步稳固奔驰
经由团结攻关,,,,,,项目已基于千卡级昇腾 910C 国产算力集群,,,,,,乐成实现DeepSeek-V4-Pro在国产算力集群上的全参数后训练稳固运行。。。。。
长稳SFT训练:完成1500+步迭代,,,,,,skipped iterations = 0,,,,,,NaN iterations = 0;;;;;;;
训练效率:MFU(模子算力使用率)抵达约30%,,,,,,要害逊с子盘算效率较初始版本提升约14%;;;;;;;
最终体现:在昇腾超节点上,,,,,,MFU稳固在34.9%。。。。。
与此同时,,,,,,DeepSeek-V4-Flash的全参数续训练与SFT链路也已同步买通。。。。。
DeepSeek-V4-Pro@昇腾超节点训练,,,,,,MFU最终稳固在34.9%
一组数据足以说明差别:在一律参数目下,,,,,,业界果真的国产算力全参数后训练案例险些为零。。。。。而我们将一个1.6T MoE模子,,,,,,在千卡集群上以27秒/步的稳固节奏,,,,,,一连奔驰1500余步——这不是实验室的“单次演示”,,,,,,而是可复现、可工程化交付的稳固能力。。。。。
更主要的是,,,,,,该平台已快速验证了笔直领域价值。。。。。团队围绕工业级自动化运筹建模场景,,,,,,在数周内完成了从数据生产、样本筛选、训练链路买通到效果评测的闭环验证。。。。。这意味着:国产算力平台不但能够“训大模子”,,,,,,更能“训好行业模子”——以短周期、低本钱构建面向专业使命的增强能力。。。。。
三大概害手艺突破:从“能跑”到“能训、训稳、训优”
本次攻关面向DeepSeek-V4-Pro全参数后训练,,,,,,而非LoRA等少量参数微调。。。。。团结团队在以下三个层面实现了系统性突破:
1. 漫衍式承载:1.6T参数的“显存拼图”
洞察: 万亿参数不可只靠显存大,,,,,,更要靠“放得巧”。。。。。
项目乐成构建了权重、梯度、激活、优化器状态的漫衍式承载计划,,,,,,使得数据并行、张量并行、流水并行与专家并行四者协同事情。。。。。每一张卡上,,,,,,该放什么、怎么放、怎样动态调理——这套“显存拼图”是稳固训练的地基。。。。。
2. 希罕与通讯:让专家不“吵架”,,,,,,让注重力不“堵车”
洞察: MoE模子训练最怕“专家负载失衡”和“跨节点通讯风暴”。。。。。
团队针对混淆希罕注重力、MoE路由、归一化、矩阵盘算等要害逊с子举行了深度适配与优化,,,,,,算子效率较初始版本提升14%。。。。。同时建设了专家负载的实时监控与平衡机制,,,,,,阻止部分专家过载而部分专家闲置。。。。。
3. 长稳监控:当训练跑上几天几夜,,,,,,谁来守夜??????
洞察: 全参数后训练最恐怖的不是慢,,,,,,而是“跑着跑着就崩了”。。。。。
团结团队搭建了一套完整的监控系统:Loss曲线、梯度范数、专家负载、显存占用、异常自动恢复……所有指标均可视、可告警、可自愈。。。。。在1500+步的训练中,,,,,,未泛起一次Loss失控或NaN值——这是“长稳能力”最直接的证实。。。。。
实战验证:数学建模能力在后训练中显著跃升
为了磨练DeepSeek-V4在昇腾集群上举行全参数后训练的真实价值,,,,,,项目设计了一项“硬核”实验:增强盛模子的数学建模能力。。。。。
团队搭建了一条SFT建模数据生产workflow,,,,,,产出3000条高质量数学建模使命SFT样本,,,,,,笼罩4类目的使命和3种问题形态。。。。。随后,,,,,,对DeepSeek-V4举行后训练。。。。。
优化建模SFT数据飞轮流程
训练曲线给出了清晰的信号:
LM loss从高位快速下降,,,,,,最终收敛至0.2056;;;;;;;
MTP-1 loss收敛至0.2538;;;;;;;
梯度范数平稳下降,,,,,,未泛起震荡或发散;;;;;;;
单步耗时稳固在27秒左右。。。。。
训练曲线给出了清晰的信号:
LM loss从高位快速下降,,,,,,最终收敛至0.2056;;;;;;;
MTP-1 loss收敛至0.2538;;;;;;;
梯度范数平稳下降,,,,,,未泛起震荡或发散;;;;;;;
单步耗时稳固在27秒左右。。。。。

3K SFT训练历程概览
更直观的效果来自Benchmark比照:
四项要害指标均显著逾越原模子,,,,,,其中ORGEval WL提升凌驾5个百分点。。。。。这意味着:在国产算力上完成的全参数后训练,,,,,,不但能“跑稳”,,,,,,更能“训强”——模子在重大推理使命上的能力获得了真实增益。。。。。
以战育才:在真实攻关中作育“能训大模子”的人
本次攻关的另一个奇异价值,,,,,,在于它是一次人才作育模式的范式实验。。。。。
深圳河套学院将万亿级模子训练攻关作为“练兵场”,,,,,,把学生直接嵌入国产算力真实训练场景。。。。。阻止现在,,,,,,项目已作育学生42名,,,,,,形成了由青年西席指导、博士生焦点攻坚、工程团队支持的协同作育机制。。。。。
在这一历程中,,,,,,同砚们不但是加入项目希望,,,,,,更是肩负详细使命的“战斗员”:有的认真训练数据结构与样实质量剖析,,,,,,有的认真漫衍式并行战略验证,,,,,,有的跟进长稳监控与异常;;;;;;指矗,,,,有的撰写手艺报告与工程文档。。。。。
一次训练启动、一次报错定位、一次参数调解、一次效果复盘——在这些真实而噜苏的工程实践中,,,,,,学生们从“会挪用大模子”真正走向了“明确并加入训练大模子”。。。。。
能力提升体现在三个方面:
建设了对国产算力大模子训练全链路的系统性熟悉;;;;;;;
掌握了从领域数据到模子能力增强的全历程实操能力;;;;;;;
在真实项目中形成了问题拆解、实验设计、训练复盘与团队协作的工程素养。。。。。
后续,,,,,,这些真实使命将沉淀为课程案例、实训资源和学生科研项目,,,,,,将一连支持深圳河套学院作育“懂模子、懂系统、能工程、敢攻关”的高水平复合型AI人才。。。。。
未来展望:从“全参数后训练”走向“Agentic RL + 超长上下文”
下一阶段,,,,,,深圳河套学院将继续团结哈尔滨工业大学(深圳)、深圳市大数据研究院、华为GTS(全球手艺效劳)、盘算产品线、2012实验室、深智城等相助同伴,,,,,,在现有全参数续训练/SFT链路基础上,,,,,,重点推进三项使命:
1. 训练效率再突破
一连优化训练框架与要害算子,,,,,,进一步提升训练效率(MFU),,,,,,降低万亿模子训练的算力本钱。。。。。
2. 超长上下文训练
支持512K至1M超长上下文训练,,,,,,提升重大专业使命中的长文档明确与长链路推理能力;;;;;;;
3. 强化学习后训练闭环
突破DeepSeek-V4-Pro强化学习后训练手艺,,,,,,围绕数学建模优化、代码Agent、长上下文推理等使命,,,,,,构建rollout天生 → 工具执行 → reward/verifier → 战略更新 → 评测反响的完整Agentic RL链路。。。。。
同时,,,,,,项目将坚定推进手艺开源与人才作育沉淀:
分阶段开放训练设置、评测剧本、合成数据、手艺报告及相关模子与框架能力;;;;;;;
将真实训练使命、数据结构要领、故障排查案例和评测流程转化为课程案例与实训使命;;;;;;;
一连完善“国产算力支持、真实使命牵引、学生团队实战、工程能力沉淀”的作育路径。。。。。
在此基础上,,,,,,项目还将依托这一训练。。。。。,,,,开展新一代通用人工智能的基础理论、新范式和新架构的研究——包括符号、毗连与行为主义有机融合,,,,,,从简单智能体到群体智能再到人机融合的建模探索。。。。。
结语
DeepSeek-V4-Pro在国产算力上的全参数后训练,,,,,,不是一次伶仃的工程突破。。。。。
它验证了一条蹊径:国产开源旗舰模子 + 国产AI算力 + 高水平训练团队 + 国产厂商手艺支持——这个四角闭环,,,,,,是可一连的、可复制的、可信托的。。。。。
它发出了一声宣告:国产AI基础设施,,,,,,从今天起,,,,,,不再只是“能推理”,,,,,,而是真正“能训练、能训稳、能训优”。。。。。
更主要的是,,,,,,它点燃了一个希望:在下一代通用人工智能的征途上,,,,,,中国的高校、科研机构和年轻学子,,,,,,可以站在自己的算力土壤上,,,,,,开展人工智能的研究,,,,,,亲手训练属于自己的万亿模子。。。。。
这不是终点,,,,,,而是发令枪。。。。。
?项目后续将逐步开源手艺报告、训练设置与评测剧本,,,,,,敬请关注深圳河套学院官方宣布。。。。。
版权声明:本文转载自深圳河套学院官方公众号,,,,,,仅用于行业资讯交流与手艺分享,,,,,,不代表本公司立。。。。。,,,,不必于任何商业用途。。。。。版权归原作者及原出地方有,,,,,,若有侵权,,,,,,请联系OLE777实时删除。。。。。
上一条智算共生,,,,,,赋能未来 ——2026 宝德盘算数智生态大会 AI 分论坛乐成举行2026.06.08
下一条无问芯穹再获超7亿融资|首发AI生产力公式,,,,,,跻身Token经济枢纽2026.05.07
_1757660066.png)
4008-770-775