智算多多
官方邮箱:service@zsdodo.com

公司地址:北京市丰台区南四环西路188号总部基地三区国联股份数字经济总部


京公网安备11010602202532号 昨天的 AI 圈有一件看起来很工程、但其实挺要紧的事。
LMSYS 团队昨天发了一份工程报告。说 DeepSeek 最新一代 V4 Flash 模型的强化学习训练——这一步是大模型从"能聊"变成"能解题"的关键训练环节——整条管子,已经在 AMD 的 MI355X 显卡上端到端跑通了。
报告一共 9 个图,从训练链路图、架构图到精度对比图、奖励曲线图,把每一步都拆给你看。
为什么这件事值得讲?不是因为 AMD 突然崛起,而是因为国产大模型的训练,过去几年几乎都压在英伟达一根线上。卡的型号、显存、配套软件生态,围着一家转。
这一次,DeepSeek 把这条路走通了。
模型总参数 2840 亿,每次答题只激活 130 亿。训练用 4 个节点、每节点 8 张 AMD MI355X 卡,一共 32 张。
跑了 100 多步训练,每一步的"答题概率"和"评分概率"对得上,差距稳定在 0.09 左右,没有漂移。
最终效果是数学题集 AIME-2024:单题准确率从 0.39 提升到 0.49,8 次抽答的覆盖率从 0.53 提升到 0.67。回答被截断的比例从 60% 降到 55%——这意味着模型"写得完"的能力也涨了一截。
这些数字本身不算惊艳。
但它证明了一件事:AMD 这条硬件路线,从"能跑起来"走到了"能稳定训练出效果"。
难的不是"让模型跑起来",而是"让两个不同引擎对同一个问题给出几乎一致的答案"。
强化学习你可以理解成"让模型边做题边自我批改"。做对了给自己加分,做错了扣分,然后顺着分数调自己的答题思路。但这一步有个前提:负责生成候选答案的"答题机",和负责打分调参的"评分机",必须对同一道题打出几乎一样的概率。
差一点点,模型就调歪了。
英伟达的 CUDA 生态为什么多年来几乎垄断大模型训练?就是因为这套"答题机"和"评分机"的概率对齐工程,CUDA 这边已经打磨得非常顺滑。换到 AMD 的 ROCm 栈上,每一个精度细节、每一次权重同步、每一轮多节点通信,都要重新校准。
这件事国内外想做的人不少。但凡沾到强化学习、混合精度、多节点协同这些工程细节,几乎都回头用英伟达。
DeepSeek 是第一个把这条管子完整走通的。
这是买了一笔"硬件保险"呀。
过去几年,国产大模型的训练节奏跟英伟达的供应节奏绑得太紧。卡的产能、出口管制、显存升级周期——任何一个变量卡一下,整个训练链条就卡壳。
AMD 这条路被证明能跑出成绩,意味着下一次不管是采购新卡、谈价格、做国产推理服务,手里多了一张牌。
对消费端的意义慢一点,但方向已经埋下了。当训练侧不再被一家卡死,推理侧的硬件选择、价格、API 成本都会松动。下一次你打开一个国产 AI 助手,背后跑的卡可能不再是统一的型号。
这笔账不是钱。是选择权。
接下来值得关注的事,是 FP8 训练全链路打通、性能调优、更大规模验证。当 DeepSeek 把这条路打通,小红书、快手、美团、百度这些已经在用国产卡做推理的团队,接下来很可能顺着这条路线,把训练侧也切到 AMD 栈上。至此,大模型的训练终于不再是NVIDIA独占了。
那一天,应该不会太远。
