首页
产品服务
模型广场
Token工厂
算力市场算力商情行业资讯解决方案
注册

DeepSeek 把模型训练搬到了 AMD 的卡上,不再是NVIDIA独占了

发布日期:2026-07-12 来源:钛媒体作者:钛媒体浏览:4

昨天的 AI 圈有一件看起来很工程、但其实挺要紧的事。

LMSYS 团队昨天发了一份工程报告。说 DeepSeek 最新一代 V4 Flash 模型的强化学习训练——这一步是大模型从"能聊"变成"能解题"的关键训练环节——整条管子,已经在 AMD 的 MI355X 显卡上端到端跑通了。

报告一共 9 个图,从训练链路图、架构图到精度对比图、奖励曲线图,把每一步都拆给你看。

为什么这件事值得讲?不是因为 AMD 突然崛起,而是因为国产大模型的训练,过去几年几乎都压在英伟达一根线上。卡的型号、显存、配套软件生态,围着一家转。

这一次,DeepSeek 把这条路走通了。

几个关键数字

模型总参数 2840 亿,每次答题只激活 130 亿。训练用 4 个节点、每节点 8 张 AMD MI355X 卡,一共 32 张。

跑了 100 多步训练,每一步的"答题概率"和"评分概率"对得上,差距稳定在 0.09 左右,没有漂移。

最终效果是数学题集 AIME-2024:单题准确率从 0.39 提升到 0.49,8 次抽答的覆盖率从 0.53 提升到 0.67。回答被截断的比例从 60% 降到 55%——这意味着模型"写得完"的能力也涨了一截。

这些数字本身不算惊艳。

但它证明了一件事:AMD 这条硬件路线,从"能跑起来"走到了"能稳定训练出效果"。

这件事到底难在哪

难的不是"让模型跑起来",而是"让两个不同引擎对同一个问题给出几乎一致的答案"

强化学习你可以理解成"让模型边做题边自我批改"。做对了给自己加分,做错了扣分,然后顺着分数调自己的答题思路。但这一步有个前提:负责生成候选答案的"答题机",和负责打分调参的"评分机",必须对同一道题打出几乎一样的概率。

差一点点,模型就调歪了。

英伟达的 CUDA 生态为什么多年来几乎垄断大模型训练?就是因为这套"答题机"和"评分机"的概率对齐工程,CUDA 这边已经打磨得非常顺滑。换到 AMD 的 ROCm 栈上,每一个精度细节、每一次权重同步、每一轮多节点通信,都要重新校准。

这件事国内外想做的人不少。但凡沾到强化学习、混合精度、多节点协同这些工程细节,几乎都回头用英伟达。

DeepSeek 是第一个把这条管子完整走通的。

对国产 AI 栈意味着什么

这是买了一笔"硬件保险"呀。

过去几年,国产大模型的训练节奏跟英伟达的供应节奏绑得太紧。卡的产能、出口管制、显存升级周期——任何一个变量卡一下,整个训练链条就卡壳。

AMD 这条路被证明能跑出成绩,意味着下一次不管是采购新卡、谈价格、做国产推理服务,手里多了一张牌。

对消费端的意义慢一点,但方向已经埋下了。当训练侧不再被一家卡死,推理侧的硬件选择、价格、API 成本都会松动。下一次你打开一个国产 AI 助手,背后跑的卡可能不再是统一的型号。

这笔账不是钱。是选择权。

接下来值得关注的事,是 FP8 训练全链路打通、性能调优、更大规模验证。当 DeepSeek 把这条路打通,小红书、快手、美团、百度这些已经在用国产卡做推理的团队,接下来很可能顺着这条路线,把训练侧也切到 AMD 栈上。至此,大模型的训练终于不再是NVIDIA独占了。

那一天,应该不会太远。

本文转载自钛媒体, 作者:钛媒体, 原文标题:《 DeepSeek 把模型训练搬到了 AMD 的卡上,不再是NVIDIA独占了 》, 原文链接: http://m.toutiao.com/group/7661171007687754276/。 本平台仅做分享和推荐,不涉及任何商业用途。文章版权归原作者所有。如涉及作品内容、版权和其它问题,请与我们联系,我们将在第一时间删除内容!
本文相关推荐
暂无相关推荐
点击立即订阅