二.1
一场官司,一次断臂,一次推倒重来
今天这家公司的每一块地基,都是在最狼狈的时候打下的
约 8 分钟·2,277 字·5 题
01
一家从来没舒服过的公司
1969 年,八个人从仙童半导体走出来
AMD 成立于 1969 年 5 月,创始人 Jerry Sanders 带着七位仙童半导体的同事在加州起家;
比它早一年、同样出自仙童系的是 Intel——两家从诞生起就是同源、同城、同代的竞争者。
理解这家公司的第一件事是:它从来不是一家舒服的公司,历史上至少两次接近生死线,
每次的脱困方式都在它的行为模式里留下了痕迹。这一节讲的不是掌故,而是
那些当年成立、今天可能还成立或者已经不成立的前提。
02
地基一:1995 年那纸和解
一套指令集,决定了三十年的命运
这场官司的经过第 5 节已经讲过,不重复:1995 年以和解收场,AMD 拿到继续设计 x86 芯片的权利。
这份权利今天值多少钱?AMD 2025 年在服务器处理器市场占 24%,而这个市场到 2030 年会长到
$1,700 亿至 $2,230 亿(第 3 节两个口径)——这一整块生意的法律前提,就是那纸和解。
但要同时看清边界:这份权利保的是「可以合法做」,不保「一定有人买」——
企业软件一旦大规模迁到别的指令集上,它的价值就会缩水,这正是第 5 节那条守线。
03
地基二:2006 年买下一家显卡公司
今天所有关于 AI 的讨论,血统在这里
2006 年,AMD 以约 54 亿美元收购了显卡厂商 ATI,动机和人工智能毫无关系——
那个年代的主题是「把处理器和图形单元整合到一颗芯片里」。结果是
AMD 成了全世界极少数同时拥有成熟中央处理器和成熟图形处理器架构的公司。
这个组合此后十几年没什么特别价值,直到图形处理器变成 AI 算力主力才突然变成关键的牌——
因为今天要拿下一台 AI 机器的订单,你得同时供得起加速卡和配套的处理器,
而全世界能两样都自己做的公司屈指可数。
这一笔还留下另一个遗产:游戏主机芯片——
把处理器和图形单元做在一颗芯片上的能力,让 AMD 长期垄断了主流游戏主机的芯片供应,
也就是第 3 节那块「用毛利率换确定性」的压舱石业务。
一个值得带走的观察角度
2006 年那笔收购在当时的评价并不好——价格被认为偏高,整合也不顺利,
此后几年公司财务恶化。但它在二十年后变成了一张决定性的牌。
这不是说「亏钱的收购总会翻身」,而是提醒一件事:
判断一次收购,要问它买到的是「一个当期业务」还是「一种可复用的能力」。
业务会随周期起落,能力会在环境变化时突然变得值钱。
同一把尺子会在本节后面量两次:2022 年那笔 $600 亿,和 2025 年那笔 $44 亿。
04
地基三:2009 年卖掉自己的工厂
当时被视为失败者的无奈,十年后变成结构优势
2009 年,AMD 把制造部门整个剥离出去,成立一家由外部主权基金出资的独立代工公司,
从中拿到约 14 亿美元现金,更重要的是卸掉了每年约 30 亿美元的资本开支义务。
这个决定当时是被逼的:一座先进晶圆厂动辄上百亿美元、每代制程还要重新投一次,
财务本已紧张的公司背不动。从此 AMD 变成了「只画图不建厂」的公司——
而这件事的历史意义,一直到 2020 年代才完全显现。
| 对比 | AMD(2009 年后只做设计) | 坚持自建工厂的那一方 |
| 制程从哪来 | 向外部代工厂采购,谁最先进就用谁 | 只能用自家的 |
| 自家制程延误时 | 不受影响——换一家买就是 | 整条产品线被拖住 |
| 实际结果 | 全球首批用上 2 纳米 | 被自家制程的连续延误拖了数年 |
| 资本开支负担 | 轻 | 极重 |
| 代价 | 产能捏在别人手里 | 全链条可控 |
这张表是这一节最该记住的东西。一个当时被视为「失败者不得已的选择」,
十年后变成了决定性的结构优势——而促成反转的不是 AMD 做对了什么,是对方的制程出了问题,
第 2 节那条「领先者自己出错」在这里得到了最清晰的印证。
但请同时记住最后一行的代价:产能捏在别人手里。
封装产能要抢、存储要多付 23.8%、交换芯片只能外购——这些问题的根子都在 2009 年这个选择上。
没有一个战略选择是只有好处的:轻资产换来了灵活,也换来了依赖。
05
2014 年:接手一家市值 30 亿美元的公司
两个反直觉的选择
2014 年 10 月,苏姿丰出任总裁兼首席执行官。她接手时公司市值约 30 亿美元,
上一代架构是性能与能效的双重失败,服务器处理器份额低到「可忽略不计的个位数,而且还在缩小」。
这里要理解一个行业常识:服务器采购周期以年计,客户一旦选定一家往往几年不换,
所以份额跌到个位数意味着的不是「今年少赚钱」,而是你已经不在客户下一轮采购的候选之列——
要回去得连续几代都好,好到客户愿意承担换供应商的风险,这是一场至少五年起步的仗。
第一个选择:推倒重来,而不是修补。
面对失败的架构,修补它成本低、见效快、风险小;重做要好几年、烧掉大量现金、期间没有新品可卖。
她选了后者,新架构代号 Zen——公司财务本就危险,Zen 失败很可能就没有下一次机会了。
2017 年 Zen 交付,相对上一代实现约 52% 的每瓦性能提升,属于代际跃迁。
第二个选择:不守低端,先攻最难的那块。
常规打法是先从门槛低的消费市场靠性价比走量,赚了钱再往上打;
她直接瞄准壁垒最高、毛利最高的服务器市场——那是所有市场里最不欢迎新面孔的一个。
为什么「先攻最难」反而是对的
难攻的另一面是难守:客户完成切换、在自己机房里验证过几年稳定性之后,
同样不会轻易换回去。所以服务器市场的份额黏性很强:抢过来慢,丢掉也慢——
这正是第 5 节那条曲线能十年不回头的原因。
同一个逻辑反过来用在加速卡上就是坏消息:
领先者在那个市场的地位同样有黏性,AMD 想抢也一样慢。
黏性是中性的——它保护在位者,不管在位者是谁。
06
两笔近期交易:同一套逻辑的延续
用手上有的,换当下最缺的
| 年份 | 动作 | 付出 | 换来 |
| 2009 | 剥离晶圆厂 | 制造能力、全链条可控 | $14 亿现金 + 卸掉每年约 $30 亿资本开支 + 制程选择自由 |
| 2022 | 收购赛灵思 | 约 $600 亿,全股票支付 | 一块周期独立、与 AI 叙事无关的可编程芯片业务 |
| 2025 | 买下一家整机公司,七周后卖掉它的工厂 |
$44 亿买入、$30 亿卖出,净支出约 $14 亿 |
机架级系统的设计能力与客户交付团队 |
第三行乍看像一次失败的收购:买入到宣布卖出只隔七个星期,而且是折价卖,但这个理解是反的——
卖掉的是制造业务(工厂、产线、组装能力),留下的是设计团队和客户交付团队,
也就是那批懂得怎么把几十颗芯片、交换机、电源、液冷管路整合成一台能稳定运行的机架的人。
为什么这支队伍非买不可?因为第 4 节讲过,2026 年只卖芯片已经拿不到大订单,
客户要的是一台能开箱运行的机器,而这套系统工程能力是芯片设计公司天然不具备的,只能整建制收购;
自建要三到五年,大客户的订单等不了——这 $44 亿买的本质上是时间。
把三行放在一起,这家公司的行为模式就清楚了:它反复在用手上已有的东西,
去换当下最缺的东西。2009 年最缺现金就卖工厂,2022 年最缺周期独立的业务就用股票换,
2025 年最缺系统能力和时间就买一支队伍。
而 2025 到 2026 年,它最缺的是愿意在软件生态还不成熟时就下大单的客户,
于是它拿出了手上最后一样还没换出去的东西——股权本身(第 8 节讲结构、第 17 节讲代价)。
这一节要带走的一句话 三块地基:①1995 年与 Intel 和解,拿到永久的 x86 设计权——此后三十年全部生意的法律前提;②2006 年收购 ATI(约 $54 亿),今天的加速卡血统从这里来;③2009 年卖掉自己的晶圆厂,换来 $14 亿现金和卸掉每年约 $30 亿的资本开支义务。2014 年苏姿丰接手时市值约 $30 亿,服务器份额低到「可忽略不计」。她做了两个反直觉的选择:推倒重来做全新架构(Zen,2017 年交付,每瓦性能提升约 52%),以及不守低端、直攻壁垒最高的服务器市场。此后两笔大交易延续同一套逻辑:2022 年 $600 亿全股票收购赛灵思、2025 年 $44 亿买下一家整机公司、七周后把它的工厂以 $30 亿卖掉。
检验一下:一场官司,一次断臂,一次推倒重来
5 道题,选完立刻出反馈。做错的那道,恰好是这一节你真正学到东西的地方。
二.2
四个分部,和那个装了两门生意的筐
报表把最不一样的两门生意放进了同一行,这一节把它打开
约 6 分钟·1,899 字·5 题
01
先看这张任何人都能在财报里找到的表
四行数字,决定了这门课要讲什么
| 分部 | 2026Q2 收入 | 占比 | 这门生意在卖什么 |
| 数据中心 | $67.18 亿 | 58.2% |
服务器处理器(EPYC)+ AI 加速卡与机架(Instinct / Helios) |
| 客户端 | $30.62 亿 | 26.5% | 个人电脑处理器(Ryzen) |
| 嵌入式 | $9.77 亿 | 8.5% | 工业、通信、汽车用的可编程芯片 |
| 游戏 | $7.79 亿 | 6.8% | 游戏主机半定制芯片、独立显卡 |
| 合计 | $115.36 亿 | 100% | 同比 +50.1%,环比 +12.5% |
先记住那个 58.2%:这家公司近六成收入来自「数据中心」这一行,市场的全部想象都压在这里。
但问题恰恰在这里:这一行是一个筐,里面装着两样东西——都是硅、都卖给数据中心、记在同一行,
可是从赚钱方式、增长确定性到毛利率方向几乎相反(第 1、3 节)。不分开就会犯读这家公司最常见的错误:
用其中一门生意的坏消息去否定另一门生意的好消息,反过来也一样。
02
公司不披露的数字,往往可以从它披露的数字里推出来
一个通用的研究技巧:找总量、分项、增速的交叉点
遇到「公司不拆开披露」,很多人停在「没有数据」。其实还有一步可以走:
找到三类信息的交叉点——一个总量、一个分项、一个增速,剩下的那一项就被锁定了。
这里手上刚好有三条公开信息:① 机构模型给出的数据中心分部收入,
2026 年约 $333.39 亿、2027 年约 $730.69 亿(总量);
② 机构研究正文提到 2027 年数据中心加速卡收入超过 $400 亿(分项);
③ 管理层指引服务器处理器收入 2026 年增长超过 80%、2027 年增长超过 70%(增速)。
| 步骤 | 算式 | 结果 |
| ① 2027 年处理器 | 730.69 − 400.00 | $330.69 亿 |
| ② 2026 年处理器 | 330.69 ÷ 1.70(按 2027 年增 70% 反推) | $194.52 亿 |
| ③ 2026 年加速卡 | 333.39 − 194.52 | $138.87 亿 |
| 加总校验 |
客户端 127.42 + 游戏 31.12 + 嵌入式 45.28 + 处理器 330.69 + 加速卡 400.00 = $934.51 亿,
与机构给出的 2027 年总收入完全一致 ✓ |
推算完一定要验一遍,这次校验零误差,可以往下说结论了。
结论一:2026 年这个筐里处理器比加速卡还大——194.52 对 138.87,处理器占 58.3%。
这和市场的讨论方式明显脱节:大家把它当「AI 加速卡股」谈,
但从收入结构上看,至少到 2026 年它主要仍是一家卖处理器的公司。
结论二:2027 年的全部张力压在一个数上——加速卡要从 138.87 涨到 400,
一年涨 1.88 倍,而这要求机架量产爬坡顺利、软件栈跟上、大客户不在里程碑上退出、
封装产能抢得到同时成立。
这就是为什么这门课要花三个单元讲工程问题——它们最终会变成收入问题。
这个推算可能错在哪,必须一起说
① 机构说的是「超过 $400 亿」,这是下限。若实际是 $450 亿,
2026 年加速卡会反超处理器,「处理器更大」这个结论会反转。
② 管理层说的「增超过 70%」同样是下限,
实际更高的话,处理器的基数会被推低。
③ 数据中心分部里可能还有少量其他产品,两项加起来未必等于分部全部。
把这三条写出来,比推算本身更重要。
不过要注意:它们影响的是数值的精确度,不是结论的方向——
无论取哪个合理数值,「处理器是一门被严重低估的大生意」和
「2027 年压在加速卡的高倍增长上」这两个判断都成立。
03
客户端与游戏:两块被低估的压舱石
它们不提供想象力,提供别的东西
客户端分部 2026Q2 收入 $30.62 亿、占比 26.5%,是第二大分部,体量比很多人以为的大。
价值有两层:一是现金——个人电脑处理器销量以千万颗计,服务器版和消费版共用大部分设计,
把第 1 节那笔架构研发费用摊到了大得多的分母上;二是产能承诺的底气——
向代工厂预订两年后的产能时,有稳定大批量出货的公司和只有新兴业务的公司谈判地位完全不同。
游戏分部只有 $7.79 亿、占比 6.8%,是最小的一块,但模式很特别:主机芯片走半定制,
毛利率明显低于公司平均,但几乎没有库存风险、需求可见度以年计(第 3 节)。
它现在处在主机世代的中后段,数字在往下走,这是周期不是衰退。
04
嵌入式:那笔 600 亿收购留下的东西
最干净的一块生意,也是账上最重的一笔包袱
2022 年 2 月,AMD 以全股票方式完成对赛灵思的收购,作价约 600 亿美元。赛灵思是可编程芯片龙头——
那类芯片出厂后可由客户自己改变内部电路,用在通信基站、工业设备、汽车、航空航天这些
「量不大但要求极苛刻、生命周期极长」的场景。
它在今天财报里的对应物就是嵌入式分部,有三个很好的属性:
周期与 AI 完全独立、毛利率被管理层列为顺风项(单价高、替换成本高、黏性极强)、
产品生命周期以十年计——这是四个分部里唯一一块「不该被 AI 故事裹挟」的生意。
但它在账上留下了一笔必须理解的包袱
用 $600 亿的股票买一家公司,会计上要把买价里超出对方净资产的那部分,
拆成「可辨认的无形资产」和「商誉」记进资产负债表,其中
无形资产要按年摊销——每季从利润表里扣一笔,扣很多年。
这笔钱在收购完成那一刻就已经用股票付掉了,之后每期的扣减并不再花一分现金,
却会实打实地压低会计准则口径的利润。
所以读这家公司必须同时看两个口径:
会计准则口径与调整后口径之间的差,主体就是这笔摊销加股份支付。
第 15 节问三会把这个差拆开量一遍,这里只标记它的存在。
| 分部 | 确定性 | 毛利率方向 | 周期驱动 | 在这门课里的角色 |
| 数据中心 · 服务器处理器 | 高 | 顺风 | 企业换机 + 智能体负载 | 最被低估的那块 |
| 数据中心 · AI 加速卡 | 低 | 逆风 | 云厂资本开支 + 第二供应商需求 | 全部想象力的来源 |
| 客户端 | 中 | 中性 | 个人电脑换机周期 | 摊薄研发的大分母 |
| 嵌入式 | 高 | 顺风 | 工业与通信设备更新 | 与 AI 无关的干净现金流 |
| 游戏 | 高 | 低但稳 | 主机世代周期 | 用毛利率换确定性 |
这张表回答一个经常被问到的问题:这家公司到底是一家什么公司?答案是
三门确定性较高的生意,养着一门确定性很低、但潜在规模远大于前三门的生意——
前三门提供稳定的收入、现金和产能谈判地位,第四门决定这家公司未来的上限在哪里。
这个结构本身没有对错,它只是决定了该怎么跟踪这家公司——
要分别跟踪两组完全不同的指标,而不是盯着一个总收入增速。第 16 节那张跟踪表就是按这个结构组织的。
这一节要带走的一句话 2026Q2 四个分部:数据中心 $67.18 亿(58.2%)、客户端 $30.62 亿(26.5%)、嵌入式 $9.77 亿(8.5%)、游戏 $7.79 亿(6.8%),合计 $115.36 亿、同比 +50.1%。「数据中心」是一个筐:服务器处理器和 AI 加速卡记在同一行,公司不拆开披露。用一个总量、一个分项、一个增速可以把它反推出来——结果是 2026 年处理器约 $194.5 亿、加速卡约 $138.9 亿,处理器还更大,加总校验完全对上。嵌入式分部=2022 年那笔 $600 亿全股票收购的产物,周期最独立、与 AI 叙事最不相关;但它也是 会计准则口径与调整后口径差异的主要来源——巨额无形资产摊销每个季度都要从利润表里扣一次(第 15 节细算)。
检验一下:四个分部,和那个装了两门生意的筐
5 道题,选完立刻出反馈。做错的那道,恰好是这一节你真正学到东西的地方。
二.3
从一张卡,到一整台机器
产品路线、订单结构,以及怎么读一张规格表才不会被骗
约 6 分钟·1,949 字·5 题
01
四代产品,一条很陡的学习曲线
从「能跑」到「能整机交付」,只用了三年
AMD 的数据中心加速卡叫 Instinct 系列,把产品节奏摆出来是一条很陡的曲线。
MI300X(2023 年)是第一款真正进入主流讨论的产品,卖点很单纯:
显存容量比同期竞品大,能把更大的模型塞进单机——第 2 节「法则一」的标准打法。
MI325X 与 MI355X是两次中期迭代,继续加存储、加算力、改数值格式支持,
意义在于让软件生态开始有东西可以跑——没有连续几代可用的硬件,就不会有人愿意花工夫适配。
MI400/MI450 系列与 Helios 机架是性质完全不同的一步:
它第一次不是在卖一张卡,而是在卖一台机器。
这一步的门槛不在芯片上,在系统工程上——第 6 节讲的那笔整机公司收购,就是为它准备的。
| 项目 | Helios 机架(AMD) | 同期竞品机架(上一代 / 新一代) |
| 加速卡数量 | 72 颗 | 72 颗 / 72 颗 |
| 配套处理器 | 18 颗(自家新一代服务器处理器) | 自研处理器 |
| 单卡存储容量 | 432GB(12 层堆叠) | 288GB / 288GB |
| 单卡存储带宽 | 23.3 TB/s | 8.0 TB/s / 22.2 TB/s |
| 单卡功耗 | 2,500W | 1,400W / 2,300W |
| 整机全包功耗 | 约 257 千瓦 | 约 153 千瓦 / 约 236 千瓦 |
第一眼看这张表,AMD 是全面领先的:存储多一半,带宽也最高。很多看多的论证就从这张表出发。
但这张表最重要的信息其实在最后一行。整机功耗 257 千瓦——
按第 3 节「按吉瓦算」的逻辑,这意味着同一座数据中心能装下的 AMD 机架数量比竞品少。
所以真正的读法是:AMD 提供了更强的标称规格,同时也消耗了更多的电;
到底划不划算,取决于那个「标称」有多少能兑现。
02
规格表上最没用的那个数
标称算力,和它的实际兑现率
买车的人都知道,厂商标的百公里油耗和自己开出来几乎从来对不上——不是造假,
而是标称值是在理想工况下测出来的。芯片的算力标称值同理:厂商标的是理论峰值,
假设所有计算单元一刻不停满负荷工作、数据永远及时到位、没有任何等待,现实中这个假设从来不成立。
业内用模型浮点利用率描述它,公式很简单——有效算力 ≈ 标称算力 × 利用率。
| 整机指标(每台 72 颗) | Helios(AMD) | 同期新一代竞品 | 谁领先 |
| 标称密集算力(整机合计) | 1,440 | 1,260 | AMD 领先 14% |
| 有效训练算力(第三方折算) | 476.8 | 567.0 | 竞品领先 19% |
| 由此隐含的利用率 | 33.1% | 45.0% | 差距就在这一行 |
这张表是本节最有价值的东西:同一台机器,用两把不同的尺子量,排名会反过来。
利用率取决于软件能不能把计算单元喂饱——算子库有没有针对这颗芯片调优、
数据搬运和计算能不能重叠、多卡通信会不会让计算单元空等。
所以「硬件已经追上、只差软件」这个流行说法不准确:软件不行的后果会直接体现在硬件的有效性能上,
它们不是两件事(第 11、12 节专讲)。
换算到成本上结论更明确。行业通用口径叫总持有成本——
买下并运行一台机器的全部代价,包括设备摊销、资金成本、电费、托管和运维。
| 口径 | Helios | 上一代竞品 | 新一代竞品 | 结论 |
| 每卡每小时总持有成本 | $3.10 | $2.32 | $3.62 | AMD 居中 |
| 每单位标称算力的小时成本 | $0.16 | $0.46 | $0.21 | AMD 大幅领先 |
| 每单位有效算力的小时成本 | $0.47 | $0.93 | $0.46 | 优势消失,基本持平 |
一条可以随身带走的检查动作
以后看到任何「每单位算力成本」「性价比领先几倍」的说法,先问一句:
分母是标称算力还是有效算力?
如果对方答不上来、或者只给了标称口径,那这个结论不能直接用来比较。
这不是吹毛求疵——本节的例子里,两种口径给出的是方向相反的答案。
但也要公平地说一句:有效算力口径下 0.47 对 0.46,基本持平,
这本身已经是巨大的进步——两年前 AMD 在这个对比里还差着一个量级。
真正的问题变成了:如果只是持平,客户为什么要冒换供应商的风险?
这个问题的答案,就是下面那份客户名单的结构。
03
订单名单:必须分成两类看
这是评估这条产品线时最容易犯的错
| 客户 | 规模 | 有没有额外对价 | 信号强度 |
| OpenAI | 6 吉瓦 | 有:最多 1.6 亿股认股权证,行权价每股 1 美分 | 混着别的动机 |
| Meta | 6 吉瓦 | 有:条款结构相同,另含新平台的共同设计 | 混着别的动机 |
| Oracle | 首批 5 万颗 MI450,2026 年三季度起部署、2027 年扩大 | 没有 | 强 |
| Microsoft | 已宣布部署新一代机架 | 没有 | 很强——它 2023 年曾放弃 AMD 并连跳两代 |
| Anthropic | 2 吉瓦 | 没有 | 强 |
第 2 节给过验证「第二供应商需求」的两个观察点,现在可以用上了。
第一类(前两行):下单的同时拿到了股权对价。规模最大,但信号是混合的——
客户的动机里既有「这产品好」,也有「这笔股权本身很划算」。
把它当成纯粹的产品力证据,会高估实际情况(代价第 17 节算)。
第二类(后三行):什么额外好处都没拿就下单了。分量重得多,因为它们是被产品本身说服的。
最值得注意的是那家 2023 年曾放弃 AMD 的超大规模厂商——当年的理由是存储不可靠和软件质量太差,
结果连续跳过了后面两代产品。一个曾经用脚投票离开的客户回来了,这是比任何新客户都强的信号。
另外那家云厂的订单口径也值得一说:它公布的是「5 万颗」而不是吉瓦,并明确这是首批、
2026 年三季度起部署、2027 年继续扩大——这种措辞通常意味着它真的排了产线档期。
一句必须跟着「12 吉瓦」一起引用的限定
第三方研究对那两份带股权对价的协议有一句很硬的限定:
「这些认股权证是激励,不是承诺。」
订单仍然取决于 AMD 能不能真的交付出芯片和整机系统;
而且——这一条更关键——客户可以在多个里程碑上退出。
所以这 12 吉瓦不是一张已经锁定的收入表,
而是一串附带条件的选择权,而条件掌握在 AMD 自己的交付能力手里。
这正是第 9 节要讲的——它的交付能力现在到底有几分。
04
为什么这一步非走不可
因为只卖芯片已经拿不到大订单了
最后回答一个基础问题:为什么一家芯片设计公司要去做整机?答案第 4 节已经埋好:
售卖单位变了——客户要的是一台能开箱运行的机器,
而「72 颗芯片怎么配合工作」必须由定义芯片的人来设计,外人做不了。
所以这一步不是扩张野心,是入场资格:
只卖芯片的公司在 2026 年的大订单谈判桌上根本不会被列为候选。
但代价同样明确——它把短板暴露在了一个更大的面上:
做一颗芯片你只要芯片好,做一台机器则互连、信号完整性、装配工艺、软件栈
任何一环拖后腿,整台机器就交付不出来。
这一节要带走的一句话 产品路线四代:MI300X(2023)→ MI325X → MI355X → MI400/MI450 系列 + Helios 机架。Helios 一台装 72 颗加速卡、18 颗处理器、12 颗交换芯片,单卡 432GB 存储、带宽 23.3TB/s、功耗 2,500W,整机全包约 257 千瓦。订单要分两类看:带股权对价的(OpenAI 6 吉瓦、Meta 6 吉瓦,各附最多 1.6 亿股认股权证)与不带任何对价的(Oracle 5 万颗 MI450、Microsoft 调头回来、Anthropic 2 吉瓦)。后一类才是对产品本身的投票。读规格表的第一课:标称算力几乎没有信息量。整机标称 1,440 对 1,260(领先 14%),按第三方折算的有效训练算力却是 476.8 对 567.0(落后 19%)。
检验一下:从一张卡,到一整台机器
5 道题,选完立刻出反馈。做错的那道,恰好是这一节你真正学到东西的地方。
二.4
护城河与短板,一条一条过
把「确实成立的」和「听起来成立但经不起追问的」分开放
约 7 分钟·2,163 字·5 题
01
先说清楚「护城河」这个词该怎么用
判据只有一条:对手要花多久才能学会
「护城河」这个词被用得太随意,什么优点都能装进去。这一节用一个很窄的判据:
一样东西能算护城河,当且仅当对手就算知道你怎么做的,也要花好几年才追得上。
按这个判据「用了最先进的制程」要被剔出去——那不是护城河,是花钱买的,
对手付同样价钱随时能买到同一条产线的产能;「显存比对手大」也一样。
花钱能买到的东西,不构成护城河。
| # | 护城河 | 为什么对手学不快 | 它的边界在哪 |
| ① | 永久的 x86 设计权 |
来自 1995 年的和解,这是法律位置不是技术位置——
第三方就算做出更好的芯片,也不能合法生产 x86 产品 |
保的是「可以合法做」,不保「一定有人买」;
如果软件大规模迁到别的指令集,它会缩水 |
| ② | 小芯片路线上的先发 |
2017 年起全线采用,比同行早了好几代,相关的封装、互连、良率管理经验是靠出货量磨出来的(第 10 节) |
正在被抹平——主要同行现在都转向了这条路线 |
| ③ | 与最先进代工厂绑得最紧 |
首批用上 2 纳米;本地测算 2027 年先进封装配额 53.0 万片,
反超另一家的 48.4 万片,升至该代工厂第二大客户 |
这是配额不是所有权;同一份测算提醒,
AMD 2026 年砍过封装订单,这个数字含执行风险 |
| ④ | 嵌入式那块与 AI 无关的现金流 |
可编程芯片客户黏性极强、产品生命周期以十年计,替换成本高到几乎不换 |
规模不大(2026Q2 仅 $9.77 亿),只能当压舱石,不能当增长引擎 |
第 ③ 条容易被误读成纯粹的好消息。封装配额反超,说明代工厂认为 AMD 的订单值得优先安排,
这比任何管理层表态都硬。但同一份测算把这个第二的来源也写清楚了:它是「分散封装」换来的——
53.0 万片里代工厂自己承担约 24 万片,其余由两家外部封测厂分担,
AMD 不是在最优先那条产线上拿到更多配额,而是把需求摊到了更多家去做,
代价是工艺一致性和良率管理更复杂。这是很典型的「老二解法」:正面拿不到就用组合拳凑,
有效,但不等于同一件事。
03
五处真短板 —— 第二处最该理解
因为它是架构问题,不会随时间自动好转
第一条(软件生态墙)第 11 节整节讲,这里先跳过。
第二条值得在这里讲透,因为它最能说明「老二的成本结构为什么天然更差」。
第 4 节讲过,机架内部最难的是纵向扩展——几十颗芯片之间的超高速互连;
Helios 机架里有 12 颗交换芯片负责把 72 颗加速卡两两连通,这 12 颗 AMD 全部外购。
为什么不自己做?因为做不出来,短期内也没有第二个卖家:第三方分析明确指出,
市面上目前只有一家在出货这个速率等级的商用交换芯片。这是第一次付钱。
开放标准的代价,在这里第一次显形
那颗交换芯片总共 512 条通道,Helios 只用得上 432 条,剩下 80 条闲置——
因为它不是为 72 颗加速卡的架构量身定制的,而走自研专有路线的那一方
带宽被整除,一条通道都不浪费。这就是「协同设计」和「买现成的」之间的差别:
它不体现在任何一张规格表上,只体现在有多少资源被白白浪费掉,
也正是第 2 节「法则二」那个代价的具体形态。
更麻烦的是第二件事。芯片之间靠铜缆传信号,高速信号在铜缆上会衰减,衰减到一定程度接收端就分不出 0 和 1,
解决办法只有两个:要么把信号发得足够干净让它撑到终点,要么半路加一颗芯片把信号重新整形——
后者叫信号中继芯片,发信号的电路叫
串行解串器,而 AMD 的串行解串器按第三方评估是公认的弱项。
结果是 Helios 机内高达 85% 的高速链路要额外加装中继芯片,每台 550 颗以上,
同样只能向那家供应商买——这是第二次付钱;对方的对应背板完全无源,一颗都不需要。
| 对比项 | Helios(AMD) | 同期竞品机架 |
| 机内交换芯片 | 外购,12 颗 | 自研 |
| 交换芯片通道利用 | 512 条里只用 432 条 | 按需定制,无浪费 |
| 背板是否需要信号中继 | 约 85% 的链路需要 | 完全无源,零颗 |
| 每台机器的中继芯片数量 | 550 颗以上 | 0 |
| 这些芯片向谁买 | 同层定制芯片战场上的对手 | 不适用 |
为什么说这是架构问题,不是良率问题
管理层对加速卡毛利率的口径是:略低于公司平均水平,并预期随着机架良率提升而改善。
前半句是事实,后半句只对了一半。
良率提升能解决的是「做十台坏三台」这类问题,这确实会发生;
但它解决不了「每台都要装 550 颗中继芯片」——无论良率多高,这 550 颗都得买、都得装、都得供电。
根源是信号收发电路的设计能力不足,要解决必须等下一代自研电路,或者等 AMD 自己做出交换芯片,
那是以年为单位的事。
而且这 550 颗芯片不提升任何性能,
只是让信号别出错,同时还占电、占空间、增加装配复杂度,纯粹是补丁成本——
回想第 8 节那个「整机功耗 257 千瓦」,现在你知道它的一部分来自哪里了。
第三处:对单一代工厂的依赖。这是 2009 年那次断臂的必然结果(第 6 节)——
AMD 的产品节奏在相当程度上由别人的产能规划决定,没有解法只能管理。
第四处:采购端天然多付钱。第 2 节那个 23.8% 的存储价差就是例子,是位置带来的,
不是谈判能力问题;应对只能靠工程手段——本地研究记录 AMD 在新一代加速卡上
砍掉了一部分常规内存配置,把存储涨价的冲击几乎完全抵消掉(第 14 节详述这个动作的代价)。
第五处:整机量产爬坡的工程债。第三方把「机架量产爬坡慢」列为两大风险之首,理由三条:
没有采用无线缆的托盘设计、高达 85% 的背板需要信号中继、量产中遇到的背板可靠性挑战。
其中「线缆」那条有点讽刺:Helios 内部大量使用独立线缆而不是电路板走线,
光是交换机托盘那一侧就有 1,728 根,每根都是一个潜在失效点;
对方上一代也这么做过、正因吃过苦头才在新一代改成无线缆——
而 AMD 参考的恰恰是对方上一代的架构,等消息公布已经来不及改。
把四条护城河和五处短板放在一起,会看到一个很整齐的结构:
AMD 的护城河集中在「位置」上,短板集中在「能力」上。
永久的设计权、代工厂的配额、嵌入式的客户黏性——这些是它站在什么地方,由历史和外部关系给定;
软件生态、信号电路、系统工程——这些是它自己能做到什么程度,要靠工程师一行代码一版电路地补。
这个结构决定了跟踪这家公司的方法:位置类的东西变化慢,一年看一次就够;
能力类的变化快,而且有公开可查的证据——代码提交、测试状态、客户是否复购,
第 16 节的跟踪表把重心压在后者上。下面三节(单元三)讲的正是最要命的三个能力问题:
小芯片这条护城河还剩多少、软件那道墙有多高、推理这一局有没有可能换个打法。
这一节要带走的一句话 四条真护城河:①永久的 x86 设计权(法律位置,第 6 节);②小芯片路线的先发(第 10 节展开);③与最先进代工绑得最紧——本地测算 2027 年先进封装配额 53.0 万片反超另一家的 48.4 万片,升至代工厂第二大客户;④嵌入式那块与 AI 无关的现金流。五处真短板:①软件生态墙;②机内互连要买两次——交换芯片只能外购,且因高速信号收发电路偏弱,机内约 85% 的链路要额外装信号中继芯片,每台 550 颗以上,而这是架构问题、良率提升解决不了;③对单一代工厂的依赖;④采购端天然多付钱;⑤整机量产爬坡的工程债。
检验一下:护城河与短板,一条一条过
5 道题,选完立刻出反馈。做错的那道,恰好是这一节你真正学到东西的地方。