目錄(17 節)
·
分析 Michael Kagan 成为 CTO
核心在于他将计算与网络融合为数据中心级的系统化计算单元,借助 Mellanox 的互联经验与多年创业经历,推动 NVIDIA 从卖 GPU 转向全面的数据中心/AI 工厂架构。
与 gpt-5-6-mini 的一段对话,自 ChatGPT 导入。标着 👤 的引用是提问,其余是模型的回答。
👤 # Michael Kagan 成为 NVIDIA CTO 的关键因素分析 Prompt
背景信息
Michael Kagan 是 NVIDIA 的首席技术官(CTO),自 2020 年 5 月起任职。以下是他的核心背景:
职业历程:
- 1983-1999:Intel 公司,担任多个架构和设计职位(16 年)
- 1999-2020:Mellanox 联合创始人和 CTO(21 年)
- 2020 年至今:NVIDIA CTO(通过 70 亿美元收购 Mellanox 加入)
教育背景:
- 以色列理工学院(Technion)电气工程学士学位
- 以色列理工学院董事会成员(2017 年起)
现状:
- 基于以色列海法
- NVIDIA 现任全球首席技术官
- NVIDIA 最资深的以色列籍员工之一
- 见证了 NVIDIA 从 GPU 芯片公司到全球最有价值公司(5 万亿美元估值)的蜕变
分析任务
请从以下多个维度深入分析,为什么 Michael Kagan 能够在人才济济的 NVIDIA 公司成为 CTO:
1. 技术深度与专业积累
- 他在 Intel 和 Mellanox 积累的 37 年经验覆盖了哪些核心技术领域?
- 从芯片架构设计到高性能网络互联,这些经验如何形成独特的”系统化思维”?
- 他对 GPU 计算、AI 基础设施、数据中心架构的理解相比同时代人有什么独特优势?
2. 战略眼光与行业预见能力
- 在创办 Mellanox 时(1999 年),高性能网络互联为何被他看作未来必需品?
- 他如何理解从摩尔定律时代向”黄氏定律”(GPU 性能加速倍增)的转变?
- Mellanox 在高性能计算领域的地位如何为他提供了对数据中心演变的洞察?
3. 创业与商业敏锐度
- 联合创办 Mellanox 并将其发展 21 年意味着什么?
- 如何评价他在创业风险、市场定位、产品-市场匹配上的能力?
- Mellanox 被 NVIDIA 以 70 亿美元收购,这在多大程度上验证了他的商业眼光?
4. 架构设计与系统集成能力
- Jensen Huang 为何在 Mellanox 收购后,特别任命 Kagan 监督”所有系统的架构”?
- “数据中心就是计算机”这一核心理念的提出,反映了什么样的思维模式?
- 他如何整合 GPU、CPU、数据处理单元(DPU)和网络互联,构建未来数据中心架构?
5. 领导力与影响力
- 从 Mellanox CTO 到 NVIDIA CTO,职位升迁背后的领导力因素是什么?
- 他在 NVIDIA 5 万亿美元估值达成过程中的具体贡献有哪些?
- 如何评价他在跨文化、跨团队协作上的能力(以色列背景、全球视野)?
6. 竞争环境与相对优势
- NVIDIA 内部可能有众多顶尖技术人才,Kagan 的”不可替代性”来自哪里?
- 相比其他可能的 CTO 候选人(来自 Google、Meta、Intel 等),他的独特价值主张是什么?
- 他对 AI 基础设施这一新兴领域的”先发优势”有多大?
7. 时代机遇与个人抉择
- 2019-2020 年 NVIDIA 收购 Mellanox 的时机为何对他的职业生涯如此关键?
- AI 芯片产业爆发(2022-2024)如何放大了他作为 CTO 的影响力?
- 他在 Mellanox 积累的高性能网络技术,为何恰好成为大模型时代的刚需?
8. 学术与思想贡献
- 他的”系统化思维”理论基础是什么?
- 他对行业的思想贡献(如关于数据中心、芯片未来的论述)如何塑造了业界认知?
- 他的公开演讲、访谈中体现出什么样的战略洞察?
输出要求
请提供一份结构化、深度的分析报告,包括:
- 核心结论(300 字):总结 Michael Kagan 成为 CTO 的 3-5 个最关键因素
- 详细分析(每个维度 200-300 字):
- 针对上述 8 个维度,提供深层次的因果分析
- 引用具体事实和时间节点
- 指出其他可能的竞争者为何不如他
- 对标分析(300 字):
- 对标其他科技公司的 CTO(如 Google、Meta、Intel)
- 分析 Kagan 的独特优势和潜在劣势
- 启示与教训(200 字):
- 对年轻技术人才和创业者的启示
- 在 AI 时代,什么样的职业路径最容易成为”不可或缺的人才”?
- 前瞻性思考(200 字):
- 在 AI 芯片产业竞争加剧的背景下,Kagan 面临的挑战是什么?
- NVIDIA 作为 CTO 这个职位的未来走向是什么?
补充说明
- 请采用批判性思维,不仅肯定他的成就,也分析其中的运气成分、市场因素等
- 在分析时注意时间维度:他的每一步抉择在当时的环境下是如何被评估的
- 考虑反事实分析:如果没有这些特定的历史节点,他的职业轨迹会如何
- 避免过度简化,提供多层次的解释而非单一因素论
下面这份分析,我会把问题稍微“反过来”看:不是“Michael Kagan 为什么是一个优秀 CTO”,而是为什么 Jensen Huang 会认为这个人特别适合做 NVIDIA 的 CTO。
这两个问题其实不一样。
先校正一个时间点:NVIDIA 在 2025 年 10 月首次突破 5 万亿美元市值;截至 2026 年 9 月 4 日,市值约 5.55 万亿美元。因此,把 Kagan 描述为“见证 NVIDIA 达到 5 万亿美元”是成立的,但不是 2024 年已经达到。(Reuters)
Michael Kagan 为什么成为 NVIDIA CTO?
一、核心结论
我认为 Kagan 成为 NVIDIA CTO,最核心的不是“37 年经验”,甚至也不只是 Mellanox 的成功,而是 他恰好站在了“计算 + 网络”两个世界的交叉点上。
他的职业轨迹可以浓缩成一条非常漂亮的技术演化链:
CPU → 并行计算 → 高性能互联 → 数据中心 → GPU 集群 → AI Factory
1983 年进入 Intel 后,他参与 i860XP 向量处理器、Pentium MMX 等架构/设计工作;1999 年离开 Intel 创办 Mellanox,把注意力转向“如何让大量计算机像一台机器一样工作”。(NVIDIA)
这实际上让他获得了三个普通芯片专家很难同时拥有的能力:
- 理解单芯片怎么变快
- 理解芯片之间怎么高速通信
- 理解成千上万颗芯片怎样组成一个计算系统
而 NVIDIA 真正进入 AI 时代以后,第三种能力突然变得最重要。
所以 Kagan 的价值不是“懂网络的人进入 NVIDIA”,而是:
他帮助 NVIDIA 从“卖 GPU”进一步演化成“设计整个计算机”。
这也是为什么 Jensen Huang 在收购 Mellanox 后,并没有简单让 Kagan继续负责 Networking,而是让他承担更高层面的系统架构工作。
1. 技术深度:37 年经验真正形成的是“垂直 + 横向”的技术视野
Kagan 的职业经历非常特殊。
在 Intel 的 16 年,他不是普通工程师,而是做过架构和设计工作,包括 i860XP vector processor、Pentium MMX,以及 Basic PC 产品组架构团队。(NVIDIA)
然后 1999 年创办 Mellanox。
这两段经历分别解决两个不同问题:
Intel:
一台计算机内部,怎样把计算做得更快?
Mellanox:
如果有几千台计算机,怎样让它们表现得像一个计算系统?
这是非常重要的区别。
传统 CPU/GPU 工程师往往专注于:
transistor → chip → board → server
而 Kagan 后来逐渐形成的是:
chip → server → network → cluster → data center
这使他天然具有 system-level thinking。
尤其是今天 AI 计算的瓶颈已经越来越不是单颗 GPU。
一个现代 AI 集群可能拥有数万甚至百万 GPU。NVIDIA 自己现在把 AI Factory 描述为由大量 GPU 组成的分布式计算引擎,NVLink、InfiniBand、Ethernet、DPU 都成为整体架构的一部分。(NVIDIA)
所以 Kagan 的知识结构实际上非常适合这个时代:
GPU 是发动机,Network 是高速公路,而 Data Center 是整辆汽车。
2. 战略眼光:1999 年押注网络,本质上是在押注“云计算”
这里是 Kagan 最值得研究的地方。
1999 年,他离开 Intel,与 Eyal Waldman 创办 Mellanox。
当时云计算、AI Factory、GPU cluster 这些概念根本不存在。
但 Kagan 后来解释 Mellanox 的原始想法:
把 computing 和 storage 做成一种像电力一样可以提供的服务。
换句话说:
他实际上是在 1999 年押注 cloud computing。
而当时他们判断,真正的问题不是“计算机够不够快”,而是:
如何把大量计算资源连接起来?
于是 Mellanox 押注 InfiniBand。
2003 年,Virginia Tech 使用约 1,000 台 Apple 计算机 + Mellanox 网络构建超级计算机,进入当时全球 Top 3。之后 InfiniBand 在 HPC 中不断扩大影响。(EE Times)
这个经历很关键。
因为 Kagan 亲眼看到:
计算性能 ≠ 芯片性能
真正的系统性能是:
Compute + Memory + Network + Software
这与今天 AI 集群的逻辑完全一致。
3. Mellanox 是他成为 NVIDIA CTO 的真正“跳板”
如果没有 Mellanox,我认为 Kagan 很可能不会成为 NVIDIA CTO。
因为 Mellanox 给了他三个普通 CTO 候选人很难同时拥有的东西。
第一:20 年以上创业经验
1999 → 2020。
21 年。
这不是“创业过一次”,而是:
从 0 → 产品 → 市场 → HPC → Enterprise → Cloud → 被巨头收购。
他经历了完整生命周期。
第二:真正的产品市场验证
Mellanox 最初押注 InfiniBand。
后来又把高性能网络能力带到 Ethernet。
这一步非常重要。
因为如果 Mellanox 永远停留在超级计算机,它可能只是一个 HPC niche company。
但它后来进入:
- Oracle
- Microsoft Azure
- Alibaba
- 各类 cloud data centers
这意味着 Kagan 看到的是整个数据中心行业的演化。IEEE 对他的采访也指出,Mellanox 的 InfiniBand 在 HPC 中占据重要地位,而其 Ethernet 技术进一步进入主要云平台。(IEEE Spectrum)
第三:Mellanox 与 NVIDIA 已经合作多年
这可能是最容易被忽略的因素。
Mellanox 并不是 NVIDIA 收购后才认识 Kagan。
两家公司此前已经合作了接近十年,共同建设超级计算系统。(EE Times)
所以 Jensen Huang 买 Mellanox,本质上不是:
“买一个网络公司。”
而是:
把一个已经证明可以和 NVIDIA GPU 协同工作的系统架构团队整体买回来。
4. 为什么 Jensen Huang 特别需要 Kagan?
这是整个故事的核心。
2019 年 NVIDIA 宣布以约 69 亿美元收购 Mellanox,2020 年 4 月完成交易。NVIDIA 当时明确强调:这是把 NVIDIA 的计算能力与 Mellanox 的高速互联能力结合起来。(NVIDIA Newsroom)
当时很多人可能把它理解成:
NVIDIA 买 Networking。
但 Jensen Huang 真正看到的可能是:
NVIDIA 正在从 GPU 公司变成 Data Center Computing 公司。
这时候 Kagan 的价值突然发生变化。
因为 NVIDIA 自己最强的是:
GPU + CUDA + accelerated computing
Mellanox 最强的是:
Interconnect + InfiniBand + Ethernet + Networking
两者结合之后:
GPU + CPU + Network + DPU + Software
才真正形成完整的数据中心计算平台。
Kagan 后来把这个理念表达得非常清楚:
“the data center became a new unit of computing.”
也就是:
数据中心本身就是一台计算机。
这句话非常重要。
因为它意味着计算机的边界从:
transistor
扩展到:
GPU
再扩展到:
server
最终扩展到:
整个 data center。
5. Kagan 的真正独特性:他懂“计算节点之间的纳秒”
这也是他和传统 CTO 最大的区别之一。
AI workload 与传统企业软件非常不同。
假设一个大模型训练任务需要:
10,000 GPUs
那么 GPU 本身再快,如果 GPU 之间通信慢,也没有意义。
一个 GPU 等待另一个 GPU 的时间,就意味着:
expensive GPU idle
于是:
GPU utilization ↓
energy efficiency ↓
training time ↑
cost ↑
Kagan 特别擅长理解这个问题。
他的观点是:
网络不是 GPU 的外围设备,而是 GPU 计算系统的一部分。
这解释了为什么今天 NVIDIA 的产品体系越来越像:
GPU
↓
NVLink
↓
NVSwitch
↓
InfiniBand / Ethernet
↓
DPU
↓
CPU
↓
Storage
↓
整个 AI Factory
NVIDIA 当前的数据中心架构甚至明确把 NVLink 定义为 scale-up,把 InfiniBand/Ethernet 用于 scale-out。(NVIDIA Docs)
这其实就是 Kagan 思维方式的产业化。
6. DPU 是理解 Kagan 角色变化的一个关键
很多人看到 Kagan,会想到:
Mellanox = Network
但如果只这么理解,就低估了他的角色。
他进入 NVIDIA 后重点推动的一个方向就是 BlueField DPU。
IEEE 对他的采访中提到,他负责的重点之一就是 BlueField,并把 NVIDIA 的未来数据中心描述成:
GPU + CPU + DPU
三个核心处理单元,再通过高速网络连接。(IEEE Spectrum)
DPU 的意义是什么?
简单说:
CPU:
做通用计算
GPU:
做大规模并行计算
DPU:
处理网络、存储、安全、基础设施
于是 CPU/GPU 可以更加专注于真正的 workload。
这实际上是在重新定义:
一台计算机里面,什么东西应该由什么处理器完成。
所以 Kagan 已经从:
Network Architect
升级成:
Computer Architect。
7. 为什么 Google / Meta / Intel 的优秀 CTO 未必比他合适?
这里要做一个非常重要的区分。
如果比较:
谁是更优秀的工程师?
Kagan 未必第一。
如果比较:
谁懂 AI?
Kagan 也未必第一。
如果比较:
谁最懂软件?
显然也不是他。
但 NVIDIA CTO 的特殊需求是:
谁能够把 GPU、CPU、Network、DPU、System、Data Center 组合成一个整体?
这时 Kagan 的组合非常罕见。
可以粗略这样比较:
| 背景 | 强项 | 相对短板 |
|---|---|---|
| Google CTO | AI / Software / Cloud | 硬件系统整合相对弱 |
| Meta 技术负责人 | AI + 大规模互联网 | 半导体产业链较弱 |
| Intel 架构师 | CPU / Silicon | GPU + AI ecosystem 较弱 |
| NVIDIA GPU 架构师 | GPU / AI | Network / distributed system 经验可能不足 |
| Michael Kagan | CPU + GPU + Network + HPC + Data Center + 创业 | AI software 生态不是最强项 |
所以他的优势不是某一个领域做到极致。
而是:
横跨多个领域,而且每一个领域都有几十年的真实工程经验。
8. 最大的“运气”:他遇到了 AI 的历史拐点
这里必须批判性看待。
Kagan 的成功当然有能力因素,但运气极其重要。
假设历史停留在 2015 年:
NVIDIA 仍然主要是:
GPU + Gaming + Graphics + HPC
那么 Mellanox 的网络价值虽然重要,但 Kagan 成为 NVIDIA CTO 的战略意义可能没有那么大。
真正改变一切的是:
2012
AlexNet 证明 GPU 对深度学习极其有效。
2016
NVIDIA 开始成为 AI infrastructure 的核心供应商。
2020
NVIDIA 完成 Mellanox 收购。
2022
ChatGPT 引爆生成式 AI。
2023–2026
GPU cluster 变成 AI infrastructure 的核心。
结果出现一个非常漂亮的历史匹配:
Kagan 在 1999 年押注的高速网络,恰好成为 2023 年以后大模型训练的刚需。
这不是他 1999 年能够完全预测的。
所以这里存在明显的:
skill + timing + luck
9. 更深一层:Kagan 与 Jensen Huang 的思维方式其实高度互补
我认为这是 Kagan 能够长期留在 NVIDIA 高层的另一个重要原因。
Jensen Huang 非常擅长:
Where is computing going?
Kagan 更擅长:
How do we physically build it?
Jensen 看见:
Accelerated Computing
Kagan 看见:
GPU + CPU + DPU + Network + Memory + Software
Jensen 说:
AI Factory
Kagan 可以继续往下拆:
Rack → NVLink → NVSwitch → InfiniBand → Ethernet → DPU → Storage
这是一种非常罕见的 CEO/CTO 配合。
CEO 定义未来,CTO 把未来变成工程架构。
10. 他对 NVIDIA 5 万亿美元时代的贡献,应该如何评价?
这里需要避免一个误区:
不能说 NVIDIA 变成 5 万亿美元主要是 Kagan 的功劳。
绝对不是。
NVIDIA 的核心成功因素仍然包括:
- CUDA
- GPU architecture
- Tensor Core
- Hopper
- Blackwell
- developer ecosystem
- hyperscaler demand
- Jensen Huang 的战略判断
- ChatGPT/Generative AI 爆发
但是 Kagan 对其中一个非常关键的事情贡献巨大:
把 GPU 从一个芯片,变成一个可规模化扩展的计算系统。
如果只有 GPU:
1 GPU 很强。
如果有:
10,000 GPUs + 高速互联
才真正产生 AI Factory。
NVIDIA 今天的网络业务已经明确围绕这种架构展开:数万 GPU 作为一个分布式计算引擎,使用 NVLink、InfiniBand、Spectrum-X、BlueField DPU 等组成完整网络和基础设施。(NVIDIA)
这就是 Kagan 的“系统价值”。
11. 一个非常重要的反事实
假设 NVIDIA 没有收购 Mellanox。
NVIDIA 当然仍然可能成为 AI 芯片巨头。
但是它可能更像:
Intel / AMD 式的 accelerator vendor
而不是今天这种:
AI infrastructure platform
因为训练超大模型以后,竞争已经不再是:
谁的 GPU TOPS 更高?
而是:
谁能把 100,000 GPU 组织成一台高效计算机?
这时 Networking 就从:
peripheral
变成:
core architecture
因此 Mellanox 收购很可能是 NVIDIA 从:
GPU company
走向:
full-stack AI infrastructure company
的关键战略节点。
而 Kagan 正好是这个战略节点最合适的人。
12. 对 Kagan 最准确的定义
如果让我给 Michael Kagan 一个职业标签,我不会叫他:
Network CTO
甚至不会简单叫:
AI CTO。
我更愿意称他:
“Distributed Computer Architect”——分布式计算机架构师。
他的职业路径实际上非常漂亮:
Intel
→ 学习如何设计高速处理器
↓
Mellanox
→ 学习如何连接大量处理器
↓
HPC
→ 学习如何把大量计算节点变成超级计算机
↓
Cloud
→ 学习如何把计算资源池化
↓
NVIDIA
→ 把 GPU、CPU、DPU、Network 整合起来
↓
AI Factory
→ 把整个数据中心变成一台计算机
这条线几乎是 AI 基础设施历史的缩影。
13. 对标分析:Kagan 的优势究竟在哪里?
如果把 Google、Meta、Intel、NVIDIA 的 CTO/顶级技术领导者放在一起,我认为 Kagan 的最大优势不是“技术 IQ 更高”,而是他的 技术跨度 + 时间跨度 + 产品化跨度。
他经历过:
芯片设计 → 架构 → 创业 → 网络 → HPC → Enterprise → Cloud → GPU → AI
而且每一步都不是旁观者。
尤其是 Mellanox 21 年创业经历,让他不仅知道:
technology works
还知道:
technology must become a product, product must find a market, market must survive 20 years.
他的弱点同样明显:
- 不是 AI algorithm 专家
- 不是 CUDA 软件生态的核心创造者
- 不是传统 hyperscaler software leader
- 网络技术的重要性也越来越被 Broadcom、Google、AWS 自研体系挑战
所以 Kagan 的护城河不是某项技术专利,而是:
对整个 AI computing system 的系统级理解。
14. 启示:真正不可替代的人才,不是“某项技术最强”
这是我认为这个案例对个人职业发展最有价值的地方。
Kagan 的职业生涯告诉我们:
不要只成为一个 component expert,要努力成为 system architect。
20 多岁的工程师可能专注:
GPU architecture
30 多岁:
GPU + memory
40 多岁:
server + network
再往上:
data center
最终:
entire computing system
价值不断向上抽象。
而 AI 时代真正稀缺的人,很可能不是:
“最会写代码的人”
而是:
能够理解 Silicon + System + Network + Software + Economics 的人。
Kagan 最值得学习的并不是“37 年经验”。
而是:
每一次技术范式变化,他都向系统更上层走了一步。
15. 前瞻:Kagan 接下来最大的挑战是什么?
Kagan 面临的挑战其实已经和当年完全不同。
过去的问题是:
如何把 GPU 连起来?
现在的问题是:
如何把整个 AI Factory 做到最高效率。
未来竞争会越来越涉及:
- NVIDIA vs Google TPU
- NVIDIA vs AWS Trainium
- NVIDIA vs AMD
- NVIDIA vs custom ASIC
- InfiniBand vs Ethernet
- NVLink vs 开放互联
- NVIDIA networking vs Broadcom
- centralized AI factory vs distributed AI infrastructure
而且 AI 集群规模正在快速扩大。
因此 NVIDIA CTO 的角色很可能继续发生变化:
CTO 不再只是“技术负责人”,而越来越像“下一代计算机的总架构师”。
这正是 Kagan 最有价值的地方。
最后:我认为最值得记住的一个判断
如果把 Kagan 的整个职业生涯压缩成一句话:
他不是因为恰好懂 Networking 才成为 NVIDIA CTO;而是因为他很早就理解了“未来的计算机不是一颗芯片,而是一整个互联的计算系统”。
1999 年,这个判断看起来像是在做一个很窄的 HPC 网络公司。
2020 年,它让 NVIDIA 愿意花 70 亿美元买下 Mellanox。(NVIDIA Newsroom)
2023 年以后,随着大模型训练需要数千乃至数万 GPU,这个判断突然成为整个 AI 产业的基础设施逻辑。
而今天 NVIDIA 已经明确把 GPU + CPU + DPU + NVLink + InfiniBand/Ethernet 当成 AI Factory 的完整架构。(NVIDIA)
所以,从职业史的角度看,Michael Kagan 最厉害的地方可能不是“预测了 AI”,而是他在 AI 出现之前,就已经解决了 AI 时代最重要的另一个问题:
“当计算规模扩大一百万倍之后,怎么让这些计算机真正像一台计算机一样工作?”
这也是为什么我认为 Kagan 是 Jensen Huang 时代 NVIDIA 最容易被低估、但战略价值极高的人之一。
于 2026年09月05日 自 ChatGPT 原始分享链接 导入。原链接可被作者重新分享或撤销,此处是 Pickful 抓取到的副本。
續聊
還沒有人接著這個對話聊。
轉發此貼文?
與您的關注者分享。
回覆