Skip to main content
目錄 目錄(17 節)

Love

 · 

分析 Michael Kagan 成为 CTO

核心在于他将计算与网络融合为数据中心级的系统化计算单元,借助 Mellanox 的互联经验与多年创业经历,推动 NVIDIA 从卖 GPU 转向全面的数据中心/AI 工厂架构。

与 gpt-5-6-mini 的一段对话,自 ChatGPT 导入。标着 👤 的引用是提问,其余是模型的回答。

👤 # Michael Kagan 成为 NVIDIA CTO 的关键因素分析 Prompt

背景信息

Michael Kagan 是 NVIDIA 的首席技术官(CTO),自 2020 年 5 月起任职。以下是他的核心背景:

职业历程:

  • 1983-1999:Intel 公司,担任多个架构和设计职位(16 年)
  • 1999-2020:Mellanox 联合创始人和 CTO(21 年)
  • 2020 年至今:NVIDIA CTO(通过 70 亿美元收购 Mellanox 加入)

教育背景:

  • 以色列理工学院(Technion)电气工程学士学位
  • 以色列理工学院董事会成员(2017 年起)

现状:

  • 基于以色列海法
  • NVIDIA 现任全球首席技术官
  • NVIDIA 最资深的以色列籍员工之一
  • 见证了 NVIDIA 从 GPU 芯片公司到全球最有价值公司(5 万亿美元估值)的蜕变

分析任务

请从以下多个维度深入分析,为什么 Michael Kagan 能够在人才济济的 NVIDIA 公司成为 CTO:

1. 技术深度与专业积累

  • 他在 Intel 和 Mellanox 积累的 37 年经验覆盖了哪些核心技术领域?
  • 从芯片架构设计到高性能网络互联,这些经验如何形成独特的”系统化思维”?
  • 他对 GPU 计算、AI 基础设施、数据中心架构的理解相比同时代人有什么独特优势?

2. 战略眼光与行业预见能力

  • 在创办 Mellanox 时(1999 年),高性能网络互联为何被他看作未来必需品?
  • 他如何理解从摩尔定律时代向”黄氏定律”(GPU 性能加速倍增)的转变?
  • Mellanox 在高性能计算领域的地位如何为他提供了对数据中心演变的洞察?

3. 创业与商业敏锐度

  • 联合创办 Mellanox 并将其发展 21 年意味着什么?
  • 如何评价他在创业风险、市场定位、产品-市场匹配上的能力?
  • Mellanox 被 NVIDIA 以 70 亿美元收购,这在多大程度上验证了他的商业眼光?

4. 架构设计与系统集成能力

  • Jensen Huang 为何在 Mellanox 收购后,特别任命 Kagan 监督”所有系统的架构”?
  • “数据中心就是计算机”这一核心理念的提出,反映了什么样的思维模式?
  • 他如何整合 GPU、CPU、数据处理单元(DPU)和网络互联,构建未来数据中心架构?

5. 领导力与影响力

  • 从 Mellanox CTO 到 NVIDIA CTO,职位升迁背后的领导力因素是什么?
  • 他在 NVIDIA 5 万亿美元估值达成过程中的具体贡献有哪些?
  • 如何评价他在跨文化、跨团队协作上的能力(以色列背景、全球视野)?

6. 竞争环境与相对优势

  • NVIDIA 内部可能有众多顶尖技术人才,Kagan 的”不可替代性”来自哪里?
  • 相比其他可能的 CTO 候选人(来自 Google、Meta、Intel 等),他的独特价值主张是什么?
  • 他对 AI 基础设施这一新兴领域的”先发优势”有多大?

7. 时代机遇与个人抉择

  • 2019-2020 年 NVIDIA 收购 Mellanox 的时机为何对他的职业生涯如此关键?
  • AI 芯片产业爆发(2022-2024)如何放大了他作为 CTO 的影响力?
  • 他在 Mellanox 积累的高性能网络技术,为何恰好成为大模型时代的刚需?

8. 学术与思想贡献

  • 他的”系统化思维”理论基础是什么?
  • 他对行业的思想贡献(如关于数据中心、芯片未来的论述)如何塑造了业界认知?
  • 他的公开演讲、访谈中体现出什么样的战略洞察?

输出要求

请提供一份结构化、深度的分析报告,包括:

  1. 核心结论(300 字):总结 Michael Kagan 成为 CTO 的 3-5 个最关键因素
  2. 详细分析(每个维度 200-300 字):
    • 针对上述 8 个维度,提供深层次的因果分析
    • 引用具体事实和时间节点
    • 指出其他可能的竞争者为何不如他
  3. 对标分析(300 字):
    • 对标其他科技公司的 CTO(如 Google、Meta、Intel)
    • 分析 Kagan 的独特优势和潜在劣势
  4. 启示与教训(200 字):
    • 对年轻技术人才和创业者的启示
    • 在 AI 时代,什么样的职业路径最容易成为”不可或缺的人才”?
  5. 前瞻性思考(200 字):
    • 在 AI 芯片产业竞争加剧的背景下,Kagan 面临的挑战是什么?
    • NVIDIA 作为 CTO 这个职位的未来走向是什么?

补充说明

  • 请采用批判性思维,不仅肯定他的成就,也分析其中的运气成分、市场因素等
  • 在分析时注意时间维度:他的每一步抉择在当时的环境下是如何被评估的
  • 考虑反事实分析:如果没有这些特定的历史节点,他的职业轨迹会如何
  • 避免过度简化,提供多层次的解释而非单一因素论

下面这份分析,我会把问题稍微“反过来”看:不是“Michael Kagan 为什么是一个优秀 CTO”,而是为什么 Jensen Huang 会认为这个人特别适合做 NVIDIA 的 CTO。

这两个问题其实不一样。

先校正一个时间点:NVIDIA 在 2025 年 10 月首次突破 5 万亿美元市值;截至 2026 年 9 月 4 日,市值约 5.55 万亿美元。因此,把 Kagan 描述为“见证 NVIDIA 达到 5 万亿美元”是成立的,但不是 2024 年已经达到。(Reuters)


Michael Kagan 为什么成为 NVIDIA CTO?

一、核心结论

我认为 Kagan 成为 NVIDIA CTO,最核心的不是“37 年经验”,甚至也不只是 Mellanox 的成功,而是 他恰好站在了“计算 + 网络”两个世界的交叉点上

他的职业轨迹可以浓缩成一条非常漂亮的技术演化链:

CPU → 并行计算 → 高性能互联 → 数据中心 → GPU 集群 → AI Factory

1983 年进入 Intel 后,他参与 i860XP 向量处理器、Pentium MMX 等架构/设计工作;1999 年离开 Intel 创办 Mellanox,把注意力转向“如何让大量计算机像一台机器一样工作”。(NVIDIA)

这实际上让他获得了三个普通芯片专家很难同时拥有的能力:

  1. 理解单芯片怎么变快
  2. 理解芯片之间怎么高速通信
  3. 理解成千上万颗芯片怎样组成一个计算系统

而 NVIDIA 真正进入 AI 时代以后,第三种能力突然变得最重要。

所以 Kagan 的价值不是“懂网络的人进入 NVIDIA”,而是:

他帮助 NVIDIA 从“卖 GPU”进一步演化成“设计整个计算机”。

这也是为什么 Jensen Huang 在收购 Mellanox 后,并没有简单让 Kagan继续负责 Networking,而是让他承担更高层面的系统架构工作。


1. 技术深度:37 年经验真正形成的是“垂直 + 横向”的技术视野

Kagan 的职业经历非常特殊。

在 Intel 的 16 年,他不是普通工程师,而是做过架构和设计工作,包括 i860XP vector processor、Pentium MMX,以及 Basic PC 产品组架构团队。(NVIDIA)

然后 1999 年创办 Mellanox。

这两段经历分别解决两个不同问题:

Intel:

一台计算机内部,怎样把计算做得更快?

Mellanox:

如果有几千台计算机,怎样让它们表现得像一个计算系统?

这是非常重要的区别。

传统 CPU/GPU 工程师往往专注于:

transistor → chip → board → server

而 Kagan 后来逐渐形成的是:

chip → server → network → cluster → data center

这使他天然具有 system-level thinking

尤其是今天 AI 计算的瓶颈已经越来越不是单颗 GPU。

一个现代 AI 集群可能拥有数万甚至百万 GPU。NVIDIA 自己现在把 AI Factory 描述为由大量 GPU 组成的分布式计算引擎,NVLink、InfiniBand、Ethernet、DPU 都成为整体架构的一部分。(NVIDIA)

所以 Kagan 的知识结构实际上非常适合这个时代:

GPU 是发动机,Network 是高速公路,而 Data Center 是整辆汽车。


2. 战略眼光:1999 年押注网络,本质上是在押注“云计算”

这里是 Kagan 最值得研究的地方。

1999 年,他离开 Intel,与 Eyal Waldman 创办 Mellanox。

当时云计算、AI Factory、GPU cluster 这些概念根本不存在。

但 Kagan 后来解释 Mellanox 的原始想法:

把 computing 和 storage 做成一种像电力一样可以提供的服务。

换句话说:

他实际上是在 1999 年押注 cloud computing。

而当时他们判断,真正的问题不是“计算机够不够快”,而是:

如何把大量计算资源连接起来?

于是 Mellanox 押注 InfiniBand。

2003 年,Virginia Tech 使用约 1,000 台 Apple 计算机 + Mellanox 网络构建超级计算机,进入当时全球 Top 3。之后 InfiniBand 在 HPC 中不断扩大影响。(EE Times)

这个经历很关键。

因为 Kagan 亲眼看到:

计算性能 ≠ 芯片性能

真正的系统性能是:

Compute + Memory + Network + Software

这与今天 AI 集群的逻辑完全一致。


3. Mellanox 是他成为 NVIDIA CTO 的真正“跳板”

如果没有 Mellanox,我认为 Kagan 很可能不会成为 NVIDIA CTO

因为 Mellanox 给了他三个普通 CTO 候选人很难同时拥有的东西。

第一:20 年以上创业经验

1999 → 2020。

21 年。

这不是“创业过一次”,而是:

从 0 → 产品 → 市场 → HPC → Enterprise → Cloud → 被巨头收购。

他经历了完整生命周期。

第二:真正的产品市场验证

Mellanox 最初押注 InfiniBand。

后来又把高性能网络能力带到 Ethernet。

这一步非常重要。

因为如果 Mellanox 永远停留在超级计算机,它可能只是一个 HPC niche company。

但它后来进入:

  • Oracle
  • Facebook
  • Microsoft Azure
  • Alibaba
  • 各类 cloud data centers

这意味着 Kagan 看到的是整个数据中心行业的演化。IEEE 对他的采访也指出,Mellanox 的 InfiniBand 在 HPC 中占据重要地位,而其 Ethernet 技术进一步进入主要云平台。(IEEE Spectrum)

第三:Mellanox 与 NVIDIA 已经合作多年

这可能是最容易被忽略的因素。

Mellanox 并不是 NVIDIA 收购后才认识 Kagan。

两家公司此前已经合作了接近十年,共同建设超级计算系统。(EE Times)

所以 Jensen Huang 买 Mellanox,本质上不是:

“买一个网络公司。”

而是:

把一个已经证明可以和 NVIDIA GPU 协同工作的系统架构团队整体买回来。


4. 为什么 Jensen Huang 特别需要 Kagan?

这是整个故事的核心。

2019 年 NVIDIA 宣布以约 69 亿美元收购 Mellanox,2020 年 4 月完成交易。NVIDIA 当时明确强调:这是把 NVIDIA 的计算能力与 Mellanox 的高速互联能力结合起来。(NVIDIA Newsroom)

当时很多人可能把它理解成:

NVIDIA 买 Networking。

但 Jensen Huang 真正看到的可能是:

NVIDIA 正在从 GPU 公司变成 Data Center Computing 公司。

这时候 Kagan 的价值突然发生变化。

因为 NVIDIA 自己最强的是:

GPU + CUDA + accelerated computing

Mellanox 最强的是:

Interconnect + InfiniBand + Ethernet + Networking

两者结合之后:

GPU + CPU + Network + DPU + Software

才真正形成完整的数据中心计算平台。

Kagan 后来把这个理念表达得非常清楚:

“the data center became a new unit of computing.”

也就是:

数据中心本身就是一台计算机。

这句话非常重要。

因为它意味着计算机的边界从:

transistor

扩展到:

GPU

再扩展到:

server

最终扩展到:

整个 data center。


5. Kagan 的真正独特性:他懂“计算节点之间的纳秒”

这也是他和传统 CTO 最大的区别之一。

AI workload 与传统企业软件非常不同。

假设一个大模型训练任务需要:

10,000 GPUs

那么 GPU 本身再快,如果 GPU 之间通信慢,也没有意义。

一个 GPU 等待另一个 GPU 的时间,就意味着:

expensive GPU idle

于是:

GPU utilization ↓
energy efficiency ↓
training time ↑
cost ↑

Kagan 特别擅长理解这个问题。

他的观点是:

网络不是 GPU 的外围设备,而是 GPU 计算系统的一部分。

这解释了为什么今天 NVIDIA 的产品体系越来越像:

GPU

NVLink

NVSwitch

InfiniBand / Ethernet

DPU

CPU

Storage

整个 AI Factory

NVIDIA 当前的数据中心架构甚至明确把 NVLink 定义为 scale-up,把 InfiniBand/Ethernet 用于 scale-out。(NVIDIA Docs)

这其实就是 Kagan 思维方式的产业化。


6. DPU 是理解 Kagan 角色变化的一个关键

很多人看到 Kagan,会想到:

Mellanox = Network

但如果只这么理解,就低估了他的角色。

他进入 NVIDIA 后重点推动的一个方向就是 BlueField DPU

IEEE 对他的采访中提到,他负责的重点之一就是 BlueField,并把 NVIDIA 的未来数据中心描述成:

GPU + CPU + DPU

三个核心处理单元,再通过高速网络连接。(IEEE Spectrum)

DPU 的意义是什么?

简单说:

CPU:

做通用计算

GPU:

做大规模并行计算

DPU:

处理网络、存储、安全、基础设施

于是 CPU/GPU 可以更加专注于真正的 workload。

这实际上是在重新定义:

一台计算机里面,什么东西应该由什么处理器完成。

所以 Kagan 已经从:

Network Architect

升级成:

Computer Architect。


7. 为什么 Google / Meta / Intel 的优秀 CTO 未必比他合适?

这里要做一个非常重要的区分。

如果比较:

谁是更优秀的工程师?

Kagan 未必第一。

如果比较:

谁懂 AI?

Kagan 也未必第一。

如果比较:

谁最懂软件?

显然也不是他。

但 NVIDIA CTO 的特殊需求是:

谁能够把 GPU、CPU、Network、DPU、System、Data Center 组合成一个整体?

这时 Kagan 的组合非常罕见。

可以粗略这样比较:

背景 强项 相对短板
Google CTO AI / Software / Cloud 硬件系统整合相对弱
Meta 技术负责人 AI + 大规模互联网 半导体产业链较弱
Intel 架构师 CPU / Silicon GPU + AI ecosystem 较弱
NVIDIA GPU 架构师 GPU / AI Network / distributed system 经验可能不足
Michael Kagan CPU + GPU + Network + HPC + Data Center + 创业 AI software 生态不是最强项

所以他的优势不是某一个领域做到极致。

而是:

横跨多个领域,而且每一个领域都有几十年的真实工程经验。


8. 最大的“运气”:他遇到了 AI 的历史拐点

这里必须批判性看待。

Kagan 的成功当然有能力因素,但运气极其重要

假设历史停留在 2015 年:

NVIDIA 仍然主要是:

GPU + Gaming + Graphics + HPC

那么 Mellanox 的网络价值虽然重要,但 Kagan 成为 NVIDIA CTO 的战略意义可能没有那么大。

真正改变一切的是:

2012

AlexNet 证明 GPU 对深度学习极其有效。

2016

NVIDIA 开始成为 AI infrastructure 的核心供应商。

2020

NVIDIA 完成 Mellanox 收购。

2022

ChatGPT 引爆生成式 AI。

2023–2026

GPU cluster 变成 AI infrastructure 的核心。

结果出现一个非常漂亮的历史匹配:

Kagan 在 1999 年押注的高速网络,恰好成为 2023 年以后大模型训练的刚需。

这不是他 1999 年能够完全预测的。

所以这里存在明显的:

skill + timing + luck


9. 更深一层:Kagan 与 Jensen Huang 的思维方式其实高度互补

我认为这是 Kagan 能够长期留在 NVIDIA 高层的另一个重要原因。

Jensen Huang 非常擅长:

Where is computing going?

Kagan 更擅长:

How do we physically build it?

Jensen 看见:

Accelerated Computing

Kagan 看见:

GPU + CPU + DPU + Network + Memory + Software

Jensen 说:

AI Factory

Kagan 可以继续往下拆:

Rack → NVLink → NVSwitch → InfiniBand → Ethernet → DPU → Storage

这是一种非常罕见的 CEO/CTO 配合。

CEO 定义未来,CTO 把未来变成工程架构。


10. 他对 NVIDIA 5 万亿美元时代的贡献,应该如何评价?

这里需要避免一个误区:

不能说 NVIDIA 变成 5 万亿美元主要是 Kagan 的功劳。

绝对不是。

NVIDIA 的核心成功因素仍然包括:

  • CUDA
  • GPU architecture
  • Tensor Core
  • Hopper
  • Blackwell
  • developer ecosystem
  • hyperscaler demand
  • Jensen Huang 的战略判断
  • ChatGPT/Generative AI 爆发

但是 Kagan 对其中一个非常关键的事情贡献巨大:

把 GPU 从一个芯片,变成一个可规模化扩展的计算系统。

如果只有 GPU:

1 GPU 很强。

如果有:

10,000 GPUs + 高速互联

才真正产生 AI Factory。

NVIDIA 今天的网络业务已经明确围绕这种架构展开:数万 GPU 作为一个分布式计算引擎,使用 NVLink、InfiniBand、Spectrum-X、BlueField DPU 等组成完整网络和基础设施。(NVIDIA)

这就是 Kagan 的“系统价值”。


11. 一个非常重要的反事实

假设 NVIDIA 没有收购 Mellanox

NVIDIA 当然仍然可能成为 AI 芯片巨头。

但是它可能更像:

Intel / AMD 式的 accelerator vendor

而不是今天这种:

AI infrastructure platform

因为训练超大模型以后,竞争已经不再是:

谁的 GPU TOPS 更高?

而是:

谁能把 100,000 GPU 组织成一台高效计算机?

这时 Networking 就从:

peripheral

变成:

core architecture

因此 Mellanox 收购很可能是 NVIDIA 从:

GPU company

走向:

full-stack AI infrastructure company

的关键战略节点。

而 Kagan 正好是这个战略节点最合适的人。


12. 对 Kagan 最准确的定义

如果让我给 Michael Kagan 一个职业标签,我不会叫他:

Network CTO

甚至不会简单叫:

AI CTO。

我更愿意称他:

“Distributed Computer Architect”——分布式计算机架构师。

他的职业路径实际上非常漂亮:

Intel

→ 学习如何设计高速处理器

Mellanox

→ 学习如何连接大量处理器

HPC

→ 学习如何把大量计算节点变成超级计算机

Cloud

→ 学习如何把计算资源池化

NVIDIA

→ 把 GPU、CPU、DPU、Network 整合起来

AI Factory

→ 把整个数据中心变成一台计算机

这条线几乎是 AI 基础设施历史的缩影。


13. 对标分析:Kagan 的优势究竟在哪里?

如果把 Google、Meta、Intel、NVIDIA 的 CTO/顶级技术领导者放在一起,我认为 Kagan 的最大优势不是“技术 IQ 更高”,而是他的 技术跨度 + 时间跨度 + 产品化跨度

他经历过:

芯片设计 → 架构 → 创业 → 网络 → HPC → Enterprise → Cloud → GPU → AI

而且每一步都不是旁观者。

尤其是 Mellanox 21 年创业经历,让他不仅知道:

technology works

还知道:

technology must become a product, product must find a market, market must survive 20 years.

他的弱点同样明显:

  • 不是 AI algorithm 专家
  • 不是 CUDA 软件生态的核心创造者
  • 不是传统 hyperscaler software leader
  • 网络技术的重要性也越来越被 Broadcom、Google、AWS 自研体系挑战

所以 Kagan 的护城河不是某项技术专利,而是:

对整个 AI computing system 的系统级理解。


14. 启示:真正不可替代的人才,不是“某项技术最强”

这是我认为这个案例对个人职业发展最有价值的地方。

Kagan 的职业生涯告诉我们:

不要只成为一个 component expert,要努力成为 system architect。

20 多岁的工程师可能专注:

GPU architecture

30 多岁:

GPU + memory

40 多岁:

server + network

再往上:

data center

最终:

entire computing system

价值不断向上抽象。

而 AI 时代真正稀缺的人,很可能不是:

“最会写代码的人”

而是:

能够理解 Silicon + System + Network + Software + Economics 的人。

Kagan 最值得学习的并不是“37 年经验”。

而是:

每一次技术范式变化,他都向系统更上层走了一步。


15. 前瞻:Kagan 接下来最大的挑战是什么?

Kagan 面临的挑战其实已经和当年完全不同。

过去的问题是:

如何把 GPU 连起来?

现在的问题是:

如何把整个 AI Factory 做到最高效率。

未来竞争会越来越涉及:

  • NVIDIA vs Google TPU
  • NVIDIA vs AWS Trainium
  • NVIDIA vs AMD
  • NVIDIA vs custom ASIC
  • InfiniBand vs Ethernet
  • NVLink vs 开放互联
  • NVIDIA networking vs Broadcom
  • centralized AI factory vs distributed AI infrastructure

而且 AI 集群规模正在快速扩大。

因此 NVIDIA CTO 的角色很可能继续发生变化:

CTO 不再只是“技术负责人”,而越来越像“下一代计算机的总架构师”。

这正是 Kagan 最有价值的地方。


最后:我认为最值得记住的一个判断

如果把 Kagan 的整个职业生涯压缩成一句话:

他不是因为恰好懂 Networking 才成为 NVIDIA CTO;而是因为他很早就理解了“未来的计算机不是一颗芯片,而是一整个互联的计算系统”。

1999 年,这个判断看起来像是在做一个很窄的 HPC 网络公司。

2020 年,它让 NVIDIA 愿意花 70 亿美元买下 Mellanox。(NVIDIA Newsroom)

2023 年以后,随着大模型训练需要数千乃至数万 GPU,这个判断突然成为整个 AI 产业的基础设施逻辑。

而今天 NVIDIA 已经明确把 GPU + CPU + DPU + NVLink + InfiniBand/Ethernet 当成 AI Factory 的完整架构。(NVIDIA)

所以,从职业史的角度看,Michael Kagan 最厉害的地方可能不是“预测了 AI”,而是他在 AI 出现之前,就已经解决了 AI 时代最重要的另一个问题:

“当计算规模扩大一百万倍之后,怎么让这些计算机真正像一台计算机一样工作?”

这也是为什么我认为 Kagan 是 Jensen Huang 时代 NVIDIA 最容易被低估、但战略价值极高的人之一。


于 2026年09月05日 自 ChatGPT 原始分享链接 导入。原链接可被作者重新分享或撤销,此处是 Pickful 抓取到的副本。

續聊

還沒有人接著這個對話聊。

Download Pickful App

Better experience on mobile

iOS

Android

APK