← 返回博客
The Engineer Who Built Google’s AI

Jeff Dean:从分布式三支柱到 Discovery Loop 的 27 年

2026 年 8 月 5 日,Google 宣布首席科学家 Jeff Dean 离职,与老搭档 Sanjay Ghemawat 等四人创办 AI for Science 公司 Discovery Loop。这 27 年,几乎就是半部 Google 工程史与 AI 基础设施史。

2026-08-06 人物 · AI 历史 约 25 分钟阅读
Scroll

他是 Google 最早的员工之一,与 Sanjay Ghemawat 共同发明了 GFS、MapReduce、Bigtable 等现代互联网的地基;他创建了 Google Brain,推动了 TensorFlow、TPU、Pathways 与 Gemini;他既是系统工程师,也是机器学习研究者。本文先做功绩总览逐年大事记,再用自传式叙事串起他的经历与选择,最后附八篇核心论文解析一手访谈引语同侪对比

功绩总览:他到底做了什么?

关键数字

0
在 Google(1999–2026),约第 30 号员工
≈ 10,000 天
0大支柱
GFS / MapReduce / Bigtable
0代系统
DistBelief → TensorFlow → Pathways
0CPU 核心
2012 猫神经元实验规模
≈ 1,000 台机器
0行 Pascal
据报道 16 岁为 Epi Info 所写
1999落幕 / 启程
离开 Google,创办 Discovery Loop 任 CEO
1999–2026

分布式基础设施

系统论文/时间核心贡献行业影响
GFSSOSP 2003廉价商用机上的容错分布式文件系统HDFS 思想来源
MapReduceOSDI 2004把大规模数据处理抽象为 map/reduce 两阶段催生 Hadoop,定义"大数据"
BigtableOSDI 2006稀疏、分布式、持久化的多维排序表HBase、Cassandra 的蓝本
SpannerOSDI 2012全球分布式、强一致关系数据库全球级事务系统标杆
LevelDB2011 开源轻量级持久化键值存储众多数据库的底层引擎参考

AI/ML 系统与算法

系统/算法时间核心贡献
Google Brain2011与 Andrew Ng、Greg Corrado 等创建深度学习研究团队;2012 年起由 Dean 领导
DistBelief2011第一代大规模分布式深度学习训练框架,支撑 Search、Ads、Translate、Photos 等产品
TensorFlow2015 开源Dean 是初始系统主要设计者之一;GPU、自动微分、数据流图、移动端支持
TPU2015 部署,2016 公布推动定制 AI 加速器;参与多代 TPU(v1–v7/Ironwood)研究
Pathways2021 愿景,2022 论文下一代异构分布式 ML 平台,支撑 PaLM 与 Gemini 超大规模训练
word2vec / 蒸馏 / 稀疏模型2013–词向量、知识蒸馏、稀疏神经网络架构的共同开创者之一
芯片布局 RL2021 Nature用强化学习做 ASIC 布局布线,达到或超过人类专家水平

主要荣誉

年份荣誉说明
2009ACM Fellow / NAE 院士计算机协会会士与美国国家工程院院士
2012Mark Weiser + ACM 计算奖 + ACM-Infosys操作系统创造力奖、ACM 计算奖;与 Sanjay 共获 Infosys 奖
2016美国艺术与科学院院士American Academy of Arts and Sciences
2021IEEE John von Neumann MedalIEEE 冯·诺依曼奖章
2025TIME100 AI《时代》周刊 AI 领域 100 位最具影响力人物

逐年大事记(1968–2026)

年份事件
19687 月 23 日生于夏威夷;父亲 Andy Dean 是热带病研究者,母亲为医学人类学家
~1981跳过八年级最后三个月,随父母赴索马里难民营帮忙
198516 岁,据报道为父亲的流行病学软件 Epi Info 编写约 20 万行 Pascal 代码
1990明尼苏达大学计算机科学与经济学双学士(summa cum laude);本科论文做神经网络并行训练
1990–91WHO 日内瓦总部全球艾滋病项目,开发 HIV/AIDS 统计建模与预测软件
1996华盛顿大学计算机科学博士,导师 Craig Chambers,方向为编译器与整体程序优化
1996–99DEC 西部研究院(WRL),做性能分析工具与微处理器架构;结识 Sanjay Ghemawat
1999短暂任职 mySimon;年中加入 Google(约第 30 号员工),与 Sanjay 同年入职
20003 月索引系统危机:与 Sanjay 一个周末定位廉价 RAM 比特翻转问题并重写索引系统
2003GFS 论文(SOSP);参与五代爬取/索引/查询系统建设
2004MapReduce 论文(OSDI),与 Ghemawat 两人合著
2006Bigtable 论文(OSDI)
~2007机器翻译系统优化:"12 小时翻一句话"降到百毫秒级
2009LADIS 演讲给出"每个程序员都该知道的延迟数字";同年获 ACM Fellow、NAE 院士
2011LevelDB 开源;与 Andrew Ng 等创立 Google Brain;DistBelief 投入使用
2012猫神经元实验(ICML);获 Mark Weiser 奖、ACM 计算奖、ACM-Infosys 奖;开始领导 Google Brain
2013word2vec 论文(与 Mikolov 等合作)
201511 月 9 日 TensorFlow 开源(v0.5.0);TPU v1 部署进数据中心
2016TPU 对外公布;TPU v1 支撑 AlphaGo 对弈李世石;获美国艺术与科学院院士
2017TPU v1 论文(ISCA);Transformer 论文《Attention Is All You Need》出自 Google Brain(Dean 领导 Brain,但不在作者名单)
20184 月出任 Google AI 负责人;TPU v3 发布;《纽约客》发表 Dean–Sanjay 特写
2021芯片布局 RL 论文登 Nature;获 IEEE 冯·诺依曼奖章;10 月发布 Pathways 愿景
2022Pathways 系统论文(MLSys);PaLM 发布(540B,6,144 块 TPU v4)
2023Brain × DeepMind 合并;Dean 任 Google 首席科学家、Gemini 联合技术负责人;Gemini 1.0 发布
2024Gemini 1.5 发布(长上下文,跨都市区数据中心训练);TPU v6 Trillium
20252 月 Dwarkesh 播客与 Noam Shazeer 同台;5 月 Sequoia AI Ascent 主旨演讲;入选 TIME100 AI;TPU v7 Ironwood
20268 月 5 日:宣布离开 Google,与 Sanjay、Quoc Le、Oriol Vinyals 创办 Discovery Loop 任 CEO;同日 Hassabis 卸任 DeepMind CEO

童年与求学(1968–1996)

FROM HAWAII TO GENEVA

在热带病研究者家庭长大

Jeffrey Adgate Dean 1968 年 7 月 23 日出生于夏威夷。他的父亲 Andy Dean 是热带病研究者,后来担任过明尼苏达州流行病学家并在 CDC 工作;母亲是医学人类学家。由于父母工作的关系,童年时期他随家庭频繁搬迁。

多份传记提到一个细节:1981 年,他跳过八年级最后三个月,随父母去索马里的一处难民营帮忙。这段经历早早把他放在"全球公共卫生"的现场——与他后来在世界卫生组织的工作、以及 2026 年创办 Discovery Loop 选择"AI 加速科学发现"的方向,形成了一条隐约的线索。

第一台电脑与 16 岁的 20 万行 Pascal

Dean 的编程启蒙来自父亲。父亲在家组装了一台 Altair 8800 套件计算机,Dean 在旁边帮忙调试,逐渐学会自己编程。12、3 岁时,他买了一本包含游戏源代码的书,先照着写,再修改,最后开始原创。

在明尼苏达的少年时期,他加入了当地大学的青少年计算机网络,写游戏和其他程序。1985 年夏天,全家搬到亚特兰大(父亲加入 CDC),16 岁的 Dean 据报道为父亲的流行病学软件 Epi Info 写了约 20 万行 Pascal 代码——一个高中生参与公共卫生软件的规模,已远超普通编程爱好者。这个数字来自多家传记网站,虽非学术来源,但多个独立报道一致提及,可信度较高。

明尼苏达本科:计算机 + 经济学

1990 年,他以 最优等荣誉(summa cum laude) 获得明尼苏达大学计算机科学与经济学双学士学位。本科毕业论文的题目与神经网络的并行训练相关——在 1990 年,神经网络正处于第一次寒冬后的低谷,这个选题说明他早早就认准了这条路径。他后来在播客里回忆:

我本科最后一年上一门并行计算课,其中一节讲到了神经网络,我就是这样接触到它的。我在一台 32 处理器的 Hypercube 机器上实现了模型并行和数据并行。

"I got introduced to neural nets in one section of one class on parallel computing that I was taking in my senior year... I implemented model parallelism and data parallelism on a 32-processor Hypercube machine." — Dwarkesh Podcast, 2025-02

也就是说,"用并行系统扩大神经网络"这件他 27 年后才做完的事,1990 年就在本科课程里埋下了种子。大一期间,他结识了后来的妻子 Heidi Hopper。

日内瓦:用软件追踪艾滋病疫情

本科毕业后的 1990–1991 年,Dean 没有立刻读研,而是去了世界卫生组织(WHO)驻日内瓦总部,为全球艾滋病项目(Global Programme on AIDS)开发统计建模、预测与分析软件。这段工作的性质是"用计算理解疾病"——与他四十年后创办 Discovery Loop 时说的"用 AI 加速科学发现",在精神上是同一类事。

华盛顿大学博士:编译器与整体程序优化

离开 WHO 后,Dean 进入华盛顿大学攻读计算机科学博士,1996 年在导师 Craig Chambers 指导下毕业,研究方向是编译器与面向对象语言的整体程序优化(whole-program optimization)。这段训练塑造了他此后一生的工作方式:不满足于局部修补,而是从系统全局找杠杆点

DEC 与 Sanjay:改变互联网的搭档关系

THE FRIENDSHIP THAT MADE GOOGLE HUGE

博士毕业后,Dean 加入 DEC 西部研究院(Western Research Lab, WRL)。那里是 1990 年代系统研究的圣地,聚集了一批顶尖的编译器、操作系统与网络研究者。在这里,他遇到了 Sanjay Ghemawat

像爵士乐手一样结对编程

《纽约客》2018 年那篇著名特写《The Friendship That Made Google Huge》(James Somers 著)描述了两人的合作方式:他们共用一台电脑,一个人敲键盘,另一个人在旁边实时审阅、提示、挑战,像爵士乐手即兴交换 solo。Jeff 节奏快、点子多、擅长宏观架构;Sanjay 更安静、更擅长把边界条件和异常情况想透。Dean 自己说过:

和 Sanjay 一起写出的代码,比我们各自单独写的都要好。

"When I work with Sanjay, the code we write together is better than anything either one of us could write alone."

"要我就得也要 Sanjay"

1999 年,Dean 面试 Google 时,有报道称他向 Google 开出的条件是:"你们要我就得也要 Sanjay。"两人于 1999 年同年加入。这个细节多次出现在传记与新闻报道中,虽难找到一手录音,但已成为两人合作史的标志性注脚。

加入 Google 与 2000 年的那个周末

THE WEEKEND THAT SAVED THE INDEX

Dean 于 1999 年年中加入 Google,是公司大约第 30 号员工。彼时 Google 只有 25 到 30 人。他的第一份工作是广告、抓取、索引与查询服务系统,此后参与了五代爬取、索引与查询服务系统的实现。他回忆:

我加入的时候,公司也就 25、26 个人,差不多那样。

"When I joined, we were 25 people, 26 people, something like that." — Dwarkesh Podcast, 2025-02

2000 年 3 月:索引崩溃,Yahoo 交易命悬一线

《纽约客》详细记录了 2000 年 3 月的一个周末:Google 的核心索引系统停止更新,搜索结果落后了五个月。Larry Page 和 Sergey Brin 当时正在和 Yahoo 谈判,准备为 Yahoo 提供搜索服务——如果索引继续瘫痪,这笔关键交易可能告吹。

六位工程师挤进临时作战室。公司的第一位员工 Craig Silverstein 和 Bogdan Cocosel 花了四天没找到原因。Dean 和 Ghemawat 接手后,把损坏的索引文件转储成原始二进制,最终发现:廉价内存芯片会在运行时自发翻转比特位(0 变 1,1 变 0),造成静默数据损坏,而不是软件 bug。

他们用一个周末重写了整个索引系统,让它能够检测并绕过损坏数据,把系统变成自愈合架构。这次危机不仅保住了 Yahoo 交易,也奠定了 Dean-Ghemawat 系统设计的核心哲学:把硬件故障当作常态,在软件层做容错。后来 GFS、MapReduce、Bigtable 的容错设计,都能追溯到这个周末。

基础设施十年:三支柱与 Jeff Dean 数字

GFS · MAPREDUCE · BIGTABLE

2000 年代是 Dean 的系统黄金期。他与 Sanjay 以及同事一起,为 Google 建造了支撑整个互联网的分布式基础设施。这些系统后来被写成论文,成为开源大数据生态的"圣经"。

GFS(2003):把廉价硬盘当成一个文件系统

Google 需要存储整个互联网,但买不起昂贵的企业存储。Dean、Ghemawat 与 Howard Gobioff 在 2003 年 SOSP 发表了 The Google File System,设计思想是:用大量廉价商用机,通过三副本、主从架构和容错,把 unreliable hardware 包装成 reliable storage。这篇文章直接催生了 Hadoop 的 HDFS。

MapReduce(2004):定义大数据处理的两步舞

2004 年 OSDI,Dean 与 Ghemawat 发表了只有两位作者的 MapReduce: Simplified Data Processing on Large Clusters。它把并行计算抽象成 map 和 reduce 两个函数,隐藏了分布式容错、数据分发、负载均衡的复杂性。Hadoop MapReduce、Spark 之前的整个大数据产业都建立在这篇论文之上。

Bigtable(2006):半结构化数据的分布式答案

2006 年 OSDI,Dean、Ghemawat 与 Fay Chang、Mike Burrows 等发表了 Bigtable,为 Google 的搜索索引、Google Earth、Google Finance 等提供可扩展的稀疏表存储。它是 HBase、Cassandra 等 NoSQL 系统的直接灵感来源。

Spanner、LevelDB、Protocol Buffers 与 Jeff Dean 数字

同一时期,Dean 还参与了:

  • Spanner(OSDI 2012):全球分布式、强一致关系数据库,用原子钟和 TrueTime API 解决跨地域事务。
  • Protocol Buffers:Google 内部 RPC 和数据持久化的结构化序列化格式,后来成为 gRPC 的核心部分。
  • LevelDB(2011 开源):轻量级、可嵌入的键值存储,由 Dean 和 Ghemawat 设计,被无数系统借鉴。

此外,工程师圈子里流传着一份"Jeff Dean 数字"——他 2009 年在 LADIS 大会主旨演讲《Designs, Lessons and Advice from Building Large-Scale Distributed Systems》中整理的数据中心各级延迟:L1 缓存 ~0.5ns、分支预测失败 ~5ns、内存访问 ~100ns、SSD 随机读 ~150μs、磁盘寻道 ~10ms、跨数据中心往返 ~150ms。这份表后来经 Johan Boné 的 gist 传播,成为无数系统设计与面试题的标准参考(原始 PDF 仍可在 Cornell 与 Google Research 站点找到)。

转向机器学习:从翻译系统到猫神经元

THE PIVOT TO MACHINE LEARNING

2007 年:"翻译一句话要 12 小时"

Dean 从基础设施转向机器学习,有一个常被提到的转折故事。2007 年前后,Google 的机器翻译系统慢到令人难以置信。他在 2025 年 2 月的 Dwarkesh 播客里回忆:

"翻译一个句子要 12 个小时。"我们重新设计了内存中的压缩 N-gram 表示和并行查询,把延迟降到了百毫秒级。

"It takes 12 hours to translate a sentence." — Jeff Dean, Dwarkesh Podcast, Feb 2025

这件事让他意识到,Google 的核心产品不仅需要更好的系统,也需要更聪明的模型。于是他开始把更多精力放在机器学习上。

2011:Google Brain 的诞生

2011 年,Dean 与 Andrew Ng(时任斯坦福大学教授)、Greg Corrado 等人共同创建了 Google Brain。团队被放进 Google X 实验室,目标是"建造非常大的神经网络"。2012 年,Dean 开始直接领导这个团队。第一代训练系统 DistBelief 让模型可以扩展到数千个 CPU 核心,训练出的模型比之前大约大 60 倍,被部署在 Search、Ads、Translate、Photos、Maps、Street View、语音识别和 YouTube 等产品中。

2012:猫神经元与 Scaling Law 的预演

2012 年,Google Brain 团队发表了 ICML 论文 "Building high-level features using large scale unsupervised learning"(Quoc Le 等,包括 Jeff Dean 与 Andrew Ng)。实验用 1,000 台机器、16,000 个 CPU 核心,无监督地观看了约 1,000 万张 YouTube 视频帧。结果,网络最高层自发涌现出一个对"猫脸"强烈响应的神经元——它从未被告诉过"猫"是什么。Dean 回忆:

那个神经网络可能比之前训练过的最大网络大 50 倍,而且效果很好。扩大神经网络规模看起来是个好主意——事实证明它确实是。

"That neural net was probably 50x bigger than one that had been trained previously, and it got good results... scaling up neural nets seems like, I thought it would be a good idea and it seems to be." — Dwarkesh Podcast, 2025-02

这个实验在今天看来像是 Scaling Law 的早期预演:规模本身可以带来涌现能力。它比业界集体醒悟早了将近五年。

深度学习基础设施:TensorFlow、TPU 与算法-硬件协同设计

DISTBELIEF → TENSORFLOW → TPU

TensorFlow:重写 DistBelief,开源 2015

2013–2014 年,Dean 判断 DistBelief 的架构无法适应 GPU 崛起和新数据类型(如复杂语音数据),决定不是修补,而是重写一个全新框架,并把它开源。2015 年 11 月 9 日,Google 在 GitHub 上以 Apache 2.0 协议发布了 TensorFlow v0.5.0,同时发表了白皮书。这是 Sundar Pichai 出任 CEO 后首批重大发布之一。

Dean 自称是"初始 TensorFlow 系统的主要设计与实现者之一"。TensorFlow 相对于 DistBelief 的关键改进包括:GPU 支持、自动微分、更灵活的数据流图编程模型,以及移动端(Android/iOS)可移植性。开源一年内就有数百名贡献者,迅速成为 GitHub 上最热门的机器学习项目。

TPU:从"如果每天用语音搜索 3 分钟"开始的芯片革命

TPU 项目的触发点是一个粗略估算:如果用户每天只用语音搜索 3 分钟,Google 就得把数据中心容量翻倍。这促使团队设计专用 ASIC。Dean 参与撰写的 ISCA 2017 论文 In-Datacenter Performance Analysis of a Tensor Processing Unit 显示,TPU v1 在推理任务上相对同时期 GPU 有约 15–30 倍吞吐优势、30–80 倍能效优势。Dean 提到,TPU v1 从设计想法到部署进数据中心大约只用了 15 个月。他解释设计动机时说:

我们在 Google 开始造 TPU,它本质上就是一台低精度线性代数机器。顺便说一句,这些算术可以用很低的精度完成,所以你还能塞进更多乘法器单元。

"We started to build TPUs at Google that were really just reduced-precision linear algebra machines... the arithmetic can be really low precision, so then you can squeeze even more multiplier units in." — Dwarkesh Podcast, 2025-02

TPU 的代际演进大致如下(基于公开报道整理,非 Google 官方完整规格表):

代数时间关键特征
TPU v12015 部署,2016 公布推理专用,INT8,256×256 脉动阵列,92 TOPS;支撑 AlphaGo vs. 李世石
TPU v22017首次支持训练,引入 bfloat16,Cloud TPU 上线,256 芯片 Pod
TPU v32018性能约为 v2 两倍,液冷,1,024 芯片 Pod
TPU v42020 部署,2021 公布光路交换实现可重构 4,096 芯片 Pod,训练 LaMDA/MUM/PaLM
TPU v5e/v5p2023分推理优化(v5e)与训练优化(v5p)两条线
TPU v6 Trillium2024公开报道中训练 Gemini 2.0 的硬件之一
TPU v7 Ironwood2025面向推理与 Gemini 3 级负载设计,更高 HBM 与算力密度

其他重要贡献

  • word2vec(2013):与 Mikolov 等合作的词分布式表示论文,让"king - man + woman ≈ queen"成为可能。
  • 蒸馏(Distillation):该技术早期的共同开创者之一,让小模型继承大模型能力。
  • 用强化学习做芯片布局(2021 Nature):将 ASIC 布局布线建模为强化学习问题,达到或超过人类专家水平。
  • 医疗 AI:参与多项将机器学习用于医疗诊断与健康管理的项目。

大模型时代:Pathways、PaLM、Gemini 与首席科学家

PATHWAYS → PaLM → GEMINI

Pathways 愿景(2021)

2021 年 10 月,Dean 在 Google 博客上发表 Introducing Pathways: A next-generation AI architecture,提出一个激进愿景:训练一个单一、多模态、稀疏激活的模型,能够处理数百万种任务,而不是为每个任务单独训练一个模型。2022 年 3 月,Pathways 系统论文 "Pathways: Asynchronous Distributed Dataflow for ML"(Barham、Chowdhery、Dean、Ghemawat 等)发布,描述了一个基于异步分布式数据流、单控制器、支持复杂并行模式的大规模加速器编排层。

PaLM:Pathways 的首次大考(2022)

2022 年 4 月,Google 发布 PaLM(Pathways Language Model):5,400 亿参数、稠密激活的 Transformer,在 6,144 块 TPU v4 上、用 Pathways 训练完成。它在数百个基准上取得少样本最优结果,并在多步推理任务上首次展现出接近或超过人类平均水平的能力。PaLM 证明了 Pathways 不是空中楼阁。

2023:Google Brain 与 DeepMind 合并

2023 年,Google 将 Google Brain 与 DeepMind 合并为 Google DeepMind。Dean 转任 Google 首席科学家,同时担任 Gemini 的联合技术负责人。他的角色从"带一支团队"变成"把 Google 最前沿的 AI 研究串在一起"。在 2025 年的访谈中,他透露 Gemini 1.5 曾在多个都市区的数据中心之间联合训练——"我们已经在这么做了"。

离开与 Discovery Loop:2026 年 8 月 5 日

THE NEXT CHAPTER

2026 年 8 月 5 日,Google 同时宣布了多项 AI 领导层变动,震动行业:

  • Jeff Dean 离开 Google,结束 27 年生涯(时年 58 岁)。
  • Demis Hassabis 卸任 Google DeepMind CEO,转任 DeepMind 董事长与 Alphabet 首席科学家,继续领导 Isomorphic Labs;他在内部信里表示 AGI"近在咫尺"。DeepMind 日常管理由高级副总裁 Koray Kavukcuoglu 接管,直接向 Sundar Pichai 汇报。
  • Dean 与 Sanjay Ghemawat、Quoc Le、Oriol Vinyals 联合创办 Discovery Loop

Discovery Loop 的轮廓

维度内容
法律形态独立的公共利益公司(public benefit corporation)
使命自动化机器学习、科学与工程,用 AI 加速科学发现;让系统能"并行运行成千上万个实验"
闭环逻辑"AI 提出实验、执行实验、从结果中学习、递归迭代"——先从自动化机器学习研究本身做起,再进入物理世界
领域工程、医学、材料设计、清洁能源(Radical Ventures 投资信的表述)
联合创始人Jeff Dean(CEO)、Sanjay Ghemawat、Quoc Le、Oriol Vinyals
投资方Radical Ventures 与 Khosla Ventures 联合领投种子轮;Alphabet 作为创始投资方参与并任云合作伙伴

一个闭环?

把 Dean 的职业线拉长,这次创业像是一个回到原点的弧线:1990–1991 年,20 岁出头的他在日内瓦为 WHO 写艾滋病建模软件;2026 年,58 岁的他离开世界上最大的科技公司,去做"用 AI 加速科学发现"。从"用计算理解疾病"出发,绕了 27 年分布式系统、深度学习、大模型的远路,又回到"用计算解决科学问题"。

当然,这是我个人的解读,不是事实陈述。但放在他一贯"先造工具,再用工具解决真问题"的轨迹里,这个闭环并不牵强。对 Google 而言,同一天失去 DeepMind CEO 和首席科学家,是在与 OpenAI、Anthropic 等对手白热化竞争时的一次剧烈失血;接下来几个季度,Gemini 与 Google AI 的稳定性,会是观察重点。


八篇核心论文深度解析

KEY PAPERS, PROBLEM → DESIGN → IMPACT

Dean 的名字出现在十余篇改变行业的论文作者名单上。以下八篇是理解他工作的钥匙。

① The Google File System

SOSP 2003 · Ghemawat, Gobioff, Dean

问题

如何在数千台随时会坏的廉价机器上,可靠地存储整个互联网的数据?

设计

单 master 元数据服务器 + 大量 chunkserver;文件切成 64MB 的 chunk,每块三副本;把"组件必然失效"写进设计前提,靠快速重复制而非持久硬件保证可靠性。

影响

HDFS 的直接思想来源;此后所有"用商品硬件堆出可靠存储"的系统都在回应这篇论文。

② MapReduce

OSDI 2004 · Dean, Ghemawat(仅两位作者)

问题

Google 有大量"对全量数据做某种统计"的需求,但每次都要手写分布式并行、容错、数据分发代码。

设计

把计算抽象为 map 与 reduce 两个纯函数,运行时负责分区、调度、容错(失败任务重执行)与数据本地性。

影响

Hadoop MapReduce 照此实现,定义了整个"大数据"产业十年的编程范式;后来的 Spark 是对它的内存化改进。

③ Bigtable

OSDI 2006 · Chang, Dean, Ghemawat 等

问题

Google 的数据形态介于关系表与文件之间:稀疏、海量、需要低延迟随机读写。

设计

"稀疏的、分布式的、持久的多维排序映射",构建在 GFS 之上;tablet 为管理单位,按行键排序;牺牲 SQL 语义换取扩展性。

影响

HBase、Cassandra 等 NoSQL 系统的蓝本;证明了"弱模型 + 大规模"是可行路线。

④ 猫神经元实验

ICML 2012 · Quoc Le 等(含 Dean, Andrew Ng)

问题

不标注数据,神经网络能否自己学出有意义的概念?

设计

9 层局部连接的稀疏自编码器,约 10 亿连接,跑在 1,000 台机器 / 16,000 CPU 核心上;喂入 1,000 万张 200×200 的 YouTube 无标注帧,训练三天。

数字与影响

图像识别准确率相对提升 70%;一个神经元对猫脸选择性响应,登上《纽约时报》头版。这是"规模带来涌现"的第一个公开实证。

⑤ TensorFlow 白皮书

arXiv 2016 / OSDI 2016 · Abadi 等(Dean 为主要设计者之一)

问题

DistBelief 绑定内部基础设施、不支持 GPU、研究者难用、无法开源。

设计

数据流图 + 自动微分;算子可放置在 CPU/GPU/移动设备;同一套代码从手机跑到数千卡集群。

影响

2015-11-09 开源后成为全球最流行的 ML 框架,把深度学习从少数公司的私有能力变成公共基础设施。

⑥ TPU v1 论文

ISCA 2017 · Jouppi 等(含 Dean)

问题

CNN 推理需求爆炸,通用 CPU/GPU 的能效撑不住"每人每天 3 分钟语音搜索"这种规模。

设计

推理专用 ASIC:256×256 INT8 脉动阵列(92 TOPS)、约 28MiB 片上存储、PCIe 协处理器;砍掉通用性换取密度与能效。

数字与影响

相对同期 GPU 约 15–30 倍吞吐、30–80 倍能效;从想法到部署约 15 个月。开启"为算法造芯片"的时代,后续七代 TPU 训练了 PaLM 与 Gemini。

⑦ Pathways: Asynchronous Distributed Dataflow for ML

MLSys 2022 · Barham, Chowdhery, Dean, Ghemawat 等

问题

上一代系统一次只能跑一个模型、绑定单一并行策略;超大模型需要跨数千加速器、混合并行、甚至跨数据中心。

设计

异步分布式数据流 + 单控制器编排;gang scheduling;构建在 XLA 之上,兼容 JAX 等前端;数据面依赖不阻塞控制面执行。

数字与影响

在 2,048 块 TPU 上跑 SPMD 计算达到接近 100% 加速器利用率;支持 16 级流水线、跨加速器岛分片。PaLM 与 Gemini 的训练底座;Dean 称之为第三代训练系统。

⑧ PaLM: Scaling Language Modeling with Pathways

2022 · Chowdhery, Narang, Devlin 等 60+ 作者(含 Dean)

问题

Pathways 愿景能不能在真实规模上兑现?

设计

540B 参数稠密 Transformer,跨两个 Cloud TPU v4 Pod、共 6,144 块芯片训练,模型并行度 12 路、数据并行 512 路。

数字与影响

模型 FLOPs 利用率(MFU)达 57.8%,当时公开报告的最高水平;BIG-bench 多步推理部分超过人类平均。一次性验证了"系统 + 规模"两条路线,直接影响后续 Gemini 系列。

他本人怎么说:访谈引语集

IN HIS OWN WORDS

以下引语均出自公开访谈,按主题分组(中文为意译,英文为原文)。

关于起点

我本科最后一年上一门并行计算课,其中一节讲到了神经网络——我就是这样接触到它的。我在一台 32 处理器的 Hypercube 机器上实现了模型并行和数据并行。

"I got introduced to neural nets in one section of one class on parallel computing that I was taking in my senior year." — Dwarkesh Podcast, 2025-02

我加入 Google 的时候,公司也就 25、26 个人,差不多那样。

"When I joined, we were 25 people, 26 people, something like that." — Dwarkesh Podcast, 2025-02

关于规模

那个网络可能比之前训练过的最大网络大 50 倍,而且效果很好。

"That neural net was probably 50x bigger than one that had been trained previously, and it got good results." — Dwarkesh Podcast, 2025-02

一代代模型之间的进步,往往部分由硬件和更大的规模驱动。

"Improvements from generation to generation of these models often are partially driven by hardware and larger scale." — Dwarkesh Podcast, 2025-02

模型可能会继续变大,你还能从那里拿到一两个数量级的提升。

"The models are probably going to be bigger, you'll get another order of magnitude or two from that." — Dwarkesh Podcast, 2025-02

关于硬件

我们在 Google 开始造 TPU,它本质上就是一台低精度线性代数机器。

"We started to build TPUs at Google that were really just reduced-precision linear algebra machines." — Dwarkesh Podcast, 2025-02

别去看新硬件的牙口。

"Never look new hardware in the mouth." — Dwarkesh Podcast, 2025-02

关于未来(Sequoia AI Ascent,2025-05)

  • 预测 AI 系统在大约一年内达到初级软件工程师的水平,尤其是长时间运行的 agent 式编程任务。
  • 推理硬件优化的两个关键:减少数据搬运与提高算力供给效率。
  • 未来进步的关键在 context engineering推理时计算,而不只是更大的预训练。
  • 提出"1000 倍能耗差距":如果模型能达到人脑能效水平,相对当前硬件还有约三个数量级的余量。
  • 预测 ML 系统参与改进 ML 系统自身——分解目标、自动跑实验,延续 AlphaEvolve 类工作的方向。

关于克制

面对 AGI 时间表,我大概在中间位置。我就是不喜欢炒作还没做完的东西。

"I'm somewhere in the middle... I just don't like to hype things that aren't done yet." — Dwarkesh Podcast, 2025-02

我确实相信,让这些系统变得安全是可能的。

"I do think it is possible to make these systems safe." — Dwarkesh Podcast, 2025-02

同侪坐标中的 Dean

THE SYSTEMATIZER AMONG THE PIONEERS

把 Dean 放进 AI 群星里,才能看清他独特的位置。2026 年 AI 圈流传的一句总结很说明问题:"Google 的四位 Gemini 联合负责人,现在只剩一位了。Jeff Dean 和 Oriol Vinyals 今天离开去做 Discovery Loop,Noam Shazeer 去了 OpenAI。"

人物原型代表作与 Dean 的对照
Sanjay Ghemawat另一半:安静的深度型工程师GFS、MapReduce、Bigtable、LevelDB27 年搭档,同进退;2026 年一起离职创业
Andrew Ng教育者与创业者Google Brain 共同创始人、Coursera、deeplearning.ai同为 Brain 创始人,Ng 走向教育与创业,Dean 留在 Google 造系统
Demis HassabisAGI 野心家、诺奖得主AlphaGo、AlphaFold(2024 诺贝尔化学奖)、Isomorphic LabsHassabis 的科学路径拿了诺奖;Dean 则把科学留给了离职后的 Discovery Loop
Noam Shazeer论文作者、产品化冲刺者《Attention Is All You Need》共同作者2021 年出走创办 Character.AI,2024 年以约 27 亿美元授权交易回归任 Gemini 联合负责人,2026 年 6 月又转投 OpenAI;Dean 在一家公司待了 27 年才离开
Oriol Vinyals全能型研究者seq2seq 共同发明人、AlphaStar 负责人、Gemini 联合负责人Discovery Loop 联合创始人之一,与 Dean、Quoc Le 再聚首
Quoc Le现代深度学习的先行者猫神经元论文一作、seq2seq 共同作者Discovery Loop 联合创始人;2012 年那篇论文的三个人(Le、Dean、Ng)如今各奔东西又部分重聚
Hinton / LeCun / Bengio学术界的深度学习三巨头反向传播、CNN、深度学习理论(2018 图灵奖;Hinton 另获 2024 诺贝尔物理学奖)他们提出思想,Dean 造出让思想在行星尺度上跑起来的机器

这张对照表勾勒出一个清晰的原型:Dean 不是某个算法的发明者——反向传播不是他、深度学习不是他、Transformer 论文的作者名单里也没有他。他反复扮演的角色是系统化者(enabler):把一个研究想法,变成能在上万台机器上可靠运行、并且开放给全世界使用的系统。GFS 之于分布式存储、TensorFlow 之于深度学习、TPU 之于 AI 算力、Pathways 之于大模型训练,都是同一个动作的重复。

这也是他与 Shazeer 轨迹对照最耐人寻味的地方:Shazeer 两次离开 Google 追逐产品落地,Dean 在同一家公司做了 27 年地基,最后离开时选择的却不是产品,而是科学。当然,这一段是我的解读;但它让"Dean 是 AI 时代的总工程师,而非发明家"这个定位更加清晰。

合作方式与工程哲学

PRINCIPLES, NOT JUST SYSTEMS

双核处理器:Jeff + Sanjay

Dean 与 Ghemawat 的合作是 Google 工程文化最持久的传奇。他们共用一台电脑,一人敲键盘、一人实时审阅;《纽约客》把他们的关系比作 Monet 与 Renoir、Picasso 与 Braque 式的"双重创造力"。他们一起获得 2012 年 ACM-Infosys Foundation Award,并成为 Google 最早的两位 Senior Fellow(L11)。

几条贯穿始终的原则

  • 异步优先:"我热爱异步性,它让你能扩展的规模大得多。"从 MapReduce 的容错到 DistBelief 的异步 SGD,再到 Pathways 的异步数据流,异步性是他系统里反复出现的主题。
  • 软硬件协同设计:低精度算术、为算法定制芯片(TPU)、用强化学习做芯片布局,都在同一条逻辑线上。
  • 把故障当常态:2000 年 RAM 比特翻转事件后,他的系统都把硬件故障视为默认假设,在软件层做检测、路由、自愈。
  • 谨慎乐观,拒绝炒作:被问到 AGI 时间表时,他说自己"在中间位置";并有一条明确的表达纪律:"我不喜欢炒作还没做完的东西。"

彩蛋:Jeff Dean Facts

ENGINEERING FOLKLORE

2008 年左右,Google 工程师 Kenton Varda 受"Chuck Norris Facts"启发,在内部 App Engine 上建了一个匿名网站,让大家提交关于 Jeff Dean 的夸张段子,并在 2008 年 4 月 1 日把链接发给了全公司。经典的"事实"包括:

"Jeff Dean 的键盘只有两个键:0 和 1。"
"编译器不会警告 Jeff Dean;Jeff Dean 会警告编译器。"
"当上帝说'要有光'时,Jeff Dean 在场做代码评审。"

最有趣的是,Dean 本人只花了 1–2 小时就通过查询内部系统日志找到了网站的作者——让 meme 的预设成了真。这些段子本质上是工程师文化的玩笑,但也从侧面说明他在业内的地位:人们真的相信,他能在系统层面做到常人做不到的事。

参考与证据边界

SOURCES & UNCERTAINTY

证据边界与不确定性说明:
  • 高置信度:教育背景、加入 Google 时间、主要系统贡献、Google 官方职务、奖项,来自 Google Research 官方简介、Wikipedia、ACM/NAE 官方记录与论文本身。
  • 中等置信度,多家报道交叉:童年经历(Altair、索马里难民营、Epi Info 20 万行 Pascal)、2000 年索引危机细节、"要我就得也要 Sanjay",来自传记、New Yorker、Minnesota CSE 等;部分属于轶事/二手叙述。TPU 代际与 PaLM MFU 57.8% 等数字来自论文或公开技术报道,具体以 Google 官方发布为准。
  • 快速发展的近期事件(2026-06 至 2026-08):Shazeer 转投 OpenAI、Dean 离职与 Discovery Loop、Hassabis 职务变动来自 CNBC/Reuters/NYT/TechCrunch/The Decoder 等多家主流媒体,但公司尚处交接期,后续细节可能变化。
  • 我的解读(非事实):"从 WHO 到 Discovery Loop 的闭环"、"Dean 是 AI 时代的总工程师而非发明家"、同侪对照中的原型归纳,均是我个人的主题性阅读,不代表 Dean 本人或任何来源的表述。
写于 2026-08-06 · 事实核查基于文中所列来源 · 有错漏欢迎指正
文章目录16
Silent Star约 26 分钟