本文来自微信公众号“DeepTech深科技”,【作者】胡莉花。

当基础模型变得越来越强,两三个人组成的创业团队,还有机会与谷歌这样的科技巨头竞争吗?
Jeff Dean给出的答案是:有。“但创业者应该寻找模型成功率为0%或1%的事情,而不是20%的事情。”
Jeff Dean是过去二十多年计算机系统和人工智能领域最具影响力的人物之一。1999年,他加入当时规模尚小的谷歌。此后,他与长期合作者Sanjay Ghemawat共同设计了MapReduce、Bigtable等基础系统,为谷歌处理和检索海量数据提供了关键支撑,也深刻影响了此后的分布式计算和云计算产业。
进入深度学习时代后,他又参与推动了TensorFlow、TPU、知识蒸馏以及谷歌早期大规模深度学习系统的发展,并于2011年参与创立并领导了Google Brain。目前,他担任谷歌首席科学家,主要负责Google DeepMind和Google Research的AI研究方向。
最近,在Y Combinator举办的Startup School 2026活动中,Jeff Dean与YC的管理合伙人Diana Hu展开了一场对谈。从专用推理硬件、长时间运行的Agent,到小团队的创业机会、AI时代的稀缺能力,两人的讨论试图回答一个正在困扰许多AI创业者的问题:当基础模型不断扩张能力边界,AI的下一个瓶颈在哪里,创业公司又应该把有限的资源押注在什么地方?
当AI走向大规模使用,推理正在成为新的瓶颈
过去几年,AI行业主要关注如何用更多数据和计算资源训练更强的模型。但随着模型进入大规模应用,怎样以更快的速度、更低的成本把模型能力交付给用户,正在成为新的问题。
这个问题的核心正是推理。用户每提出一个问题,模型都要进行一次推理。Agent读取文件、检索信息、调用工具或决定下一步行动,也要反复调用模型。当任务持续数天或数周,推理的延迟和成本会被进一步放大。因此,Jeff Dean将高性能、低能耗的推理硬件视为2026年值得关注的方向之一。
但降低推理延迟,并不只是增加更多芯片。Jeff Dean提到,AI计算中一个容易被忽视的问题是,移动数据的成本远高于计算本身。在现代AI芯片上,完成一次乘法运算可能只需要约1皮焦耳能量,但把数据从高带宽内存搬到处理器,让计算单元真正使用这些数据,能耗可能是计算本身的1,000倍。
换句话说,AI系统中成本更高的部分,往往不是“算”,而是把数据“搬”到需要计算的位置。为了分摊数据搬运成本,模型训练和推理通常会采用批处理,把多个样本或token放在一起送入加速器。一次数据搬运可以支持更多计算,硬件效率也会随之提高。
但批处理同时会带来等待。系统需要先积累足够多的请求,才能组成较大的批次。训练模型时,人们更重视整体吞吐量,这种等待通常可以接受;推理直接面向用户,响应速度本身就是产品体验的一部分。
这就形成了一个矛盾:从响应速度看,每次只处理一个请求更加理想;从现有硬件效率看,较大的批次又更加经济。Jeff Dean表示,这也是他近期更加关注推理的原因。训练未必需要极低的延迟,但推理天然需要。要同时改善速度和成本,仅靠调整模型还不够,底层硬件和系统也要随之改变。
基于这一判断,Jeff Dean预计,未来会出现更多针对推理设计的硬件,以降低模型响应的延迟和能耗。不过,这类硬件也不能只适配某一种模型,否则模型架构一旦变化,芯片就可能失去用途。
TPU的设计体现了这种平衡。谷歌开发TPU时,机器学习算法仍在快速变化,因此没有把它做成只能运行某一种神经网络的芯片,而是设计成一个相对通用的线性代数计算系统。第一代TPU诞生时,Transformer尚未出现,但它仍然能够支持此后的模型发展。
TPU的起点,则是谷歌语音识别面临的一次推理成本问题。当时,基于深度学习的新系统把语音识别错误率降低了一半,但需要的计算量也明显增加。Jeff Dean估算发现,如果每名谷歌用户每天使用3分钟语音识别,继续依赖CPU可能需要把公司服务器规模扩大一倍。
也就是说,语音模型已经变得更好,阻碍它服务更多用户的却是运行成本。谷歌因此开始开发TPU,希望用专门的硬件提高机器学习计算效率。
Jeff Dean认为,今天的Agent正在带来类似问题。一次复杂任务需要反复调用模型,运行时间越长,推理次数、等待时间和计算成本就越高。对大模型公司来说,这关系到产品能够服务多少用户;对创业公司来说,则可能直接决定商业模式是否成立。
因此,AI行业接下来不仅需要继续提高模型能力,也要改善运行模型的硬件和系统。只有推理变得更快、更便宜,Agent才可能从短暂的问答工具,转变为能够长时间执行任务的系统。
Agent从短任务走向长时间自主运行
2025年5月,Jeff Dean曾预测,AI已经接近初级工程师的水平。一年后回看,他认为这一判断基本准确。不过,Agent执行复杂任务的进步速度,比他当时预想的更快。
他还表示,许多人仍然低估了Agent能够持续运行的时间。在一些问题领域,只要底层模型足够强,Agent不只能针对一个问题运行一两个小时,还可以连续工作数天甚至数周,完成更复杂的任务。
这种任务与聊天机器人的一次性回答不同。一次问答只需要生成一个看起来合理的结果,但一个长期运行的Agent必须在几十次、数百次工具调用后,仍然记得自己要解决什么问题,并判断此前的尝试是否有效。
这也是今天Agent经常遇到的问题:前十几步表现不错,运行到第30步、第50步后,却开始偏离目标。Jeff Dean认为,其中一个原因是,模型逐渐进入自己不熟悉的任务分布。模型离训练中见过的任务越远,表现越容易下降,早期的小错误也可能在后续步骤中不断累积。
解决这个问题,不能只依赖更大的模型。在Jeff Dean看来,一个有用的AI系统,需要在模型周围建立一套机制:检索相关信息、调用工具、保存历史记录、把问题拆成多个步骤、尝试不同方案,并评估哪些方案真正有效。
一种方法是为Agent提供技能和操作指南,让它尽量沿着自己熟悉、可以验证的路径行动;另一种方法是使用多Agent系统,让多个Agent尝试不同方案,再由另一个模型或Agent负责评估,保留更有希望的路径。
Jeff Dean举了一个自己与Sanjay Ghemawat合作的例子。两人经常需要优化谷歌内部非常底层的代码库。一些数据结构会运行在数百万个进程中,即使只有很小的性能提高,也可能产生很大的整体收益。

图|Jeff Dean和Sanjay Ghemawat(来源:Peerlist)
过去,人类工程师会先运行微基准测试,找出性能瓶颈;然后修改代码,重新测试并比较性能变化;如果有效就继续迭代,如果无效则尝试其他方案。他们把这套流程写成了一项供Agent使用的“技能”,模型由此知道怎样运行基准测试、修改代码、测量性能变化并继续优化。
Jeff Dean对这件事的概括是,他们只是把人类解决问题的方法,转换成了模型可以使用的形式。这也是他所说的上下文工程:基础模型本身没有发生变化,但当人们把专业经验整理成清晰的步骤、工具和评估标准后,模型在特定任务上的能力会随之提高。
这种自动化还可能从软件开发进入科学研究,并进一步用于改进机器学习系统本身。Jeff Dean预测,到2027年,机器学习系统将更大程度地自动改进自己的能力。
未来的AI可以把一个目标拆成多个子问题,让每个子问题进入自动实验循环:提出方案、运行实验、评估结果,再保留有效方法。不同子问题的结果最终被组合起来,用于改进整个系统。只要一个问题存在可以测量的目标,这套方法就可能应用于机器学习之外的科学和工程领域。
Jeff Dean提到,谷歌研究人员曾在量子化学研究中,使用昂贵模拟器的输入和输出训练一个神经网络,使其近似原有模拟器。原本一次计算可能需要一整晚,新的近似模型却把速度提高了约30万倍,同时保持了接近原模拟器的准确度。当评估速度大幅提高后,过去需要数月完成的候选分子筛选,可能在一顿午餐的时间内完成初步评估。
类似的自动实验循环也可能被用于机器学习本身。今天,大型研究团队通常先提出一些想法,运行小规模实验,从中选择有希望的方案,再扩大规模并整合结果。未来,这套流程可能越来越多地由模型完成。
人类可以提出较高层级的研究方向,AI负责拆解问题、运行实验、比较结果,再把有效方案纳入下一轮模型。Jeff Dean将这类系统追求的目标概括为:每投入一个单位的计算资源,能够获得多少项新发现。
AI由此不再只是回答问题,也开始参与改进AI。
通用模型越强,小团队越应该寻找那1%的问题
在基础模型、芯片和数据中心越来越集中于大型科技公司的情况下,两三个人的创业团队还能做什么?这是整场对谈中,最直接关系到创业者的问题。
Jeff Dean认为,小团队的机会仍然存在。
谷歌正通过Gemini和自己的硬件基础设施,建设能够处理广泛任务的通用模型。但“通用”也意味着,大公司不可能在每一个具体领域投入同样多的精力。小团队可以长期关注一个明确的问题,围绕特定用户设计产品界面,为模型配备相应的工具和技能,或者训练一个更专用的模型。
不过,通用模型仍在快速扩大自己的能力范围。一些今天还需要专门产品才能完成的任务,可能会在下一次模型升级后成为通用能力。创业者不仅要看模型现在做得好不好,还要判断它为什么做不好,以及这种不足会持续多久。
Jeff Dean给出了一个具体的判断办法:测试当前通用模型在目标任务上的成功率。“如果它已经能做其中一些,只是做得不太好,那可能不是一个很好的信号。”Jeff Dean说。这通常意味着相关能力已经开始出现在模型中。随着训练数据增加或模型规模扩大,它可能在未来6个月或12个月继续提升。

(来源:YouTube)
随后,他提出了这场对谈中最受关注的“1%法则”:“寻找模型成功率为0%或1%的事情,而不是20%的事情。”
这里的1%,指的是通用模型目前完成某项任务的成功率。Jeff Dean建议创业者关注模型几乎不会做的事情,而不是围绕它已经初步掌握的能力开发产品。
在他看来,这些成功率接近于零的问题,首先可能来自模型无法获得的数据。基础模型在训练中接触了大量公开信息,但它不了解某个用户的全部文件、邮件和工作记录,也无法自动获得一家企业内部长期积累的业务数据。
如果一款产品在得到授权后能够使用这些信息,就拥有了通用模型不具备的上下文。例如,一个团队可以开发帮助用户整理个人信息的产品,让模型理解不同文件、项目和历史记录之间的关系。
除了特定数据,Jeff Dean提到的另一个方向是专用模型。有些问题非常困难,但范围相对明确。如果团队能够获得合适的训练数据,就可以针对一个具体问题训练规模更小、目标更集中的模型。因为不需要处理所有任务,这类模型未必需要基础模型级别的计算资源。
Jeff Dean以AlphaFold为例。AlphaFold不是一个通用模型,而是针对蛋白质结构预测开发的专用模型。它专注于一组明确的问题,并在蛋白质及其结构研究中提供专业能力。
不过,一个任务目前成功率只有1%,并不代表它会一直停留在1%。如果模型做不好,只是因为当前规模不够大或训练数据暂时不足,下一代模型就可能迅速补上这项能力。
如果问题依赖基础模型无法直接获得的数据、专业工具或行业流程,小团队才可能继续提供不同于通用模型的能力。Jeff Dean所说的“1%法则”,就是从当前模型几乎无法完成的问题出发,再判断一个小团队能否依靠数据、专业模型和产品设计,把这件事真正做成。
当Agent承担执行,人更需要知道什么值得做
如果未来每位创业者都能够同时运行数百个Agent,大部分代码也可以被自动生成,什么会成为真正稀缺的能力?
Jeff Dean的第一个回答,是清晰定义任务。如果要求不明确,Agent只能猜测人的意图,而它猜出的目标可能与人真正需要的结果不同。目标、限制和验收标准越清晰,Agent越容易沿着正确方向执行。
除此之外,还要决定什么问题值得投入,Jeff Dean把这种选择问题的能力称为“品味”。研究人员可能拥有相同的工具和技术,但最终产生的价值相差很大:有人可以非常漂亮地解决一个并不重要的问题,也有人选择了一个真正关键的问题,即使解决方案还不完美,也可能产生更大的影响。
这种判断一部分来自经验,也可以通过有意识的复盘积累。Jeff Dean建议,人们可以写下自己认为未来12个月会变得重要的一批事情,一年后再回头检查:哪些判断成为现实,哪些问题被其他人解决,哪些方向始终没有发生。通过不断积累这样的判断样本,人们可以逐渐改善自己选择问题的能力。
知识蒸馏的发展,就是一个例子。2014年,Jeff Dean与Geoffrey Hinton、Oriol Vinyals共同完成了一篇相关论文,希望用能力更强的大模型训练规模更小、运行成本更低的模型。但论文投稿后,一名评审认为,这项工作“不太可能产生重大影响”。

(来源:arXiv)
Jeff Dean没有因此停止研究。对当时的谷歌来说,如何在保留模型能力的同时降低运行成本,已经是大规模部署语音和视觉模型需要解决的问题。后来,知识蒸馏逐渐成为AI行业广泛使用的方法,谷歌也用它根据较大的Gemini Pro模型构建Flash模型。
Jeff Dean借用知识蒸馏的概念回应:“这就是我会从这件事中‘蒸馏’出的教训。”
对于选择创业的人来说,除了做什么,还要考虑和谁一起做。Jeff Dean认为,组建小团队时,专业能力当然重要,但也要选择那些愿意长期相处、能够合作并且技能互补的人。
小团队理想的状态,是每个人都知道一些其他人不知道的事情,也分别拥有不同的技术工具。成员合作后,可以完成任何一个人单独都难以完成的任务,并在合作过程中获得新的知识和技能。
Jeff Dean把工程师和研究人员掌握的能力比作一条工具带。职业生涯中,人们应该不断往里面加入新工具,因为未来遇到的问题,可能恰好需要几种不同方法配合才能解决。
在访谈最后,他还建议年轻人,无论选择加入大型前沿实验室,还是与两三个朋友创办公司,都应该先问自己:如果这件事取得了最理想的结果,世界会不会因此明显变好?还是人们只会觉得“有点酷,但也就这样”?
对于小团队来说,机会并不在于重复通用模型已经能够完成的任务,而在于找到它目前几乎无法解决的问题,再用数据、专业工具和产品设计把这件事做成。至于是否值得投入,最终仍要由创业者自己判断。
参考链接:
1.https://www.ycrootaccess.com/p/jeff-dean-the-1-rule-for-building
2.https://www.youtube.com/watch?v=CxXgV54KzpQ&t=1s
