Aioga
AI资讯 / 技巧观点
返回 AI资讯

代码成本崩盘后的工程管理:一位工程总监的反思

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-07-25T22:34:51.368Z热度 57

一位工程总监基于过去一年的笔记指出,代码生产成本已崩溃且不会回升,但AI工具是否让工程团队显著提速尚无定论。管理实践应基于其底层假设是否成立来评估:依赖代码编写成本的做法需重新...

技巧观点Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

一位工程总监基于过去一年的笔记指出,代码生产成本已崩溃且不会回升,但AI工具是否让工程团队显著提速尚无定论。

管理实践应基于其底层假设是否成立来评估:依赖代码编写成本的做法需重新审视,而依赖人类协调、信任构建或正确性验证的做法则未改变。 正确性验证中的机械性检查(类型、测试、契约)正因AI加速,但语义验证(业务需求、监管风险)仍依赖人类判断,AI自检无法发现共享盲点。

中文正文 · AI 翻译

我担任工程总监已经有三年多了,我仍然会听到和看到那些我称之为“旧规则”的话被一遍又一遍地重复:总监不应该花时间编程,好的工作需要时间,要保护团队免受业务干扰,在做出承诺前要达成共识,等等。

Engineering management after the cost of code collapsed

有一段时间,我以为重复这些话的人落伍了。然后我们在组织中引入了大型语言模型(LLMs),代码生产成本下降了,我开始检查每条规则背后的假设。令人惊讶的是,大约一半的旧规则建立在已经失效的假设上,另一半建立在仍然有效的假设上,而且其中一些甚至比以前更重要。

以下是我在过去一年中积累的笔记的整理版。Gemini 4 帮助进行了编辑。

生成合理代码的成本已经崩塌,并且不会回升。除了这一点之外的几乎所有说法要么未经验证,要么是错误的。

如果你基于这一狭义说法重建管理实践,你就是正确的。如果你基于广义说法重建管理实践,那你就是在拿别人的职业生涯赌博,并称之为结论。

每一种管理实践都建立在某种假设之上。速度追踪依赖于产出是工作努力的可用代理;六个月的入职培训依赖于语法学习缓慢;共识驱动的架构依赖于变更成本高;人员编制规划依赖于产出随人数扩展,等等。

对于每种实践来说,问题不是它存在多久,而是它实际依赖的是什么。

如果一项实践依赖于编写代码的成本,那就需要重新评估,因为成本已经发生变化。如果它依赖于人类如何协调、建立信任、分配注意力或验证正确性,那么无论仪式看起来多么过时,都没有改变。

这听起来很明显,但我认为很多人是凭感觉在排序:看起来现代的保留,看起来老的放弃。这会导致团队放弃有用的摩擦,却保留无用的流程,因为实践的年龄与其实效性是无关的变量。

对任何人,包括你自己的团队,如果他们只报告巨大加速而没有其他信息,都要保持怀疑。我熟悉的性能提升通常在新项目、模板代码以及不熟悉的领域中表现明显。但在对工程师已经熟悉的系统进行深度工作时,这些提升会逐渐消失或反转。我非常期待在2025年第四季度之后的数据和研究,那时将推出一类全新的模型,其能力完全超越了以往研究和报告所基于的模型。

然而,感受到的速度与实际测得的速度之间的差距本身就是一个管理问题。如果你的工程师感到更快,但交付量相同且缺陷更多,你将会错误地安排人员、制定错误的计划,并向业务设定无法实现的期望。AI 采纳组织的首要任务是进行足够诚实的度量,以告诉你是否真的实现了加速。

速度、拉取请求数量和关闭的工单数量一向不完美。它们之所以能继续使用,是因为它们近似的指标,即编写代码的投入,确实稀缺,所以噪音仍然在可容忍的范围内。

现在,代理的对象已经变得廉价。这不仅使指标变得不完美,更实际上具有误导性,因为提升指标最便宜的方法是产生大量代码,而组织现在真正不缺的正是数量。

AI特定的指标解决了错误的问题。我认为接受率和提示次数只是以新形式出现的同样错误。持久的做法更古老也更困难:衡量业务成果和系统健康,将代码量视为需要合理化的成本而非值得赞扬的产出。优秀的工程师在大型语言模型出现之前就已经这么说了。当时就是真理。现在可以执行这一点,而以前不可行,因为没人能争辩说写更多代码才是难点。

优秀工作需要时间的规律可以清晰地分为两类。

基础工作时间已经大幅缩短。搭建服务框架、生成测试、在不同框架之间转换、编写迁移的初稿:这些现在都很快,而且任何基于这些成本制定的时间表都应当被压缩。

AI 系统现在检查和修复代码的速度比任何人类审查员都快,假装不是这样会损失可信度。一方面,机械化验证正在崩溃。任何可以用机器可检查的工件表达正确性的东西:类型、测试、合同、lint 规则、不变量、金丝雀指标。智能体运行测试循环,读取失败信息,修复差异,再次运行,速度是任何审查员无法匹敌的。如果你的正确性存在于这一层,你的检查时间确实在下降,并且会继续下降。

但请注意,是什么让这一层变快。它之所以快,是因为已经有人写下了正确性的定义,以机器可以评估的形式。规范完成了工作,检查器读取它。

语义验证则是另一回事。代码是否实现了业务实际需要的策略?这种权衡是否符合你的监管风险?在这里,正确性存在于人类的头脑和制度历史中。AI 检查 AI 有结构性问题:检查器与生成器共享训练数据、偏见和盲点。两层在同样的地方以同样的原因失败。自我审查可以发现拼写错误,但无法发现共同的误解。

我认为有三个后果,且这是这篇文章的核心:

所以验证仍然决定吞吐量。变化的是约束的位置:从检查速度变为规范质量,以及具体某个人愿意对结果负责的意愿。

没人知道如何培训工程师以适应这种环境。

你希望资深工程师拥有的判断力,历史上是通过完成 AI 现在吸收的工作来建立的:修复小错误、编写模板、遇到问题再解决问题——这些不仅是任务,实际上是培养判断力的实践。如果机器吸收了这些实践,产生资深工程师的流程就会破裂,而且这种破裂有延迟,所以你在三到五年内都不会注意到。

有一些可行的应对措施。生成代码的结构化审查、刻意的无辅助练习、在测试和验证工作中的轮岗、在资深监督下尽早接触真实系统。我正在运行其中的若干版本。我无法告诉你它们是否有效,因为结果变量是半十年后资深工程师的质量。

我能告诉你的是,任何声称已经解决这个问题的人,无论是供应商、散文作者还是会议演讲者,都在推销某种东西。把这个流程当作一个你个人拥有的开放问题。它在行动与证据之间的延迟最长,而且修正方向的机会最少。

“主管不应该编码。” 那些涉猎编码、审查 pull request 以感觉自己有用,并因此成为瓶颈的主管确实存在。还有那些工作心理模型陈旧五年,无法区分一个真正更快的团队与一个大量产生自信但错误输出的团队(结果混乱)的主管也同样存在。解决方法是校准。你不需要亲自发布。你需要与工具和输出有足够直接的接触,这样你就不会被任何一方迷惑,无论是炒作还是忽视。

“保护团队不受业务干扰。” 这一点背后的假设是注意力有限,而且上下文切换代价高。这一假设仍然成立。改变的是让团队缺乏上下文的代价。没有业务背景的工程师在提示 AI 工具时,只会大规模地产生流畅、看似合理但错误的结果。修正措施不是把所有信息都轰炸给每个人,而是停止默认过滤,并开始有意识地选择:哪种上下文,给谁,以及以何种细节层级。

“我们需要在提交前达成共识。” 共识一直是关于承诺与协调,以及承受低成本调整的能力。低成本调整改变的是哪些决策实际上需要共识。可逆决策,或“双向门”,应由最小的团队尽快做出,因为错误的可逆决策现在容易撤销。不可逆决策仍然需要慢过程。真正的技能是分类,而大多数组织一直在错误分类,把可逆的技术选择当作永久的,把永久的组织决策当作随意的。

“我们需要增加人手。”产出的单位经济学发生了变化,所以每一个请求都值得比三年前提出更严格的问题:这项工作中哪一部分是判断,哪一部分是我们继续雇人做的生产?但不要过度修正。给一个已延期的项目增加人员只会让它更晚。协调成本、入职拖延和沟通开销并不会因为语法的价格而变化。要仔细审查人手数量,因为每个人的产出已经变化,而不是因为人不再是昂贵的部分。

三年过去了,这是我对持久性的看法。实践之所以延续,总有原因,而这些原因总是混合的:有些过时,有些仍然有效,有些是政治性的。当你听到一个老规则被重复时,你通常是在听一个人用错误的论点为有效部分辩护,或者用曾经有效的论点为过时部分辩护。

把持久性当作愚蠢是每种管理潮流的失败模式,而人工智能潮流也不例外。五年后看起来最糟的领导者不会是谨慎的人,而是那些用一套新的口号取代思考的人,即使这些口号听起来准确,并且在他们的组织中基于尚未衡量的主张运作。

当如此大规模的技术出现时,人们的诱惑是采取一种态度:烧掉旧的操作手册或者捍卫它。这两种态度都是懒惰。操作手册从来不是一件单一的物件。它有一百页,其中一些关于打字成本,一些关于人的本质,它们紧密结合,以至于我们忘记了它们可以分开。

不要让任何人,包括一篇自信的文章,包括这篇文章,让你相信这些页曾经是同一页。

最近有人告诉我,人工智能很快也会管理,包括排序工作。我在周末考虑了这件事,我认为部分是对的。

管理具有信息路由功能:汇总状态、跟踪进度、将更新转换为仪表盘、预测计划、整理绩效数据。管理层每天做的大部分工作就是在不同格式和人员之间移动信息。大语言模型在这方面非常出色,而这一价值将趋于零。如果你的管理层靠总结Jira来证明自己的价值,那么是的,那就是过度了。

然后是判断功能:雇用、解雇、晋升,决定在这种情况下适用于这些人的规则,并为错误的决定承担责任。这与验证具有相同的结构。有人将输出与现实进行核对,有人承担后果。

我们回到上文提到的生成论点,但应用于管理工作:管理输出变得丰富,因此成本低。但上述所有内容的核心论点是,当生成变得丰富时,验证成为瓶颈。机器生成的管理仍然需要人类将其与组织的实际行为进行核对,并签署结果。所以这或许不是经理的终结,而是经理降职为编辑者和拥有者。这正是个体贡献者所经历的相同转变。

委派排序还有一个问题。排序需要对你的组织实际行为有一个模型:信任关系、走廊知识、过去决策的后果。这几乎都没有被记录下来。组织的书面记录只是一小部分经过打磨的片段,而模型是基于记录进行排序的。更糟的是,模型从其训练中编码的是行业的平均判断。大型语言模型会大致按中位组织的方式对你的操作手册进行排序。如果你的策略是成为中位组织,那没问题。差异化正存在于你拒绝委派的决策中。

这是我诚实的承认,作为智力练习的排序是可以自动化的。我用人工智能对这篇文章的部分内容进行了压力测试,其初次审核效果不错。不可自动化的是政治和道德工作。

结果是:控制跨度扩大,层级压缩,管理的信息传递层确实面临风险,职位名称的存在会比职能持续更久。能够存续下来的管理工作是那些无法书面化、无法平均化、也无法由他人签署的工作。

工程工作的剩余部分是规范与拥有权。管理工作的剩余部分是判断与拥有权。形态相同,层级不同。

在组织的每一个层级,能够存续下来的工作是必须有人签署的工作。

让我们把外推推到极限,以真正让它深入人心。想象一个组织,代理人编写代码、运行检查、传递状态、安排工作、起草计划。人类设定方向,定义正确的标准,并签署。签署与最终交付结果之间的所有环节都是机器化的。现在把时间线倒推:想象这个组织先出现,然后有人提出你实际运作的那个组织。我们将雇佣数百名昂贵的员工手工生成文本,以打字速度进行。我们会把他们按层排列,每一层的工作是为上一层总结下一层的内容。我们会在房间里同步他们的日程,以便他们可以告诉彼此已经发生的事情。我们将他们的价值衡量为他们输出了多少。没有人会资助这个提议。它很慢,每次交接都会丢失信息,而且把建筑中最稀缺的资源用于机器已经能完成的工作。

你运行的组织从未被设计,而是逐渐积累的。每一个角色、仪式和层级的存在,都是因为某些事情过去很昂贵:打字、传递、检查、记忆。价格变动了,组织架构没有。在代理极限下,组织架构不再记录谁在生产,而开始记录谁签署。员工人数不再衡量产能,而是衡量你能承担多少责任。达到那个阶段的组织看起来会很小、很安静、大部分是空的:短短的名字列表对应着很长的决策列表,其他无事可管。

Karim Jedda

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:一位工程总监基于过去一年的笔记指出,代码生产成本已崩溃且不会回升,但AI工具是否让工程团队显著提速尚无定论。 Aioga 将其归入「技巧观点」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:实践类内容的价值在于是否能被复现、是否有明确边界,以及它能否转化为稳定的开发或工作流方法。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察示例是否可复现、工具版本变化、社区反馈和实际成本。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: karimjedda.com

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-25T22:34:51.368Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

一位工程总监基于过去一年的笔记指出,代码生产成本已崩溃且不会回升,但AI工具是否让工程团队显著提速尚无定论。管理实践应基于其底层假设是否成立来评估:依赖代码编写成本的做法需重新...

Hacker News 热门(buzzing.cc 中文翻译)2026-07-25T22:34:51.368Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。