当Agent在帮你跑任务的时候,你在做什么?
最近我观察到一个现象,经过一段跟Agent讨论确定好方案设计、开发测试计划之后,Agent会像一个勤勤恳恳的好伙伴帮我去自动化地完成所有的任务,除了有些细节不清楚需要“问”我之外,一般就是macOS锁屏了、AI额度达到限制了才需要我关注处理。
然而,最近我意识到一件诡异的事情,Agent在跑任务的过程中,我自己有相当一部分时间会盯着Agent的thinking、输出的文档、code diff等等,也不算是发呆、也不算是思考,就是一种两眼空空的状态,就跟人在等电梯的时候,无意识地打开手机左右划两下很相似。
AI出现提高了效率,又好像没有提高效率。
这个问题首先肯定跟我自己相关,我想先弄清楚这个状态是什么,查了一圈资料发现这种「两眼空空」既不是发呆、也不是思考的状态,在认知心理学上有一个近似的概念叫 注意力残留(Attention Residue),我把任务交给Agent之后实际上卡在了三种状态之间:
- 无法深度脱钩:任务还没完成,你的认知资源不敢完全撤出(万一需要我介入呢?);
- 无法深度参与:执行权已经交出去了,你插不上手;
- 不够时间或者不想做别的事:Agent几分钟就出结果,不够完成另一项深度工作,或者压根就不想做别的事情;
结果我(大脑)本能地选择了一种「最低功耗维持连接」的模式——盯着屏幕,眼睛接收信息,但不加工、不判断、不行动 —— 用低密度刺激填充一段既不能离开、又无法利用的过渡时间。这种诡异感来自:我清楚地知道这段时间本可以用来做别的,但身体和注意力都不听使唤。
我习惯了构思→动手→反馈→调整→完成这样的回路,每个步骤都可以从反馈中得到奖励,这是我已经长久训练并熟悉的多巴胺回路,现在Agent把我的回路打断了,于是我会试着用“盯着Agent的产出过程”来作为自己的参与 —— 我在工作,我在把关,我没有浪费时间。
自动化系统有个经典悖论:系统越可靠,人越容易「出环」(out-of-the-loop),但一旦出环,人的情境意识(situation awareness)就会下降。为了不被抛出环外,人会无意识地维持一个「监控姿态」 —— 持续盯着系统输出,确保自己随时能接管。我盯着Agent的执行就是这种低强度的持续监控。这是多么讽刺的局面:Agent本来是为了解放我,但它把我从操作者变成了监控者,而监控本身就是一种隐性劳动,它实实在在地消耗了我的时间和注意力。
我一直以为AI把任务做掉了,我应该变得更高效,但是好像并没有……
所以,AI到底改变了什么?我想着不妨做一次思想实验!
根据奥卡姆剃刀,我有一个简单粗暴的推断:Agent/AI可以替人做的任务,本质上这些任务就不需要人做。
如果这个推断成立的话,那就意味着现在AI能够帮我完成的很多coding事情本质上就是不需要我做的,紧接着问题来了,程序员不做coding、testing那应该做什么呢?如果coding、testing这些可以由AI做的事情,本就不应该由我做,那么作为程序员的我应该做什么?
或者我换一个视角提问,现在占据了程序员大量时间的工作会被一个高效的工具替代掉,那腾出来的时间程序员应该做什么?不然,就会变成当前的状态:对着Agent输出发呆,陷入那种低强度的持续监控的劳动中。
有人说AI时代程序员的价值是“定义问题、设计系统、并做出最优判断”,重要的能力是“抽象力、洞察力、批判力与伦理思辨力”。这些价值和能力,好像在互联网时代也是有的,只是价值被“写代码”、“熟练度”等外显的东西包裹住了。
这么看,当前AI还没有彻底颠覆程序员这个行业,只是将更加本质的东西和价值凸显出来了,AI把本来就不应该要程序员做的“写”、“记”、“熟”都做了,上面提到的关键能力和价值还是需要程序员来展示,这么看来程序员以后只会更贵……
按照上面的思考,从一个资深的程序员视角好像还好,那么紧接着的一个问题“你相信AGI吗?如果AGI到了,程序员这个职业还是会像我上面的判断那样吗?”。
我个人觉得AGI一定会到来,所以我基于这个前提试着做一次思想实验。
实验问题:当前在Coding领域是否已经达到AGI了?
思想实验:
- 判断Coding AGI的维度划分
| 维度 | AGI 级编码能力应具备的特征 |
|---|---|
| 任务广度 | 能处理几乎所有类型的软件工程任务,从前端到后端、从 bug 修复到架构设计 |
| 自主性 | 在数小时甚至数天的长周期任务中,无需人类干预即可持续工作并交付 |
| 质量 | 产出代码质量与熟练人类工程师相当或更优 |
| 适应性 | 面对陌生的代码库、语言、框架,只需少量上下文即可上手 |
| 推理深度 | 能理解模糊需求、进行 trade-off 判断、主动质疑不合理要求 |
看Mythos、Astra各自的情况:
- Mythos SWE-bench Verified:93.9%(2026年4月数据)。
- Mythos SWE-bench Pro:77.8%(更高难度的企业级长周期任务)。
- Mythos连续工作 16 小时+:METR 机构测试发现 Claude Mythos Preview 能持续自主工作至少 16 小时。
- Anthropic 内部超 80% 代码由 Claude 编写。
- Mythos 一次提交修复 800+ bug,将 API 错误率降低一千倍。
- 在最开放、最复杂的工程任务难度档位上,Claude 成功率从 2025 年底的 26% 上升到 2026 年 76%。
- 代码质量方面,2026 年 5 月 Anthropic 内部评估是"Claude 与人类大致持平",预计一年内才全面超越——说明现在还处于追赶或持平阶段,自动代码审查能捕获约 1/3 的生产事故 bug,仍会遗漏不少。
- Astra 在 ARC-AGI-3 上拿到 99.9%,在 Coding Agent Index 上,Astra 得分 67 分,落后于 Fable 5.1 的 70 分。
- 可以做这样的总结:Claude Mythos 在 coding 领域大概处于 L3-L4 之间(在特定领域超越人类,但泛化性和可靠性不足),当前它们的状态更像是 AGI 的前夜。
基本上可以认为coding领域AGI的到来是确定性事件,并且这个事件可能会很快发生。
这两天Meta发布了Muse,Zuckerberg对于这个Personal AI的思考非常完善、逻辑清晰,有人说它的状态很像互联网早期的微信,AGI如果仅仅是替代现有工作,创造不了真正的新时代,我们现在做的所有事,可能都只是在用新工具干旧活,真正属于这个时代的东西,也许还在某个人的脑子里,还没被想出来。代表性产品还没出现。
程序员也是类似的,我们可能都只是在用新工具干旧活,真正属于AI时代的“程序员”还没有出现,或者还在某个OPC逼仄的办公室内。
云栖大会上吴泳铭说:“新生儿早衰症全球可能就几百个患者,按现在的商业逻辑没有公司愿意花几十年去做这个药。但如果思考的成本趋近于零,上百万个 Agent 可以不眠不休地跑实验,那这几百个孩子就会得到治疗而活下来”
也许当Agent在帮你跑任务的时候,那些在过去因为不赚钱就没人管的人、事、物,第一次有了被你认真对待的可能。
Public discussion