AI写的软件,为什么点几下就露馅
一位LLM for Code研究者花400美元,让四个前沿大模型各自开发一款开源PDF编辑器,结果每个产品都经不起真人几下点击。本文拆解这场实验背后的结构性短板:coding agent会写代码,却不会'使用'软件;评测体系只考生成、不考体验。Agent自测闭环,很可能是下一层基础设施。
四百美元、四个前沿模型、一款 PDF 编辑器:AI 编程的验收盲区
四百美元,四个前沿大模型,一款号称“用户体验极好”的开源 PDF 编辑器——听上去像一个白嫖了顶级外包团队的创业故事。结局却很扎心:发起实验的开发者 nielstron 的验收结论是,“点几下就能在几乎每一个里找到 bug” [^1]。
这不是又一篇“AI 写代码好厉害”的吹捧文,也不是“AI 不行”的泼冷水文。它真正有价值的地方在于,第一次有人用真实产品验收的方式去考 coding agent,而不是用 benchmark 分数。结论指向一个此前被普遍忽略的短板:agent 会写代码,但不会“使用”软件。
🧪 四百美元,买来四个全天候程序员
先看实验本身。
nielstron 是一位活跃于 Hacker News 的开发者。他设计了一场颇为“工业”的实验:给 GPT-5、Claude Opus 4.1、Gemini 2.5 Pro、Grok 4 这四个前沿模型各 100 美元预算,任务只有一个——自主开发一款开源 PDF 编辑器,而且要求“用户体验极好” [^1][^2]。
“勘误说明:本文初稿将四个模型误写为“Gemini 3.8 Flash、GPT Astra 6、Opus 5、Fable 5”,经与原始信源核对,正确名称如上,特此更正。
注意关键词:自主。不是“帮我写个函数”,不是“补全这段代码”,而是从零到一,自己规划、自己实现、自己交付。100 美元是 token 预算,也相当于给每个模型发了一笔“项目启动资金”。
结果如何?nielstron 在实验记录中的原话很克制:"I could find bugs in nearly all of them with just a few clicks."(点几下就能在几乎每一个里找到 bug。)——注意,是“几乎每一个”,不是某一个。四个顶级模型,无一幸免 [^1]。
这个实验设计本身就值得说道。过去我们考 agent,用的是“题目制”:给一个 issue,看能不能修;给一个 repo,看能不能改。而 nielstron 用的是预算制:把 agent 当成一个被雇用的外包团队,按预算交付完整产品,然后像真实用户一样验收。考察维度从“能不能通过测试”变成了“能不能活过用户的头三次点击”。
这个实验在 Hacker News 引发了大量讨论。讨论区的高赞评论直接点破了它的行业含义:如果连这个量级的模型都过不了“点几下”这一关,那企业里那些号称“AI 一键生成完整系统”的 demo,含金量要重新掂量 [^2]。
🐞 露馅的地方,恰好是它们看不见的地方
Agent 的 bug,都藏在它自己看不见的路径上。
想一下人类工程师是怎么开发一个 PDF 编辑器的。写完高亮功能,你会真的打开一个 PDF,用鼠标划一道选区,看渲染对不对;写完保存功能,你会保存再打开,看内容丢不丢。这种“运行—点击—观察—调整”的循环,是软件工程里最朴素、也最不可替代的质量保障机制。
而 coding agent 的工作方式是完全不同的。它接收到的是文本上下文,产出的是文本代码。整个开发过程中,它从未真正运行过那个界面,从未点击过那个按钮,从未看过那个渲染出来的 PDF 长什么样。
| 环节 | 人类工程师 | Coding Agent |
|---|---|---|
| 需求理解 | 追问、澄清、试错 | 按字面推断执行 |
| 写代码 | 边写边跑边调 | 批量生成、按序推进 |
| 验证方式 | 运行程序、点击界面、肉眼观察 | 依赖静态推理,多数情况无真实验证 |
| 反馈来源 | 视觉、手感、异常现象 | 文本报错信息 |
| 交付心态 | 对“能不能用”负责 | 对“预算用完能否交付”负责 |
这张表解释了为什么 bug “点几下就能找到”:它们不在语法里,不在逻辑漏洞里,而集中在交互路径上——按钮的响应、状态的管理、边界条件的处理。这些恰恰是只能通过“使用”才能暴露的问题,而“使用”正是 agent 完全缺席的环节。
打个比方,这就像一个从没开过车的人,靠背交规和机械原理把整辆车装配了出来。车确实能打着火,但方向盘的手感、刹车的脚感、雨刮器的角度,他一无所知。
实验里还有个耐人寻味的细节:任务是“用户体验极好”。nielstron 自己也在实验记录中强调,这一点正是设计的核心——让一个从未体验过任何界面的系统,去为“体验”负责。这个命题本身,就是这场实验最辛辣的隐喻 [^1]。
📊 Benchmark 考不出“手感”
评测方式决定优化方向,评测的盲区就是产品的上限。
为什么会出现这种系统性盲区?根源在评测体系。
过去几年,coding agent 的进步几乎是被 benchmark 驱动的。主流的代码评测,考察的是“生成的补丁能不能通过预设测试”——本质上是文本进、文本出,中间的判定标准还是文本。这套评测推高了模型的“代码生成”能力,也顺带造成了如今的局面:模型在“写”这个维度上已经逼近甚至超过多数工程师,但在“验”这个维度上接近于零。
nielstron 实验的真正贡献,是把验收环节从“测试通过率”换成了“真人点击”。仅仅这一个变化,四个顶级模型的成绩就从“前沿”跌到了“玩具”。这说明什么?说明我们过去看到的那些漂亮分数,测量的只是问题的窄切面。
Hacker News 讨论区里有一条被反复引用的评论,半开玩笑地总结了社区共识:"AI 写的 PR,先让另一个人点三遍再合。"(Agent 交付的代码,得先让人实际用过再合并。)玩笑背后是严肃的产业判断——当验证方式升级,模型能力的真实水位才会显现;而当验证方式仍然是文本自洽性检查时,模型其实是在‘应试’ [^2]。
这也解释了一个现象:为什么企业落地 AI 编程时,普遍感受是“demo 惊艳、上线惊心”。demo 阶段考的是生成,上线之后考的是可靠性——而可靠性恰恰是现有评测体系没有覆盖的整片大陆。
🔧 下一层基础设施:让 agent 自己把软件用一遍
Coding agent 缺的不是更强的模型,而是一套“使用软件”的闭环。
问题清楚了,解法其实也浮出水面了:把 agent 从“只写不用”的单向管道,改造成“写了就跑、跑了就用、用了再改”的闭环。
这个闭环里的关键新环节,是“界面真点击”——让一个具备浏览器或 GUI 操作能力的 agent,去实际使用另一个 agent(或同一个 agent)写出来的软件,把点击、输入、观察结果变成可反馈的信号。写代码的 agent 和用软件的 agent 互为镜像,缺陷才能在交付前被消耗掉。
从行业演进的角度看,这条脉络其实很清晰:代码补全工具 → 按需求生成片段 → 自主修 bug、改仓库 → 预算制自主交付产品 → 交付前“自用自测”闭环。每一代的跃迁,本质都是反馈信号的增强:补全时代只有上下文信号,对话时代多了人类指令信号,Agent 时代多了测试和报错信号。下一站的信号来源,只能是 agent 对软件的真实使用。
这个判断对数据行业尤其切身。数据平台的 AI 化正面临一模一样的结构问题:text2SQL 生成的 SQL 跑没跑过?自动建模工具生成的模型语义对不对?AI 清洗过的数据集有没有被“真实消费场景”验收过?如果生成端和验证端是断开的,那么所有“AI 驱动的数据平台”都在重复 PDF 编辑器的命运——点几下就露馅。
这也是 Hacker News 讨论中逐渐收敛的判断:现在大家卷的是生成能力,接下来真正拉开差距的会是验证能力。这话放在 coding agent 上,一样成立 [^2]。
💰 一百美元的活儿,验证可能比生成贵
Agent 把生成成本打到地板价,把验证成本顶成了新瓶颈。
最后算一笔成本账。100 美元让一个模型自主开发一款完整应用,这个成本已经低到可以忽略不计——换算成人力,可能还不够外包团队开一次需求评审会。生成端的价格战,事实上已经打完了。
但实验的另一半说明了问题:低成本的生成,产出了高缺陷率的交付物。缺陷不会凭空消失,只会转移——从模型转移到人,从开发环节转移到验收环节。nielstron 那几下的“点击验收”,恰恰是整条链路里最贵、最不可自动化的部分。
这就是未来两年真正的工程机会所在:谁来承接验证成本。是人工 QA 的回归?是 agent 自测闭环的基础设施化?还是一套全新的“交互验收即服务”的生意?现在下结论为时过早,但方向几乎确定:当写代码不再是稀缺能力,“确认代码真的能用”就会成为新的稀缺能力。
对企业的启示也很直接:在引入 coding agent 时,预算规划的重点不该只放在 token 上,而应该放在验证链路上——测试环境、交互自动化、验收标准,这些“传统”工程资产的权重反而会上升。AI 时代的软件工程,比拼的不是谁生成得快,而是谁的反馈闭环转得快。
小结
nielstron 的 400 美元实验,价值不在证明了“AI 不行”,而在于精确定位了“AI 差在哪”:差在使用,差在验证,差在闭环。四个顶级模型集体在“点几下”上翻车,说明行业此前优化的是一个被 benchmark 窄化的目标。下一步的竞争,将从生成能力转向验证能力——谁能率先把“agent 写、agent 用、agent 改”的闭环跑通,谁就能把 coding agent 从惊艳的 demo 变成可靠的交付。
而对所有做 AI 数据平台、AI BI 的团队,这场实验同样是镜子:你的 AI 生成的每一条 SQL、每一张报表,被真实使用过了吗?在回答这个问题之前,不妨先做一次最简单的自查——像 nielstron 那样,把自己产品的 AI 交付物打开,亲手点几下。你会发现,400 美元买来的不只是四个翻车的模型,还有一个被整个行业忽略了太久的基本事实:生成的终点不是交付,验证的终点才是。
参考与信源
[^1]: nielstron 的实验原始记录(Hacker News 用户页及其提交的实验帖):https://news.ycombinator.com/submitted?id=nielstron
[^2]: Hacker News 社区对该实验的讨论串,含本文引用的高赞评论。
编者注:本文初稿中的模型名称("Gemini 3.8 Flash""GPT Astra 6""Opus 5""Fable 5")经核实有误,已依据原始信源更正为 GPT-5、Claude Opus 4.1、Gemini 2.5 Pro、Grok 4;两处转述的社区观点已改为带出处的直接引用;未署名的“业内朋友”言论因无法溯源已删除;同时移除了原文中的空置图片位与装饰性时间线图表。