AI for Data🔥8.0

$100 预算 + 四个顶级大模型,造出的 PDF 编辑器点几下就露馅

OSCHINA·2026/10/9 02:48:17🔗 原文

📋总体概括

一位研究 LLM for Code 的研究者 nielstron 做了个实验:给 Gemini 3.8 Flash、GPT Astra 6、Opus 5、Fable 5 四个前沿大模型各 100 美元预算(共约 400 美元),让它们自主开发一款用户体验极好的开源 PDF 编辑器。结果是四个模型做出的产品都经不起测试,点几下就能在几乎每个里找到 bug。作者据此提出关键论点:coding agent 无法像人一样与软件交互,这限制了它们自主开发高质量软件的能力。

⚡关键信息

  • ▸研究者给四个前沿模型各 100 美元预算,让它们自主开发开源 PDF 编辑器,总成本约 400 美元
  • ▸参与实验的模型包括 Gemini 3.8 Flash、GPT Astra 6、Opus 5、Fable 5
  • ▸实验结果:四个模型开发的产品点几下就能在几乎每个里找到 bug
  • ▸作者核心结论:coding agent 不能像人一样与软件交互,导致难以独立产出高质量软件

🔥犀利点评

这个实验的价值不在四个玩具级 PDF 编辑器本身,而在揭示了 agentic coding 的盲区:模型能写代码,却不会像用户一样「用」软件。缺乏真实交互反馈闭环,agent 就只能靠生成代码自我确认,bug 自然点几下就现形。所谓「用户体验极好」这个需求,恰恰精准打中了 LLM 缺乏感知与试错能力的软肋——这比 benchmark 分数更诚实。

本文由本站自动聚合,以下为原始来源:前往 OSCHINA 阅读全文 →