AI for Data🔥8.0
$100 预算 + 四个顶级大模型,造出的 PDF 编辑器点几下就露馅
📋总体概括
一位研究 LLM for Code 的研究者 nielstron 做了个实验:给 Gemini 3.8 Flash、GPT Astra 6、Opus 5、Fable 5 四个前沿大模型各 100 美元预算(共约 400 美元),让它们自主开发一款用户体验极好的开源 PDF 编辑器。结果是四个模型做出的产品都经不起测试,点几下就能在几乎每个里找到 bug。作者据此提出关键论点:coding agent 无法像人一样与软件交互,这限制了它们自主开发高质量软件的能力。
⚡关键信息
- ▸研究者给四个前沿模型各 100 美元预算,让它们自主开发开源 PDF 编辑器,总成本约 400 美元
- ▸参与实验的模型包括 Gemini 3.8 Flash、GPT Astra 6、Opus 5、Fable 5
- ▸实验结果:四个模型开发的产品点几下就能在几乎每个里找到 bug
- ▸作者核心结论:coding agent 不能像人一样与软件交互,导致难以独立产出高质量软件
🔥犀利点评
这个实验的价值不在四个玩具级 PDF 编辑器本身,而在揭示了 agentic coding 的盲区:模型能写代码,却不会像用户一样「用」软件。缺乏真实交互反馈闭环,agent 就只能靠生成代码自我确认,bug 自然点几下就现形。所谓「用户体验极好」这个需求,恰恰精准打中了 LLM 缺乏感知与试错能力的软肋——这比 benchmark 分数更诚实。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 OSCHINA 阅读全文 →