AI for Data🔥7.0

$100 预算 + 四个顶级大模型,造出的 PDF 编辑器点几下就露馅

OSCHINA·2026/10/9 02:48:17🔗 原文

📋总体概括

一位研究 LLM for Code 的开发者 nielstron 做了个实验:给 Gemini 3.8 Flash、GPT Astra 6、Opus 5、Fable 5 四个前沿模型各 100 美元预算,让它们自主开发一款开源 PDF 编辑器。虽然成品初看惊艳,但简单操作几下就能在几乎每个作品里发现 bug。作者据此指出核心症结:coding agent 无法像人一样与软件交互,缺乏真实使用反馈,导致表面光鲜、体验脆弱。

⚡关键信息

  • ▸实验总预算约 400 美元,四个前沿模型各获得 100 美元的自主开发预算
  • ▸被测试模型包括 Gemini 3.8 Flash、GPT Astra 6、Opus 5 和 Fable 5
  • ▸任务是让模型自主开发一款「用户体验极好」的开源 PDF 编辑器
  • ▸结论是每个作品都「点几下就能找到 bug」,功能完成度与实际可用性差距明显
  • ▸作者归因于 coding agent 不能像人类一样与软件交互、缺乏真实反馈闭环

🔥犀利点评

这个实验戳破了 Vibe Coding 的滤镜:agent 写代码快如流水,却不会打开自己写的软件点几下。没有运行时反馈、没有真实交互验证,模型只是在「猜」代码对不对,编译通过≠产品可用。所谓四模型对比更像四种姿势翻车,真正的瓶颈不在模型智商,而在 agent 缺少端到端的使用回路——谁先把「像人一样操作软件」补上,谁就赢下一程。

本文由本站自动聚合,以下为原始来源:前往 OSCHINA 阅读全文 →