Data for AI

你的旧推文可能正在成为AI训练数据

原标题: 你的旧推文可能正在成为AI训练数据

DevToData·2026/10/10 23:32:35🔗 原文

📋总体概括

文章解析AI大模型如何抓取用户公开推文等社交媒体内容作为训练语料。指出公开社交帖子因体量大、具备真实对话语境而成为高价值语料,公开推文被采集的概率很高,且通常无需用户另行授权。文章同时探讨普通用户可采取的撤回或限制措施,帮助读者理解自身数字足迹与AI训练数据之间的关联及应对方式。

⚡关键信息

  • ▸大语言模型需要天文数字级别的文本量作为训练语料
  • ▸公开社交帖子因体量大、含真实对话语境被视为高价值语料
  • ▸公开推文被爬取概率高,通常无需单独征得用户同意
  • ▸文章建议普通用户可采取措施撤回或限制旧推文的使用
  • ▸书籍、论坛、公开数据集与网页均是模型训练的主要文本来源

🔥犀利点评

说白了,你在社交媒体上的每条公开动态,本质上是默认免费投喂给AI的数据饲料。平台赚的是社交生意,模型厂商赚的是数据红利,唯一没拿到任何收益和选择权的是内容生产者本人。所谓「可以撤回」的补救,对已经被抓走的数据毫无意义——删除只对未来的爬虫有效。这再次印证:AI时代真正的稀缺资源不是算力,而是尚未被圈占的人类语料。

本文由本站自动聚合,以下为原始来源:前往 DevToData 阅读全文 →