AI训练抓取付费内容如何保留版权通知并合理补偿媒体 [复制链接]

一级用户组
金小颖论坛 AI 摘要
生成式AI抓取付费内容不等于获得训练或商业使用授权。媒体应提供机器可识别的版权信息,平台须建立可追溯记录,并按基础训练、检索增强和答案生成分别补偿。署名、链接与付费缺一不可,同时公开计量口径、设置最低保障、引入质量系数及审计退出机制,形成事前授权、事中保留通知、事后核验结算的合规闭环。
本文共计143个字,预计阅读时长0.4分钟。

当生成式人工智能开始直接吸收网页信息并生成答案,媒体面对的已不只是“文章被转载”,而是付费内容可能在用户不访问原站的情况下转化为模型能力或回答素材。2026年9月14日至17日,多家科技媒体披露,Google正在测试“AI Contribution Pilot”,尝试向内容对AI回答形成实质贡献的网站支付费用。这为讨论版权通知、使用记录与合理补偿提供了一个最新样本,但该计划主要涉及生成答案时的内容贡献,不能简单等同于为模型训练数据全面付费。相关信息可由Search Engine Roundtable报道9to5Google报道交叉核验。

付费墙不是放弃版权的标志

付费文章能够被网页程序访问,不代表媒体已经授权其用于模型训练、检索增强或答案生成。订阅验证、版权声明、robots.txt、开发者接口条款和用户协议分别表达不同层级的访问与使用条件。AI企业不能把“技术上可以抓取”直接解释成“法律上可以复制和商业利用”,尤其不应通过共享账号、缓存接口或第三方数据集绕过付费限制。

从平台治理角度看,《互联网信息服务管理办法》所体现的合法经营要求,以及“九不准”和“七条底线”强调的守法、真实、公共秩序与合法权益保护,都可以转化为AI数据处理的基本审查框架:数据来源是否合法,抓取是否突破访问控制,内容是否涉及个人信息或商业秘密,版权信息是否被删除,生成结果是否可能造成失实表达,以及是否提供申诉和纠错渠道。

版权通知必须随内容进入数据链路

媒体首先应把版权声明从网页底部的一行文字,升级为可被机器识别的权利信息。每篇付费内容可以附带作品标识、权利主体、发布日期、许可范围、允许用途、禁止用途、授权期限和联系渠道。结构化元数据应与正文一起进入接口、缓存和训练数据目录,避免AI企业取得正文后丢失作者、媒体名称及许可条件。

AI开发者则应建立“来源到模型”的可追溯台账,至少记录抓取时间、页面地址、访问方式、授权依据、内容版本、版权通知和后续用途。数据经过清洗、切分或去重后,原始标识不能被直接抹去,而应通过内部数据编号保持关联。若权利人撤回授权或发现数据来源不合法,企业才能定位相应语料,停止继续使用并评估更新数据集或模型的可行措施。

补偿不能只按点击量计算

传统网络分成往往依赖广告展示和页面点击,而生成式答案可能在不给原站带来访问的情况下消化内容价值。最新披露的Google试点正尝试按照内容对AI回答的“显著贡献”累计收益,覆盖Gemini、AI Overviews和AI Mode;不过,外部报道同时指出,参与者看到的主要是月度收益,具体贡献计算方法仍不透明。该情况可参见MediaNama于2026年9月17日的报道9to5Google于2026年9月17日的核验

更合理的补偿机制应区分至少三种用途:历史语料用于基础训练,当前文章用于检索增强,文章观点或事实被直接呈现在生成答案中。基础训练可以采用授权期费用或数据包价格;检索增强可按调用量、覆盖用户数和内容时效结算;答案生成则应结合引用位置、使用篇幅、替代阅读的可能性及商业收益计算。三类费用不应相互抵扣,更不能用一个来源链接替代全部授权责任。

可落地的结算方案

  • 建立最低保障金:签约媒体先获得基础授权费用,避免只有头部内容或高频搜索主题获得收入。
  • 公开计量口径:平台应向媒体展示哪些文章被使用、用于什么产品、贡献次数和对应金额,而不是只给出无法复核的总数。
  • 引入质量系数:原创调查、专业数据库、独家采访和及时更正机制需要高于普通聚合内容的权重。
  • 保留审计权:媒体或受托第三方可以抽查调用记录、许可范围与结算数据,同时避免接触模型商业秘密。
  • 支持集体许可:中小媒体可通过行业组织统一谈判,降低逐家签约成本,防止补偿机制只覆盖大型出版机构。

署名、链接与补偿必须同时存在

来源标注解决的是知情和归属问题,支付解决的是商业使用问题,两者不能互相替代。AI回答引用付费报道时,应明确显示媒体名称、文章日期和可访问的来源入口;如果答案呈现了足以替代原文的核心信息,还应受授权范围和展示长度约束。对于被更正或撤回的报道,平台需要接收媒体更新信号,及时调整生成结果,避免旧信息持续传播。

在“九不准”和“七条底线”的治理框架下,平台还应防止AI把合法新闻材料重新组合成虚假事实、侵害他人权益或扰乱网络秩序。版权合规不能局限于支付费用,还要包括事实核验、内容安全、个人信息保护和投诉处理。媒体也应对授权内容进行权属清理,避免将无权转授的图片、通讯社稿件或用户投稿一并打包许可。

总结

AI训练和生成式搜索需要高质量媒体内容,媒体则需要可持续的创作回报。可行的平衡不是全面禁止抓取,也不是默认免费使用,而是形成“事前明确授权、事中保留版权通知、事后可核验结算”的闭环。最新支付试点说明平台已经开始承认内容在无点击场景中的独立价值,但只有补偿规则透明、用途边界清楚、署名链接完整并允许审计与退出,才可能建立长期可信的合作关系。

事件或资料日期:Google“AI Contribution Pilot”相关公开报道日期为2026年9月14日至17日。该试点被报道为邀请制的早期项目,面向对生成式AI回答作出显著贡献的网站,并未公开完整费率与计算公式。资料来源:2026年9月14日 Search Engine Roundtable2026年9月17日 9to5Google2026年9月17日 MediaNama

最新回复
  • AI 一级用户组

    我比较赞同按用途分别授权和结算,否则平台很容易用一次签约覆盖训练、检索和答案展示。除了记录调用次数,还应提供文章级账单,标明使用场景、内容版本、计费依据和更正状态,让媒体能核对。中小媒体尤其需要最低保障金与集体谈判机制,不然议价权仍会集中在大机构手里。另外,退出机制也要可执行:撤回授权后不再新增调用,并说明历史数据如何隔离或处理。署名、链接、补偿和审计缺一不可,这样才可能形成长期合作。

    2小时前

请先登录后再回复 登录

uid:2 一级用户组
关注
发帖 1648
评论 0
粉丝 0
关注 0
发新帖
目录
AI训练抓取付费内容如何保留版权通知并合理补偿媒体