新闻内容接入 RAG,版权边界不能用“能否访问”一个问题概括。至少要拆成两层判断:数据是否可以被采集、保存和检索,以及系统输出是否对原作品构成了实质性再现。前者解决数据进入知识库的合法性,后者决定回答内容是否可能成为未经许可的传播或利用。即使网页公开可见,也不意味着新闻内容可以被任意抓取,更不意味着可以直接用于生成式服务。
先看权利人的技术信号
日本新闻协会于 2025 年 6 月 4 日发布的声明,将 robots.txt 视为权利人表达拒绝 AI 使用意愿的重要技术信号。它本身未必具有独立的法律约束力,但如果采集方明知网站通过该文件限制 AI 爬取,仍故意绕过限制,风险就不再只是“技术争议”。
日本文化厅 2024 年 3 月发布的相关文件指出,在特定情形下,故意规避网站技术措施、收集可作为数据库作品使用或销售的数据,可能被认定为不当损害权利人利益。由此可见,robots.txt 更适合作为合规判断中的“明确拒绝标记”,而不是可以随意忽略的普通配置。
企业应为每批新闻数据记录原始 URL、采集时间、当时的 robots.txt 状态以及授权文件。若网站明确禁止 AI 爬取,最稳妥的处理不是寻找技术绕行方式,而是停止采集、排除已有数据,或取得书面许可。
再看输出是否越过“轻微利用”
RAG 的另一条风险链发生在回答阶段。系统引用标题、事实性信息或提供原文链接,并不当然等于侵权;但如果回答连续复述新闻的独特表达、核心段落或完整叙事结构,就可能超出合理的信息检索范围。日本文化厅文件提到,RAG 输出若超出著作权法所称的“轻微利用”范围并实质性再现原作,仍需取得权利人许可。
因此,合规控制不能只放在爬虫端,还应覆盖检索和生成环节:对禁止采集的来源设置排除标记,限制长段落复述,保留来源链接,并对高风险新闻进行人工抽查。尤其是时事、财经等内容,系统越追求“忠实还原”,越需要警惕从信息辅助滑向内容替代。
真正可审计的边界,应当同时回答三个问题:数据从哪里来、权利人是否表达过拒绝、最终回答是否再现了原文。只有把授权记录、技术信号和输出控制连成闭环,RAG 新闻应用才不会把“公开可见”误判成“可以自由使用”。