漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品

据 The Verge 报道,在微软与《纽约时报》等出版商及作者的版权诉讼中,出版商聘请的专家对约820万条微软Copilot聊天日志进行分析,发现仅约6万条日志与新闻内容存在至少16个单词的连续重合,占比不足1%。微软借此主张Copilot很少逐字复制受版权保护的新闻内容。16个单词重合常被作为判断大模型输出是否接近逐字复制的参考指标之一,因此该统计直接关系到生成式AI版权侵权的关键争议。分析结果虽不能完全排除侵权风险,但为微软提供了数据化抗辩:绝大多数交互生成的是非原文表述。在AI训练数据与新闻版权边界诉讼日益增多的背景下,这一发现可能影响法院对AI输出相似性及侵权责任的判断。

核心要点

  • 出版商专家在820万条Copilot日志中仅发现约6万条与新闻内容至少16词重合
  • 重合比例不足1%,显示Copilot很少逐字复述新闻内容
  • 微软用该分析在版权诉讼中主张AI输出通常不是逐字复制

Read more >