用GitHub上的开源代码训练人工智能违法吗?
近日,人工智能公司 OpenAI 在开发者大会上 宣布 [i] :如果用户因人工智能生成内容造成版权侵权被起诉索赔,其将向用户提供版权保护盾:为客户辩护并报销过程中产生的费用。其实 OpenAI 这招是从微软学来的。而微软,则是因为用了开源软件代码训练人工智能被起诉,迫不得已才想出版权保护盾的办法。今天就来聊聊微软被起诉这个的诉讼,以及用开源代码训练人工智能到底有哪些法律风险。 笔者在网上找到了案件的起诉书、微软的答辩意见和美国加利福尼亚北区法院的 初步裁定 [ii] ,今天就根据相关内容介绍一下该案。美国是普通法系国家,法院的审判模式和我国有很大区别,所以我对判决书中的判例引用和制度也都不甚了解,只能挑自己看得懂的案件事实和部分说理做摘要。美国法律上的分析可以参考美国律师这篇 文章 [iii] 。 OpenAI 公司开发出一款名为 Codex 的人工智能生成工具。 GitHub 推出了基于生成式人工智能的代码自动完成工具 Copilot 。 Copilot 是一款面向 GitHub 用户的订阅工具,月费 10 美元,年费 100 美元。根据诉状, Copilot 需要 Codex 才能运行。 2022 年 11 月,两名软件开发者使用化名(为什么用化名起诉,因为有人通过原告律师对原告发出过死亡威胁)提起了假定的集体诉讼,被告为 GitHub 、微软(作为 GitHub 的母公司)、 OpenAI 。原告声称 Copilot 和 Codex 作为人工智能工具,其训练中使用了原告受版权保护的计算机代码。 开源代码的特点是都在开源许可证下发布的,既然是开放的,所以用开源代码训练人工智能也不能说必然侵权,但在 GitHub 上有 11 种开源许可证,每一种许可证都对使用开源代码者有不同的要求,要求任何衍生作品或许可作品的副本都包含贡献源代码者的信息、版权声明以及其他要求,比如 GPL 许可证下的代码要求使用者开放其软件中的全部源代码。 但原告认为,当他们的代码被用作训练数据时,代码附带的开源许可证的版权管理信息(“ CMI ” Copyright Management Information )被删除了。他们还认定 Codex 和 Copilot 生成的作品部分包含了...