歐盟開源 AI 開發面臨的著作權挑戰 – Open Future

歐盟希望以開源 AI 建立數位主權,但自己的著作權規則卻成為阻礙。由大量公共資金支持的歐洲研究聯盟,正在開發開源、公共利益導向的大型語言模型(LLM)。與此同時,一張由著作權限制與法律不確定性構成的網,卻限制了他們試圖建立的開源 AI 生態系。

這項研究由 COMMUNIACentrum Cyfrowe 與 Open Future 共同完成。這是 Open Future 持續推動公共 AI 工作的一部分,探討歐洲如何發展開放、可問責,並符合公共利益的 AI 系統。這也與我們先前關於開源 AI 的工作相關,包括對兩個此類模型開發過程的深入觀察

本研究是對法律環境的實證盤點。研究採訪了八位來自歐洲倡議計畫的技術負責人、首席研究員,以及法律與資料專家,相關計畫包括 OpenEuroLLM、Pleias、GAMS、PLLUM、SOOFI、GPT-NL,以及一個匿名的氣候變遷出版品資料庫。目標是記錄影響,且往往阻礙歐洲開源 AI 發展的著作權挑戰。

指令核心的錯配

《數位單一市場著作權指令》(Copyright in the Digital Single Market Directive, CDSMD)規定了兩項強制性的文本與資料探勘(TDM)例外。第 3 條允許研究組織與文化遺產機構為科學研究進行 TDM。第 4 條則允許任何人進行一般用途的 TDM,但包含權利人的退出機制。

這項區分造成了摩擦。研究機構進行的 AI 訓練,經常會脫離第 3 條的適用範圍,轉而落入限制更嚴格的第 4 條;這與研究例外原本要實現的目的正好相反。

訪談揭示了什麼

在 TDM 例外下,AI 訓練規則不明確,已成為訓練開源大型語言模型(LLM)面臨的最大法律挑戰。遵循選擇退出(opt-out)要求又讓問題更加複雜,而目前缺乏標準化、機器可讀的權利保留資訊,也使情況更難處理。資料共享在歐盟內部同樣尚未調和,因此研究者各自使用自己的爬取資料,形成重複投入,也浪費公共資源。

建議

根據受訪者的觀察,本研究提出四項政策建議,以強化開源模型訓練的法律基礎、擴大公共利益導向的資料共享,並保障開放科學研究成果:

  • 明確將 AI 訓練列為受保護的 TDM。 歐盟法律應明確規定,依該指令第 3 條與第 4 條,訓練與開發 AI 系統屬於合法的 TDM 活動。
  • 建立研究資料共享的法定權利。 應設立明確且不可拋棄的公共利益例外,確保科學研究機構能合法託管、分享並重新發布整理過的訓練資料集,以供同儕審查、評估與演算法驗證。
  • 保護善意研究者與中介者。 遵循標準合規程序的研究者與公共利益中介者,應免於法定著作權請求與法律責任的影響,避免這些風險阻礙其開源 AI 工作。
  • 建立歐洲公共訓練語料庫。 歐洲需要將公共訓練語料庫作為數位基礎設施,讓第 3 條與第 4 條的資料共享規定能實際落地。

閱讀研究