最新研究:歐盟開源人工智慧發展面臨的著作權挑戰
隨著歐盟(European Union)積極追求數位主權(digital sovereignty),其創新目標與現行法律框架之間出現了根本性的結構性錯位。在整個歐洲,學術研究聯盟正利用公共資金來建立開源且符合公共利益的大型語言模型(LLMs)。然而,正如由 COMMUNIA 委託、並由 Centrum Cyfrowe 和 Open Future 進行的最新研究所顯示,歐洲的開源與公共人工智慧(AI)開發者正發現自己受困於錯綜複雜的著作權限制與法律不確定性之中。
這份名為 Copyright challenges in open-source AI development in the European Union(提供 PDF 檔案下載)的報告,提供了實證證據,說明《數位單一市場著作權指令》(CDSMD)所確立的現行文字與數據探勘(TDM)例外規定在實務上是如何運作的。該研究對歐洲著名 AI 專案(包括 OpenEuroLLM、Pleias、PLLUM 和 SOOFI)的八位技術負責人和數據專家進行了深度訪談,藉此描繪出阻礙公共利益科技發展的實務運作瓶頸。
《數位單一市場著作權》(CDSM)指令包含兩項針對文字與數據探勘(TDM)的強制性例外規定。第 3 條允許研究機構和文化遺產機構為了科學研究進行文字與數據探勘(TDM)。同時,第 4 條允許一般用途的文字與數據探勘(TDM),但允許著作權人實施「退出」(opt-out)機制。該研究指出,這種區分造成了結構性的摩擦。由於受公共資金資助的專案通常被要求開源其模型——以允許廣泛的重複使用,包括商業應用——大學的法務團隊經常建議不要依賴僅限於研究範圍的第 3 條。正如一位受訪者所言:
我們身為科學機構的事實,並未賦予我們僅依據第 3 條運作的權利,因為用途才是關鍵。
因此,公益團隊通常會轉向限制更嚴格的第 4 條(Article 4)框架。在此機制下,開發者必須投入運算與財務資源,來解析未經標準化的選擇退出(opt-out)聲明。正如該報告所指出的:
這並沒有標準的公式——不像藥品免責聲明那樣具有每個人都能識別的固定法律形式。限制聲明以各種形式出現。這提出了一個關鍵問題:哪種形式足以被視為有效的保留(reservation),而哪種又不是?
政策建議:確保開放科學(Open Science)的未來
為了確保歐洲的公益人工智慧(AI)能夠擴大規模,該研究的作者列出了一系列具針對性的政策干預措施,旨在降低這些障礙:
- 釐清文字與數據探勘(TDM)例外條款的範圍:歐盟法律必須明確確認,AI 系統的訓練與開發構成了合法的文字與數據探勘活動,並受到第 3 條與第 4 條的保護。此外,歐盟立法者必須澄清,開源大型語言模型(LLMs)及其組件在《數位單一市場指令》(DSM)第 3 條下已獲完全允許,且不會使該機構失去科學研究和 TDM 例外條款的適用資格。
- 引入法定的分享權利:政策制定者應加強第 3 條,引入一項明確的權利,允許科學研究機構託管、分享和重新發布整理過的訓練數據集,以供驗證和同儕審查(peer review)。
- 建立善意的「避風港」(safe harbors)機制:遵循標準程序合規協定的研究人員和公益中介機構,必須在法律上免受法定著作權索賠和法律責任的追究。
- 開發歐洲公共訓練語料庫:歐洲需要投資數位基礎建設,建立共享且高品質的公共訓練語料庫。這將使《數位單一市場著作權指令》(CDSM Directive)的數據共享目標落實到實際運作中。
為了讓歐洲的數位主權(digital sovereignty)從口號走向現實,著作權框架必須積極保護公益創新,而不是用法律風險來懲罰它。一個平衡的數位生態系統需要健全的權利,將開放科學和共享知識視為至關重要的公共財(common goods)。
