台灣AI語料大戰開打:出版業怒吼!

30 秒看重點

  • 事件:數發部計劃徵集台灣在地AI語料,用於發展本土AI模型。
  • 意義:爭奪AI訓練資料「主權」,但引發出版界對著作權及無償授權的強烈擔憂。
  • 影響:可能影響台灣出版產業的著作權權益,並突顯AI發展下的版權挑戰。

台灣數位發展部(數發部)推動「國家級AI大模型」計畫,需要大量的在地化語料,卻在徵集過程中,與出版界爆發嚴重的授權爭議。出版業者強烈反對政府要求「無償授權」,認為這將嚴重侵害創作者的著作權,為台灣AI發展埋下版權隱患。

關鍵數據:數發部希望匯聚台灣在地的數百億至數兆的語料,以建立可信賴的AI模型。

在地AI的「主權」爭奪戰?

AI之所以強大,就像是一個超級大腦,而「語料」就是它的教科書。這些教科書的內容越豐富、越貼近我們生活,AI學到的知識和能力就越精準。全球各大AI公司都在爭搶這「AI的教科書」,因為誰擁有最好的語料,誰就能訓練出最頂尖的AI模型。這次數發部提出的「台灣主權AI語料」計畫,目標就是打造一個專屬於台灣、了解台灣文化、習慣和需求的AI。這聽起來很美好,就像是我們要蓋一座台灣自己的「AI知識圖書館」,而不是一直去借用國外的書本。

然而,問題出在「教科書」的來源。數發部想從台灣的出版品、新聞報導、學術論文等寶貴的知識資產中,徵集大量內容作為AI模型的訓練資料。最讓出版界炸鍋的,是「無償授權」的條款。試想,一位作家辛辛苦苦寫出來的書,一位記者嘔心瀝血報導的新聞,都是他們的智慧財產,價值連城。現在政府要求「免費借我用」,來訓練一個可能讓別人(甚至是AI公司)賺大錢的AI,出版業的業者們當然覺得權益被嚴重剝奪,就像是發現自己的心血被未經同意就拿去販售一樣。這場風波,不僅是技術上的需求,更是對「內容創作者權益」與「AI發展」之間平衡點的嚴峻考驗。

台灣怎麼看這件事?

這場「AI語料主權」的爭議,對台灣來說,絕對是個需要嚴肅面對的警鐘。一方面,我們確實需要發展在地化的AI,讓AI更懂台灣的語言、文化,甚至在產業應用上能更貼近本土需求。這對於提升台灣的國際競爭力,以及在AI浪潮中站穩腳步至關重要。這也是為什麼數發部會積極推動。但另一方面,出版業是文化傳承的重要推手,他們的著作權是創作產業的生命線。如果政府帶頭,以「國家發展」為名,要求無償授權,這無疑會嚴重打擊創作者的士氣,長遠來看,反而可能扼殺台灣的文化創新能量。

目前,這個議題正處於一個敏感的協商階段。出版界希望政府能尊重智慧財產權,透過合理的授權機制,例如付費授權或建立專門的AI內容授權平台,來達成雙贏。這不僅是為了保護出版業者的權益,更是為了建立一個健康的AI生態系,讓AI發展與文化創作能夠相互促進,而不是互相侵蝕。如果處理不好,可能會讓台灣的AI發展,蒙上一層「侵權」的陰影。

編輯觀點

數發部的初衷或許是為了國家的AI戰略,但「無償授權」這步棋,確實走得太過簡略,且缺乏對產業生態的細緻考量。AI發展是趨勢,但尊重智慧財產權更是普世價值。如何在兩者間取得平衡,政府的態度至關重要。與其強硬徵集,不如積極溝通,建立一套符合市場行情、又能鼓勵創作的AI語料授權機制,這才是長遠之計。別讓台灣的AI,成為建立在「犧牲」創作者權益的基礎上。

常見問題

什麼是AI語料?
AI語料,就像是餵給AI吃的「知識糧食」,包含文字、圖片、聲音、影片等各種資料,AI透過學習這些資料來提升它的智慧和能力。
為什麼台灣需要主權AI語料?
發展在地化的AI,讓AI能更精準理解台灣的語言、文化、在地知識,提供更符合台灣需求的服務,避免AI模型帶有國外偏見。
出版界為何反對無償授權?
出版品是作者的智慧財產,無償授權等於讓業者無償提供自己心血的成果,侵害了著作權,並且損害了創作的價值。
AI訓練語料需要多少?
AI模型越強大,需要的語料量也越大,從數十億到數兆的資料量都是常見的,這也是為何語料的取得與授權成為重要議題。
這個爭議對一般人有什麼影響?
若爭議未妥善處理,可能影響AI服務的品質與在地化程度;長期來看,若創作者權益受損,文化創新可能趨緩,影響內容的多元性。

名詞小教室

AI大模型(Large Language Model, LLM)
就像是一個超級會讀書、會寫作、會聊天的「數位巨嬰」,透過海量資料訓練,具備理解與生成人類語言的能力。
著作權
保護創作者(如作家、記者、畫家)對其原創作品的權利,像是電影票,沒買票就不能看。
授權
創作者允許他人使用其作品的行為,通常伴隨著費用,就像是付費訂閱 Netflix 一樣。