30 秒看重點
- 事件:軟銀推動 AI 訓練資料授權,終結 AI 巨頭免費爬取網路數據的慣例。
- 意義:AI 競爭進入下半場,高畫質、具版權的「黃金語料庫」成為勝負關鍵。
- 影響:台灣繁體中文本土語料庫價值暴增,台廠將迎來版權變現的新商機。
生成式 AI 靠「免費爬網」訓練的黃金時代正式宣告終結。軟銀(SoftBank)近期大舉推動 AI 訓練資料授權化,這不僅改變了 AI 巨頭的遊戲規則,更象徵著未來的 AI 競爭,將從「算力比拼」轉向「優質語料產權」的爭奪戰。
關鍵數據:研究顯示,高達 80% 的公開網路資料在未來兩年內,將被禁止用於未授權的 AI 訓練。
為什麼 AI 巨頭不能再「白嫖」網路資料了?
過去 OpenAI、Google 等巨頭在開發大型語言模型(LLM)時,大多依賴網路爬蟲「無償」抓取全球網頁進行訓練。然而,這種「先用再說」的模式,近年來引發了紐約時報、各大出版社與藝術家的集體反彈,版權訴訟接踵而至。軟銀敏銳地嗅到了這個痛點,開始在全球積極收購、整合媒體與出版資源,並與 AI 廠商洽談「合法授權協議」。這就像是當年的 MP3 音樂下載,從 Napster 的盜版混亂,過渡到 Spotify 的合法訂閱制,軟銀此舉無疑是在建立 AI 界的「Spotify 模式」,讓訓練資料走向正規化與收費化。
- 2023-11:各大媒體(如紐約時報)聯手起訴 OpenAI,抗議其未經授權使用內容訓練 AI 模型。
- 2024-05:OpenAI 與新聞集團(News Corp)等媒體巨頭達成數十億美元的多年授權協議,開啟合規訓練先河。
- 近期:軟銀積極佈局智慧財產權與優質資料庫,改寫生成式 AI 的訓練資料授權規則,卡位 AI 供應鏈最上游。
台灣怎麼看這件事?
台灣的機會在於「繁體中文」與「本土半導體/高科技資料集」。隨著英文與主流語系資料逐漸飽和,具備高知識價值的繁體中文資料成了稀缺資源。台灣若能建立本土的「授權大聯盟」,防堵境外 AI 巨頭無償爬取,不僅能保障台灣文化主體性,更能讓本土媒體、出版業與台廠 AI 業者(如聯發科、台碩等)建立雙贏的商業模式,把「台灣語料」變成高價外銷的黃金。
編輯觀點
軟銀這一手是極為聰明的「陽謀」。在硬體算力(NVIDIA 獨霸)與演算法逐漸去中心化的趨勢下,最難被複製、最稀缺的資源就是「有版權的優質數據」。這對 AI 產業的健康發展是好事,但也意味著 AI 開發成本將呈指數級暴增,未來的 AI 賽道將徹底變成「大資本家」的專屬遊戲,新創公司的生存空間將被進一步壓縮。
常見問題
- 為什麼 AI 訓練需要合法授權的資料?
- 為了避免高昂的法律侵權訴訟,且人工生成的優質、專業授權資料,能大幅提升 AI 模型回答的精準度與可信度。
- 軟銀在 AI 資料授權中扮演什麼角色?
- 軟銀扮演「資源整合者」,透過收購、代理或合作,將分散的版權資料打包,建立合法的 AI 訓練資料庫並授權給 AI 開發商。
- 這會導致我們使用的 AI 工具(如 ChatGPT)漲價嗎?
- 很有可能。當 AI 廠商的資料訓練成本(版權費)大幅增加,這些成本最終會轉嫁到企業訂閱與個人消費者身上。
- 台灣繁體中文資料在這波浪潮中重要嗎?
- 非常重要。繁中資料不僅代表台灣文化,更是半導體與高科技製造業的知識寶庫,是全球 AI 巨頭極欲取得的「黃金語料」。
- 一般創作者如何保護自己的作品不被 AI 免費訓練?
- 創作者可以在網站設定中加入 Robots.txt 阻擋 AI 爬蟲,或加入支持創作者權益的集體版權授權組織來維權。
名詞小教室
- AI 訓練資料授權
- 就像是餐廳(AI 公司)要用某個祕方(創作者的內容)做菜,以前是偷偷學,現在必須付版權費給原創者(買授權)才能合法使用。