AI 訓練資料授權時代來臨!軟銀如何改寫遊戲規則?

30 秒看重點

  • 事件:軟銀推動 AI 訓練資料授權,終結 AI 巨頭免費爬取網路數據的慣例。
  • 意義:AI 競爭進入下半場,高畫質、具版權的「黃金語料庫」成為勝負關鍵。
  • 影響:台灣繁體中文本土語料庫價值暴增,台廠將迎來版權變現的新商機。

生成式 AI 靠「免費爬網」訓練的黃金時代正式宣告終結。軟銀(SoftBank)近期大舉推動 AI 訓練資料授權化,這不僅改變了 AI 巨頭的遊戲規則,更象徵著未來的 AI 競爭,將從「算力比拼」轉向「優質語料產權」的爭奪戰。

關鍵數據:研究顯示,高達 80% 的公開網路資料在未來兩年內,將被禁止用於未授權的 AI 訓練。

為什麼 AI 巨頭不能再「白嫖」網路資料了?

過去 OpenAI、Google 等巨頭在開發大型語言模型(LLM)時,大多依賴網路爬蟲「無償」抓取全球網頁進行訓練。然而,這種「先用再說」的模式,近年來引發了紐約時報、各大出版社與藝術家的集體反彈,版權訴訟接踵而至。軟銀敏銳地嗅到了這個痛點,開始在全球積極收購、整合媒體與出版資源,並與 AI 廠商洽談「合法授權協議」。這就像是當年的 MP3 音樂下載,從 Napster 的盜版混亂,過渡到 Spotify 的合法訂閱制,軟銀此舉無疑是在建立 AI 界的「Spotify 模式」,讓訓練資料走向正規化與收費化。

  1. 2023-11:各大媒體(如紐約時報)聯手起訴 OpenAI,抗議其未經授權使用內容訓練 AI 模型。
  2. 2024-05:OpenAI 與新聞集團(News Corp)等媒體巨頭達成數十億美元的多年授權協議,開啟合規訓練先河。
  3. 近期:軟銀積極佈局智慧財產權與優質資料庫,改寫生成式 AI 的訓練資料授權規則,卡位 AI 供應鏈最上游。

台灣怎麼看這件事?

台灣的機會在於「繁體中文」與「本土半導體/高科技資料集」。隨著英文與主流語系資料逐漸飽和,具備高知識價值的繁體中文資料成了稀缺資源。台灣若能建立本土的「授權大聯盟」,防堵境外 AI 巨頭無償爬取,不僅能保障台灣文化主體性,更能讓本土媒體、出版業與台廠 AI 業者(如聯發科、台碩等)建立雙贏的商業模式,把「台灣語料」變成高價外銷的黃金。

編輯觀點

軟銀這一手是極為聰明的「陽謀」。在硬體算力(NVIDIA 獨霸)與演算法逐漸去中心化的趨勢下,最難被複製、最稀缺的資源就是「有版權的優質數據」。這對 AI 產業的健康發展是好事,但也意味著 AI 開發成本將呈指數級暴增,未來的 AI 賽道將徹底變成「大資本家」的專屬遊戲,新創公司的生存空間將被進一步壓縮。

常見問題

為什麼 AI 訓練需要合法授權的資料?
為了避免高昂的法律侵權訴訟,且人工生成的優質、專業授權資料,能大幅提升 AI 模型回答的精準度與可信度。
軟銀在 AI 資料授權中扮演什麼角色?
軟銀扮演「資源整合者」,透過收購、代理或合作,將分散的版權資料打包,建立合法的 AI 訓練資料庫並授權給 AI 開發商。
這會導致我們使用的 AI 工具(如 ChatGPT)漲價嗎?
很有可能。當 AI 廠商的資料訓練成本(版權費)大幅增加,這些成本最終會轉嫁到企業訂閱與個人消費者身上。
台灣繁體中文資料在這波浪潮中重要嗎?
非常重要。繁中資料不僅代表台灣文化,更是半導體與高科技製造業的知識寶庫,是全球 AI 巨頭極欲取得的「黃金語料」。
一般創作者如何保護自己的作品不被 AI 免費訓練?
創作者可以在網站設定中加入 Robots.txt 阻擋 AI 爬蟲,或加入支持創作者權益的集體版權授權組織來維權。

名詞小教室

AI 訓練資料授權
就像是餐廳(AI 公司)要用某個祕方(創作者的內容)做菜,以前是偷偷學,現在必須付版權費給原創者(買授權)才能合法使用。