新聞股票牛津大學與OpenAI合作 以博德利圖書館文本訓練AI模型

牛津大學與OpenAI合作 以博德利圖書館文本訓練AI模型

作者: CryptoBriefing·

重點速覽

  • •根據2025年3月4日宣布的五年合作協議,OpenAI將能以牛津博德利圖書館的歷史文本訓練其AI模型。
  • •2月啟動的試點計畫正將約3,500篇1498年至1884年間的公有領域論文數位化,目標是讓這些數百年的館藏可被搜尋並向全球開放。
  • •該協議是OpenAI NextGenAI計畫的一部分,該計畫已向包括哈佛大學與麻省理工學院在內的頂尖機構承諾提供5,000萬美元的研究補助、運算資源與API存取權限。
  • •牛津在約750名使用者試點後,計劃自2025年9月起在全校推行ChatGPT Edu,數位化計畫的開放取用研究報告預計於2026年初發布。
  • •儘管試點論文屬於公有領域,部分校方教職員仍因OpenAI的版權爭議與資料來源做法,對合作帶來的聲譽風險表達疑慮。
牛津大學與OpenAI合作 以博德利圖書館文本訓練AI模型

牛津大學與OpenAI達成為期五年的合作協議,將允許ChatGPT背後的這家公司以博德利圖書館收藏的歷史文本訓練其AI模型。博德利圖書館是世界上最古老、最負盛名的圖書館體系之一。

這項於2025年3月4日宣布的合作,首先於2月啟動試點計畫,重點是將約3,500篇1498年至1884年間的公有領域論文數位化。這些已有數百年歷史的文本,過去對於無法親自造訪牛津的人而言大多難以取得,意味著全球研究社群實際上難以接觸這批資料。

合作內容為何

該協議隸屬於OpenAI的NextGenAI計畫,該計畫已向包括牛津在內、與哈佛大學及麻省理工學院並列的一群頂尖機構,承諾提供5,000萬美元的研究補助、運算資源與API存取權限。

對博德利圖書館而言,其宣明的目標十分明確:以AI驅動的詮釋資料強化與改進的轉錄服務,將使這些數百年的館藏可被搜尋並向全球開放。

在教育方面,牛津計劃自2025年9月起在全校推動ChatGPT Edu。該工具已在約750名使用者中進行試點。數位化計畫的研究結果預計於2026年初以開放取用報告的形式發布,為外界提供具體的檢核點,以判斷這項合作是否兌現其宣示的目標。

教職員的疑慮

並非牛津校內所有人都為這項安排感到欣喜。校方教職員已表達與OpenAI合作所帶來的聲譽風險疑慮。這家公司在版權爭議、資料來源做法,以及執行長Sam Altman領導下的快速商業化等方面,持續受到批評。

試點計畫涵蓋的論文屬於公有領域,版權限制。然而,一所擁有約900年歷史的學術機構將其館藏提供給一家營利性AI公司的觀感問題,仍引發了關注。

此外還有雙方各取所需的問題。牛津獲得數位化支援、運算資源與教育工具;OpenAI則獲得來自全球信賴來源的高品質、經過篩選的訓練資料,以及與牛津合作所帶來的隱性背書——在公司資料做法仍受爭議的情況下,這種背書的價值更為凸顯。

更大的格局

牛津與OpenAI的協議,正值高等教育界加速出現的一股趨勢。科技公司日益將學術機構視為資料來源,部分原因是網路爬取資料正面臨法律挑戰,另一部分原因則是學術語料庫的品質通常高於一般的網路文字。

在此背景下,牛津ChatGPT Edu的推動情況與數位化報告的反響,將受到正在評估類似合作安排的機構密切關注。NextGenAI計畫5,000萬美元的承諾雖分散於多個機構,規模可觀,但相較於OpenAI每年以數十億美元計的整體支出,仍屬適度。