新闻股票牛津大学与OpenAI合作,允许其使用博德利图书馆文献训练AI模型

牛津大学与OpenAI合作,允许其使用博德利图书馆文献训练AI模型

作者: CryptoBriefing·

要点速览

  • •根据2025年3月4日宣布的五年合作协议,OpenAI将可以使用牛津大学博德利图书馆的历史文献训练其AI模型。
  • •2月启动的试点项目正在将约3,500篇1498年至1884年间的公有领域学位论文数字化,旨在使这些数百年历史的馆藏可被检索并向全球开放。
  • •该协议是OpenAI NextGenAI计划的一部分,该计划已向包括哈佛大学和麻省理工学院在内的顶尖院校承诺提供5,000万美元的研究资助、计算资源和API访问权限。
  • •牛津大学在约750名用户中完成试点后,计划自2025年9月起在全校推广ChatGPT Edu,数字化项目的开放式获取研究报告预计于2026年初发布。
  • •部分大学员工对与OpenAI合作的声誉风险表示担忧,涉及其版权争议和数据来源实践,尽管试点涉及的学位论文属于公有领域。
牛津大学与OpenAI合作,允许其使用博德利图书馆文献训练AI模型

牛津大学与OpenAI达成了一项为期五年的合作协议,将允许这家ChatGPT背后的公司使用博德利图书馆收藏的历史文献训练其AI模型。博德利图书馆是世界上最古老、最负盛名的图书馆系统之一。

该合作于2025年3月4日宣布,并以2月份启动的试点项目拉开序幕,重点是将约3,500篇1498年至1884年间的公有领域学位论文数字化。这些数百年前的文献此前对无法亲自前往牛津的人而言基本无法获取,这意味着全球研究界在很大程度上无法接触这批资料。

合作的具体内容

该协议隶属于OpenAI的NextGenAI计划。该计划已向包括哈佛大学、麻省理工学院和牛津大学在内的一批顶尖院校承诺提供5,000万美元的研究资助、计算资源和API访问权限。

对博德利图书馆而言,其宣称的目标十分明确:AI驱动的元数据增强和改进的转录服务将使这些数百年历史的馆藏可被检索并向全球开放。

在教育方面,牛津大学计划自2025年9月起在全校推广ChatGPT Edu。该工具已在大约750名用户中完成试点。数字化项目的研究成果预计将于2026年初以开放式获取报告的形式发布,这为外界判断该合作是否兑现其承诺提供了具体的检验节点。

员工的担忧

并非所有牛津人都对这一安排感到高兴。大学员工对与OpenAI合作的声誉风险表达了担忧。这家公司在版权问题、数据来源实践以及首席执行官Sam Altman领导下的快速商业化等方面一直面临持续批评。

试点涉及的学位论文属于公有领域,不适用任何版权。尽管如此,一所拥有约900年历史的学术机构将其馆藏输送给一家营利性AI公司的观感,仍引发了外界的审视。

此外还存在双方各自获得什么的问题。牛津大学获得数字化支持、计算资源和教育工具;OpenAI则获得来自全球可信来源的高质量、经筛选的训练数据,以及与牛津合作随之而来的无形背书——鉴于该公司的数据实践仍存在争议,这种背书的价值更加凸显。

更宏观的图景

牛津与OpenAI的协议符合高等教育领域不断加速的一种趋势。科技公司日益将学术机构作为数据来源,部分原因在于网络抓取数据正面临法律挑战,另一部分原因在于学术语料库的质量往往高于普通的互联网文本。

在此背景下,牛津ChatGPT Edu的推广情况和数字化报告的反响,将受到正在权衡类似合作安排的院校的关注。NextGenAI计划分散在多所院校的5,000万美元投入虽然可观,但相对于OpenAI每年以数十亿美元计的整体支出而言仍属有限。