新聞宏觀經濟湯森路透以基於 Qwen 的內部 Thomson-1,部分取代 Claude 的法律 AI 工作

湯森路透以基於 Qwen 的內部 Thomson-1,部分取代 Claude 的法律 AI 工作

作者: Cryptopolitan·

重點速覽

  • 湯森路透正將部分文件審閱工作從 Claude 轉移至內部模型 Thomson-1。
  • Thomson-1 建立在 Snowdon 之上,而 Snowdon 來自對阿里巴巴開源 Qwen 模型的調整。
  • 湯森路透表示,Thomson-1 旨在降低成本,且將循序使用,不會完全取代 Anthropic。
  • 公司聲稱 Thomson-1 的表現可與 Claude Opus 4.8 競爭,並領先數個其他主要模型,但獨立測試仍在進行中。
  • 這項轉變引發了對安全性、資料治理,以及中國開放權重模型是否能在法律使用情境中被完全審計的疑慮。
湯森路透以基於 Qwen 的內部 Thomson-1,部分取代 Claude 的法律 AI 工作

湯森路透已開始將部分法律 AI 工作負載,從 Anthropic 的 Claude 轉移至 Thomson-1,這是一套使用中國開源技術打造的內部模型。此一變動預期可降低成本,但同時也引發外界對於在仍持續演變的產業中使用中國 AI 系統,其安全性與治理方式的疑問。

根據 Business Insider 報導,Thomson-1 預計將負責先前由 Claude 執行的文件審閱工作。法律從業者、會計師,以及使用 CoCounsel 和類似產品的公司,日常使用上大致不會看到重大變化。CoCounsel 是湯森路透在 2023 年以 6.5 億美元收購法律 AI 新創 Casetext 後納入產品組合。更值得注意的是,這家擁有 Westlaw 法律研究服務、也是西方法律實務常用工具的公司,正在依賴一個經過大幅內部調整的中國模型。

設計上就比 Claude 更便宜

成本是這項決策的主要因素。湯森路透 CTO Joel Hron 告訴 Business Insider,Anthropic 和 OpenAI 等實驗室收取的高價格,促使公司考慮自行開發模型。透過建立自己的系統,湯森路透可以運用自身的智慧財產權,而不必持續支付第三方服務費用。

Hron 表示,Thomson-1 不會完全取代 Anthropic。湯森路透已在 5 月擴大與 Anthropic 的合作,而 CoCounsel 仍高度依賴 Claude。相對地,公司計畫循序漸進,僅在有利於自身專業能力的情況下才使用 Thomson-1。就目前而言,這套系統將用於「高量、結構化文件審閱」。

「重新對齊」Qwen 的真正意義

Thomson-1 是建立在 Snowdon 之上,而 Snowdon 是透過對阿里巴巴的開源 Qwen 模型進行「重新對齊」而來。與透過 Anthropic 以封閉系統方式存取的 Claude 不同,Qwen 的開放權重可被下載並修改;一旦下載,也可在企業自有基礎架構上運行,因此正在審閱的文件不必經過外部供應商的 API。

一支由 Thomson Reuters 與 Imperial College London 組成的團隊花了數月時間,將 Qwen 調整為 Snowdon。Hron 將其描述為「在倫理與政治上去偏見,且可安全使用」。Cryptopolitan 先前曾報導,西方公司正愈來愈多地調整外國開放權重模型,以便對自身 AI 堆疊擁有更多控制權。Hron 也淡化了對阿里巴巴模型的依賴,表示「沒有任何東西必然把我們綁定在 Qwen 上」。

湯森路透表示,Thomson-1 在更廣泛的評測套件中,與 Claude Opus 4.8 具競爭力,並領先 GPT-5.5、Claude Sonnet 5 和 Gemini 3.1 Pro。不過,這些結果仍由公司自行公布,獨立學術基準測試仍在進行中。已公布的分數顯示,結果並非全面勝出,而是呈現較為混合的情況。

使用中國開源模型的疑慮

成本節省伴隨著政治與安全層面的包袱。Anthropic 曾指控中國實驗室非法「蒸餾」其模型輸出,並敦促華盛頓採取限制措施。參議員 Tom Cotton 也曾對美國公司使用中國開源模型提出安全疑慮。

史丹佛研究人員則看到另一種問題。HAI 的 James Landay 主張,可下載的模型權重並不代表系統可以被完全稽核,因為使用者仍無法看到訓練資料,也無法理解所有行為。他將這稱為「開放分發」,而不是開源。這使得客戶難以獨立驗證偏見已被移除的說法。

以數月計算的差距

各家公司願意考慮這種取捨,是因為中國模型近年快速追趕。史丹佛的 2026 AI Index 指出,美中性能差距已「實際上消失」。截至 2026 年 8 月 21 日,Arena 的 Text 排行榜上,領先的美國模型得分為 1,508,頂尖中國模型為 1,489,差距僅 1.3%。阿里巴巴的 Qwen3.8-Max 得分為 1,481。

當能力只差幾分、成本卻相差甚遠時,文件審閱就成了較便宜替代方案的自然試驗場。

不要只看加密新聞,還要看懂它。訂閱我們的電子報,完全免費。