汤森路透在基于 Qwen 构建的自研 Thomson-1 上,用其替代部分 Claude 法律 AI 工作
要点速览
- •汤森路透正在将部分文档审查工作从 Claude 转移至自研的 Thomson-1。
- •Thomson-1 基于 Snowdon,而 Snowdon 是通过改造阿里巴巴的开源 Qwen 模型创建的。
- •汤森路透表示,Thomson-1 的目标是降低成本,并将循序渐进使用,而不是完全取代 Anthropic。
- •公司称 Thomson-1 在基准测试中可与 Claude Opus 4.8 竞争,并领先于其他几款主要模型,但独立测试仍在进行。
- •此次转变引发了关于安全、数据治理以及中国开放权重模型在法律场景中是否可被充分审计的担忧。

汤森路透已开始将部分法律 AI 工作负载从 Anthropic 的 Claude 转移至 Thomson-1,这是一款使用中国开源技术构建的自研模型。此举预计将降低成本,同时也引发了在这一仍在演进的行业中,使用中国 AI 系统的安全性与治理问题。
据 Business Insider 报道,Thomson-1 将负责此前由 Claude 承担的文档审查任务。法律专业人士、会计师以及使用 CoCounsel 和类似产品的公司,日常使用中大概率不会看到重大变化。CoCounsel 是汤森路透在 2023 年以 6.5 亿美元收购法律 AI 初创公司 Casetext 后纳入产品组合的。更值得关注的是,这家拥有 Westlaw 法律研究服务、并长期是西方法律实践重要组成部分的公司,正在依赖一款经过内部深度改造的中国模型。
设计上就更便宜的 Claude 替代方案
成本是此次决策的重要因素。汤森路透首席技术官 Joel Hron 告诉 Business Insider,Anthropic 和 OpenAI 等实验室收取的高价促使公司开发自己的模型。通过构建自有系统,汤森路透可以利用自身知识产权,而无需持续支付第三方服务费用。
Hron 表示,Thomson-1 不会完全取代 Anthropic。汤森路透在 5 月扩大了与 Anthropic 的合作,CoCounsel 目前仍在很大程度上依赖 Claude。公司计划循序渐进,仅在有利于自身专业能力的场景下使用 Thomson-1。当前,该系统计划用于“高量、结构化的文档审查”。
“重新对齐” Qwen 到底意味着什么
Thomson-1 基于 Snowdon,而 Snowdon 是通过对阿里巴巴的开源 Qwen 模型进行“重新对齐”而创建的。与通过 Anthropic 以封闭系统方式访问的 Claude 不同,Qwen 的开放权重可以被下载并修改。
汤森路透与帝国理工学院的团队花费数月时间将 Qwen 调整为 Snowdon。Hron 将其描述为“在伦理和政治上去偏并且安全可用”。Cryptopolitan 先前曾报道,西方公司正越来越多地改造外国开放权重模型,以便对其 AI 技术栈拥有更多控制权。Hron 也淡化了对阿里巴巴模型的依赖,称“没有什么东西必然把我们和 Qwen 绑定在一起”。
汤森路透表示,Thomson-1 在更广泛的评测套件中,表现与 Claude Opus 4.8 相当,并领先于 GPT-5.5、Claude Sonnet 5 和 Gemini 3.1 Pro。上述结果由公司披露,独立学术基准测试仍在进行中。其公开分数显示的是较为复杂的结果,而不是全面胜出。
关于使用中国开源模型的担忧
节省成本的同时也带来了政治包袱。Anthropic 指责中国实验室非法“蒸馏”其模型输出,并已敦促华盛顿方面采取限制措施。参议员 Tom Cotton 也对美国公司使用中国开源模型提出了安全担忧。
斯坦福研究人员则看到的是另一个问题。HAI 的 James Landay 认为,可下载的模型权重并不意味着系统可以被完全审计,因为用户仍然无法查看其训练数据,也无法理解每一种行为。他将这种模式称为“开放分发”,而不是开源。这使得客户很难独立验证偏见已被成功移除的说法。
以数月计的差距
公司愿意考虑这种权衡,是因为中国模型已经迅速追赶上来。斯坦福 2026 AI Index 表示,美中性能差距已“实际上关闭”。截至 2026 年 8 月 21 日,Arena 的 Text 排行榜上,排名第一的美国模型得分为 1,508,顶级中国模型为 1,489,差距仅为 1.3%。阿里巴巴的 Qwen3.8-Max 得分为 1,481。当能力只相差几个点,而成本却仍然相距甚远时,文档审查就成为测试更便宜替代方案的自然场景。