新闻股票Intron 推出 Sahara v2.5,以改进非洲语码转换语音识别

Intron 推出 Sahara v2.5,以改进非洲语码转换语音识别

作者: Techcabal·

要点速览

  • Sahara v2.5 为 12 种非洲语言增加了语码转换支持,包括 Zulu、Hausa、Swahili 和 Luganda。
  • Intron 表示,它推出了其所谓全球首个非洲三语语音识别模型,用于卢旺达的 Kinyarwanda、英语和法语混用场景。
  • 在 Intron 的基准测试中,Sahara v2.5 在 12 种语码转换语言上的平均词错误率为 34.3%,而 Gemini 3.6 为 53.8%。
  • 公司称,其模型目前已在六个非洲国家的 40 多家机构中用于生产和研究部署。
  • Intron 表示,其语音和语音代理产品现已覆盖 31 种语言,并在 API 中加入了流式识别和流式文本转语音。
Intron 推出 Sahara v2.5,以改进非洲语码转换语音识别

大多数非洲人至少会说两种语言,而且经常会在一句话里混用,例如“My loan imekataliwa, but I paid yesterday.” 在许多语音识别系统中,英语会被转写,而斯瓦希里语部分会被忽略,导致依赖该转录内容的公司丢失部分含义。

Intron 是一家专注非洲的语音技术公司,成立于拉各斯,现已发布 Sahara v2.5,这是一组为这一使用场景打造的模型。此次发布增加了语码转换支持——即跟随说话者在同一句中切换语言的能力——覆盖 12 种非洲语言,包括 Zulu、Hausa、Swahili 和 Luganda。

该版本还引入了 Intron 所称的全球首个非洲三语语音识别模型,能够处理在三种语言之间切换的对话。该模型面向卢旺达而设计,在那里,几乎全民使用的国语 Kinyarwanda 与英语和法语在日常职业生活中并存。公司称,已就支撑该系统的算法提交了美国专利申请。

Intron 认为,语码转换是一项独立的技术挑战,而全球实验室往往将其视为次要问题。一个模型可以在英语上表现出色,在斯瓦希里语上也能胜任,但当两者出现在同一句话中时仍可能失效。公司表示,要解决这一问题需要专门的数据、专门的训练和专门的评估,而且专注于窄领域问题的小公司,可能胜过依赖全球平均值的大公司。

在 Intron 自身的基准测试中,Sahara v2.5 在 12 种语码转换的非洲语音上录得平均词错误率 34.3%,而 Google AI 模型 Gemini 3.6 的该指标为 53.8%。从实际意义上看,这意味着 Sahara 大约每三词错一词,而 Gemini 超过每两词错一词。

公司称,Sahara 在其测试的全部 12 种语言上都优于 Gemini、ElevenLabs 和 Meta。即便如此,该系统仍大约每三词错一词,这也说明,语音工具要可靠服务于客户支持、金融、医疗保健及其他日常服务中普遍存在的混合语言对话,仍有很长的路要走。

Intron 由受过尼日利亚医学训练的医生 Tobi Olatunji 和 Kunle Asekun 于 2020 年创立。该公司在 2024 年 7 月由 Microtraction 领投,获得 160 万美元种子前融资,最初是为了解决医院文书工作问题,如今则在开发可在整个非洲大陆使用的语音 AI 产品。

为什么语码转换很难

在这种情况下,语音比文本更难处理,因为书面句子能清楚显示每个词的起止位置。而音频模型只能接收声音。它必须同时识别声音、单词、口音、上下文和语言,却没有任何可见边界显示 Yoruba 何处结束、英语何处开始。切换可能发生在句子之间、句子内部,或某个单词周围。

许多系统的处理方式是先识别语言,再将每个片段路由给单语识别器——一种只用于转写单一语言的模型。该方法在较长、较清晰的片段上可行,但当切换只持续一两个词时往往会失效。Intron 表示,Sahara 是直接在混合语言语音上训练的,因此模型会把切换视为正常现象,学习每种语言对之间可能出现的转换,并借助整段语音的声学证据和上下文来解决它们。

第二个问题从分词开始。在模型处理语音之前,它会将声音拆分为称为 token 的小单位,每个单位都对应它之前见过的某种语言片段。如果非洲语言形式在训练数据中只占很小一部分,模型可匹配的非洲 token 就会很少。于是,它会把陌生的非洲语音强行套入它所知道的最近的英语或法语 token。结果要么是幻觉——说话者从未说过的词——要么是某段语音从转录中完全消失。

训练数据本身也十分稀缺。自然发生的语码转换语音录音很难获得,而人为混合的音频无法反映人们实际如何切换语言。

“Intron 首席执行官 Tobi Olatunji 在接受 TechCabal 采访时表示:‘语码转换是客户在部署真实世界语音 AI 时持续遇到的最大问题之一。非洲需要按非洲人真实说话方式打造的 AI。人们不应该为了机器而翻译自己、压平口音、避免使用本地表达,或者只重复自己说话中的英语部分。’”

谁在使用 Sahara?

Intron 表示,其模型目前已支持六个国家 40 多家机构的生产和研究部署:尼日利亚、肯尼亚、南非、乌干达、卢旺达和加纳。

公司分享的一个商业案例是 Branch International,这是一家金融科技贷款机构。在该部署中,Sahara 驱动的催收代理在一周内追回了超过 ₦1.2 million($891)的逾期贷款,同时还创下了下班后和周末还款的纪录水平。Intron 表示,该系统在逾期超过 356 天的贷款上表现优于人工代理。

Branch Africa 产品负责人 Adanne Anene 在与 TechCabal 共享的一份声明中表示:“即使在下班后和周末,客户也能自然地参与互动。”

Intron 还表示,其文本转语音产品——可将书面文字转换为口语音频——以及语音代理,现已能处理 13 组语言对中的语言混用,并在公司测试中于其中 9 组语言对上优于 ElevenLabs 和 Gemini。该初创公司补充称,其语音识别现已支持 Nupe、Kanuri、Nigerian Fulfulde、Tigrinya、Kikuyu、Dholuo 和 Somali,使总语言覆盖数达到 31 种。

公司还在其应用程序接口(API)中加入了流式语音识别和流式文本转语音,为开发者提供实时字幕和实时应用所需的工具。

Intron 已发布《2026 Africa Voice AI Report》,认为收集非洲语言数据只是可靠语音 AI 面临的一个障碍。报告指出,研究能力、系统整合能力以及部署专业知识同样重要。

报告以环境式医疗记录员为例——即监听医患问诊并自动起草病历记录的软件。这项技术在美国和欧洲被广泛使用,但在非洲诊所中大多并不实用,因为一次问诊可能涉及两到三种语言。

公司表示,真正的规模化需要超越表层集成,转向稳健执行。