新聞股票Intron 推出新的語音模型,可追蹤在句中切換語言的非洲使用者

Intron 推出新的語音模型,可追蹤在句中切換語言的非洲使用者

作者: Techcabal·

重點速覽

  • Sahara v2.5 新增涵蓋 12 種非洲語言的 code-switching 支援,包括 Zulu、Hausa、Swahili 與 Luganda。
  • Intron 表示,已推出其所稱的全球首個非洲三語語音辨識模型,適用於盧安達的 Kinyarwanda、English 與 French 混用情境。
  • 根據 Intron 的基準測試,Sahara v2.5 在 12 種 code-switched 語言上的平均字錯率為 34.3%,低於 Gemini 3.6 的 53.8%。
  • 公司表示,其模型目前已在六個非洲國家的 40 多家機構投入 production 與 research 部署。
  • Intron 表示,其語音與 voice 產品現已覆蓋 31 種語言,並在 API 中加入 streaming recognition 與 streaming text-to-speech。
Intron 推出新的語音模型,可追蹤在句中切換語言的非洲使用者

多數非洲人至少會說兩種語言,而且常在同一句話中混用,例如「My loan imekataliwa, but I paid yesterday.」。在許多語音辨識系統中,英文會被轉寫出來,而 Swahili 則被忽略,讓依賴該逐字稿的公司失去一半語意。

Intron 是一家專注非洲市場、總部位於拉各斯的語音技術公司,近日推出 Sahara v2.5,一組為上述情境打造的模型。這次發布新增 code-switching 支援——也就是在同一句話中追蹤說話者跨語言切換的能力——涵蓋 12 種非洲語言,包括 Zulu、Hausa、Swahili 與 Luganda。

這次發布也包含 Intron 所稱的全球首個非洲三語語音辨識模型,可處理在三種語言之間切換的對話。該模型是為盧安達打造,當地幾乎全民都使用的國語 Kinyarwanda,與 English 及 French 在日常專業生活中並存。公司表示,已就其背後的演算法申請美國專利。

Intron 認為,code-switching 是一個獨立的技術問題,但全球實驗室往往把它視為小問題。一個模型可能在 English 表現出色、對 Swahili 也具備能力,但當兩者出現在同一口語片段中時仍會失效。Intron 認為,要解決這個問題需要專門的資料、專門的訓練與專門的評估,而聚焦窄問題的小公司可以在全球平均化的大公司面前勝出。

根據 Intron 自身的基準測試,Sahara v2.5 在 12 種 code-switched 非洲語音中錄得平均字錯率 34.3%,而 Google AI 模型 Gemini 3.6 為 53.8%。實際上,這代表 Sahara 大約每 3 個字錯 1 個,而 Gemini 則是超過每 2 個字錯 1 個。

公司表示,Sahara 在其測試的 12 種語言中都優於 Gemini、ElevenLabs 與 Meta。不過,這仍意味著大約每 3 個字就有 1 個出錯。

Intron 由受過 Nigerian 培訓的醫生 Tobi Olatunji 與 Kunle Asekun 於 2020 年創立,並在 2024 年 7 月由 Microtraction 領投完成 160 萬美元 pre-seed 融資,當時目標是解決醫院的文書問題;如今則正試圖讓語音 AI 能在整個非洲大陸運作。

為什麼 code-switching 很難

在這裡,語音比文字更難處理,因為閱讀文字句子時,模型能看見每個字從哪裡開始、在哪裡結束;而聽音訊的模型只能接收聲音。它必須同時判斷聲音、單字、口音、語境,以及正在聽的是哪種語言——而且沒有任何可見標記顯示 Yoruba 何時結束、English 何時開始。切換可能發生在句與句之間、句子內部,或只圍繞一個字。

其他系統通常先辨識語言,再把每個片段導向單語辨識器——也就是只訓練來轉寫單一語言的模型。這種方法在長而清晰的片段上表現尚可,但當切換只持續一兩個字時就容易失效。Intron 表示,它直接以混合語言語音訓練 Sahara,讓模型把切換視為正常現象,學習每種語言對之間可能出現的轉換,並透過整段語音中的聲學證據與語境來解決問題。

第二個問題從 tokenisation 開始。模型在處理語音前,會把聲音切分成稱為 tokens 的小單位,每個 token 都對應它過去見過的語言片段。如果非洲語言形式只占訓練資料的一小部分,模型能對照的非洲 tokens 就很少。於是它會把不熟悉的非洲語音硬套到最接近的 English 或 French token。結果可能是 hallucination——說話者根本沒說過的字——或是一段語音在逐字稿中整段消失。

訓練資料本身也相當稀缺。自然產生的 code-switched 語音錄音很難取得,而人工混合的音訊無法反映人們實際的切換方式。

「Code-switching 是客戶在部署真實世界語音 AI 時最常反映的重大問題之一,」Intron 執行長 Tobi Olatunji 在接受 TechCabal 訪問時表示。「非洲需要符合非洲人真實說話方式的 AI。人們不應該為了機器而翻譯自己、壓平口音、避免使用地方用語,或只重複自己說話中的英文部分。」

誰在使用 Sahara?

Intron 表示,其模型目前已在六個國家、超過 40 家機構支援 production 與 research 部署,這些國家包括 Nigeria、Kenya、South Africa、Uganda、Rwanda 與 Ghana。

公司分享的一個商業案例是 fintech 放貸機構 Branch International。在該部署中,由 Sahara 驅動的催收代理在一週內追回超過 ₦1.2 million($891)的逾期貸款,並在下班後與週末回款方面創下公司所稱的紀錄;Intron 也表示,系統在逾期超過 356 天的貸款上表現優於人工代理。

Branch Africa 產品主管 Adanne Anene 在與 TechCabal 共享的聲明中表示:「Customers engaged naturally even after hours and on weekends.」

Intron 也表示,其 text-to-speech 產品——可將文字轉為口語音訊——以及 voice agents,現在可處理 13 組語言配對中的語言混用,並在公司測試中於其中 9 組配對上優於 ElevenLabs 與 Gemini。這家新創還表示,其語音辨識現已支援 Nupe、Kanuri、Nigerian Fulfulde、Tigrinya、Kikuyu、Dholuo 與 Somali,使總語言覆蓋數達到 31 種。

公司也已將 streaming speech recognition 與 streaming text-to-speech 加入其 application programming interface(API)——也就是開發者將 Intron 模型接入自家產品的連結介面——以支援即時字幕與即時應用。

Intron 另外發布了 2026 Africa Voice AI Report,指出蒐集非洲語言資料只是可靠語音 AI 面臨的其中一項障礙。研究能力、系統整合能力與部署專業,同樣重要。

其中一個例子是 ambient medical scribe——一種聆聽醫病問診並自動撰寫病歷紀錄的軟體。這項技術在美國與歐洲被廣泛使用,但在非洲診所中多半難以實行,因為單次問診可能涉及兩到三種語言。

真正的規模化,要求從表層整合走向穩健執行。We’ve filtered the noise out of Moonshot 2026, optimizing the conference strictly for high-calibre connections between startup founders, global financial operators, enterprise leaders, and individuals rewiring Africa’s technical frameworks. Get 20% off Early Bird tickets for a limited time .