新聞宏觀經濟Talksign 推出手語資料市集,為聾人社群打造 AI 基礎設施

Talksign 推出手語資料市集,為聾人社群打造 AI 基礎設施

作者: TechNext24·

重點速覽

  • Talksign 已推出 Talksign Marketplace,這是一個現已上線的平台,讓聾人社群、研究人員、機構與企業能夠貢獻、標註、授權並存取高品質手語資料集。
  • 文中引述 WHO 資料指出,全球超過 4.3 億人正經歷致殘性聽力損失,且預計到 2050 年將超過 7 億;這些族群依賴 200 到 300 種有文獻記載的手語。
  • 貢獻者會因錄製影片資料獲得直接金錢補償,而有酬標註工作則由流利的手語者負責,而非非母語工作者。
  • 由於手語資料本質上屬於生物特徵資料且受嚴格規範,Talksign 推出開放驗證入口網站,將每個資料集連回其來源與授權條款,以確保同意與肖像權可稽核。
  • Talksign 以自家專有模型作為概念驗證:Palm 1.0 據稱可在約 29 毫秒延遲下達到 84.2% 的語意準確率,而 Echo 1.0 據稱可在每秒 30 幀下達到 0.927 Structural Similarity Index。
Talksign 推出手語資料市集,為聾人社群打造 AI 基礎設施

Talksign 已推出 Talksign Marketplace,這是一個讓聾人社群、研究人員、機構與企業能夠貢獻、標註、授權並存取高品質手語資料集的平台。該公司將這個新平台定位為建立真正能為聾人服務的人工智慧所必需的基礎設施層。

這項推出旨在填補 AI 發展中的長期缺口。現代人工智慧可以撰寫複雜程式碼、生成寫實影片,並在毫秒內翻譯口語,但在理解數以億計人們的自然溝通方面卻根本失靈。障礙不在於運算能力或演算法複雜度,而在於結構化、可授權資料的嚴重匱乏。

領先的語音模型以數十年來從開放網路抓取的音訊訓練,而多模態手語資料的基礎設施幾乎不存在。大多數公開可得的手語語料都很小、在無菌式的工作室環境錄製,且只涵蓋少數手語者。當開發者將這些狹窄資料集硬塞進機器學習模型時,產品在真實世界中往往會失敗,無法處理地區方言、原生手語節奏,以及傳達語氣強弱或提出疑問所需的複雜臉部語法。

Talksign 創辦人兼執行長 Edidiong Ekong 在接受 Technext 獨家聲明時表示:「今天我們推出 Talksign Marketplace,這是一個讓聾人社群、研究人員、機構與公司能夠貢獻、標註、授權並存取高品質手語資料集的地方。它是每一項認真嘗試打造真正為聾人服務的 AI 之下缺失的基礎設施層,也是我們必須親手建立、才能繼續打造其他一切的那一塊。」

「對全球科技產業,尤其是非洲人工智慧生態系而言,這次推出不只是無障礙工具而已。它是一個商業與倫理框架,說明我們如何解決 AI 中的低資源語言問題,」他補充道。

落差規模

根據世界衛生組織資料,全球超過 4.3 億人正經歷致殘性聽力損失;WHO 預測到 2050 年這個數字將超過 7 億。這些族群仰賴 200 到 300 種有文獻記載的手語。儘管規模龐大,手語在當前的機器學習熱潮中卻完全未被代表。

手語是完整的自然語言,具有獨特的形態學與句法,並透過手部、臉部、上半身與空間環境同時表達。理解手語的 AI 必須解決一個真正困難的多模態運算問題,模型需要即時跨越多個視覺通道進行推理。

訓練這類模型所需的資料確實存在,但高度分散。它要麼被鎖在大學檔案庫中,沒有商業授權途徑;要麼仍掌握在獨立聾人組織手中,而這些組織從未被提供分享資料的財務誘因。

市集如何運作

Talksign 的市集透過四大核心支柱運作,旨在將手語資料商業化並標準化:

貢獻: 獨立手語者與聾人組織可提交錄製影片資料,並獲得直接的金錢補償。

標註: 原始影片會經由 gloss 標註、姿態擷取與語言標記等程序,重度處理成訓練資料。Talksign 將這些有酬工作直接交給流利的手語者,而不是外包給非母語工作者。

授權: 買方可取得機器可讀的授權條款與清楚的來源紀錄,解決企業 AI 建置者面臨的重大合規難題。

存取: 新創與研究人員可透過單一入口,評估並取得跨多種方言與錄製環境的多樣化資料集。

非洲 AI 的藍圖

對非洲的開發者與創業者而言,Talksign 正在解決的底層問題會顯得非常熟悉。非洲大陸擁有數千種口語與手語,包括 Nigerian Sign Language (NSL),它們同樣面臨資料稀缺,因而被排除在全球 AI 經濟之外。世界聾人聯盟估計,全球約 7000 萬名聾人中有超過 80% 生活在發展中國家,這也使非洲等地區在建立具代表性的手語資料方面具有舉足輕重的地位。

為 Hausa、Yoruba 或 Swahili 等語言開發自然語言處理工具的非洲技術人員,經常會遇到資料瓶頸。Talksign 的框架為本地創業者如何以倫理方式彙整並變現低資源語言資料提供了一個具說服力的藍圖。透過建立一個向母語者與手語者支付報酬的透明市集,開發者可以繞過緩慢且依賴補助金的學術資料蒐集途徑,建立穩健、可商用等級的語料庫。

同意、驗證與生物特徵資料

科技產業與邊緣化社群之間的歷史關係,多半帶有掠奪性:資料被抓取、模型被訓練,而生成原料的社群卻得不到任何回報。

手語資料還帶來另一層挑戰。由於它本質上屬於生物特徵資料,會捕捉一個人的臉部與身體,因此無法像文字一樣匿名化。它也落在個人資料中管制最嚴格的層級:例如 EU 的 GDPR 將用於識別個人的生物特徵資料歸類為需要明確同意的「特殊類別」,而 EU AI Act 也為生物特徵系統增加了更多規範。Talksign 已推出一個open verification portal 直接處理此問題。該系統將每個資料集都連回其來源與授權條款,確保同意與肖像權可供稽核。買方在將資料整合進其管線前,可先驗證手語者的流利程度與標註的準確性。

概念驗證

Talksign 表示,這套基礎設施源於公司自身在內部開發上的困難,並將其專有模型作為概念驗證。Palm 1.0 是一款語音轉手語模型,據稱可在約 29 毫秒延遲下達到 84.2% 的語意準確率。其手語轉語音對應模型 Echo 1.0,據稱在每秒 30 幀下達到 0.927 Structural Similarity Index。

不只是字幕

Talksign 認為,字幕只是無障礙的次佳替代品,因為它完全是單向的。要讓聾人使用者以原生方式與科技溝通,必須將手語視為主要語言格式。透過讓手語資料具有真實商業價值,並補償產生這些資料的社群,Talksign 正在為更公平的 AI 基礎設施奠定基礎。

這正是更廣泛科技生態系迫切需要採納的結構性思維。

另請閱讀:TalkSign: Edidiong Ekong just wanted to talk to friends; now he is using AI to bridge the silence The Marketplace 現已上線。若你擁有手語資料並希望上架,若你是有意貢獻或標註的手語者或組織,或若你正在打造需要授權多模態手語資料的產品,Talksign 希望收到你的聯繫。你可以在 註冊,或直接寄信至 sales@talksign.co