НовостиМакроTalksign запускает маркетплейс данных жестового языка для создания ИИ-инфраструктуры для глухих сообществ

Talksign запускает маркетплейс данных жестового языка для создания ИИ-инфраструктуры для глухих сообществ

Автор: TechNext24·

Ключевые выводы

  • Talksign запустила Talksign Marketplace — работающую платформу для внесения, аннотирования, лицензирования и доступа к качественным наборам данных жестового языка.
  • По данным ВОЗ, на которые ссылается статья, более 430 million людей во всём мире сталкиваются с нарушением слуха, а к 2050 году этот показатель, по прогнозу, превысит 700 million; эти группы используют от 200 до 300 задокументированных жестовых языков.
  • Участники маркетплейса получают прямое финансовое вознаграждение за видеоданные, а оплачиваемая аннотация направляется носителям жестового языка, а не неносителям.
  • Поскольку данные жестового языка по своей природе биометрические и строго регулируются, Talksign представила открытый портал верификации, который связывает каждый набор данных с его источником и условиями лицензирования, обеспечивая проверяемое согласие и права на изображение.
  • Talksign приводит свои проприетарные модели как подтверждение концепции: Palm 1.0, как сообщается, достигает 84.2% семантической точности при задержке примерно 29 milliseconds, а Echo 1.0 — 0.927 Structural Similarity Index при 30 frames per second.
Talksign запускает маркетплейс данных жестового языка для создания ИИ-инфраструктуры для глухих сообществ

Talksign запустила Talksign Marketplace — платформу, где глухие сообщества, исследователи, учреждения и компании могут вносить, аннотировать, лицензировать и получать доступ к качественным наборам данных жестового языка. Компания рассматривает новую платформу как базовый инфраструктурный слой, необходимый для создания искусственного интеллекта, который действительно работает для глухих людей.

Запуск призван устранить давний пробел в развитии ИИ. Современный искусственный интеллект может писать сложный код, генерировать фотореалистичное видео и переводить устную речь за миллисекунды, однако он принципиально не справляется с пониманием естественной коммуникации сотен миллионов людей. Проблема не в вычислительной мощности и не в сложности алгоритмов, а в острой нехватке структурированных данных, подлежащих лицензированию.

В то время как ведущие речевые модели обучаются на десятилетиях собранного из открытого веба аудио, инфраструктура для мультимодальных данных жестового языка практически отсутствовала. Большинство общедоступных корпусов жестового языка невелики, записаны в стерильных студийных условиях и ограничены небольшим числом носителей. Когда разработчики пытаются использовать такие узкие наборы данных в моделях машинного обучения, продукты неизбежно не работают в реальных условиях, сталкиваясь с региональными диалектами, естественными ритмами жестовой речи и сложной мимической грамматикой, необходимой для передачи интонации или вопроса.

Эдидионг Эконг, основатель и CEO Talksign, в эксклюзивном заявлении для Technext сказал: «Сегодня мы запускаем Talksign Marketplace — место, где глухие сообщества, исследователи, учреждения и компании могут вносить, аннотировать, лицензировать и получать доступ к высококачественным наборам данных жестового языка. Это недостающий инфраструктурный слой под каждой серьёзной попыткой создать ИИ, который работает для глухих людей, и именно его нам пришлось построить самим, чтобы построить всё остальное».

«Для глобальной технологической индустрии и особенно для африканской экосистемы искусственного интеллекта этот запуск означает нечто большее, чем просто инструмент доступности. Это коммерческая и этическая основа того, как мы решаем проблему языков с ограниченными ресурсами в ИИ», — добавил он.

Масштаб проблемы

По данным Всемирной организации здравоохранения, более 430 million людей во всём мире сталкиваются с нарушением слуха, приводящим к инвалидности, — по прогнозу ВОЗ, к 2050 году этот показатель превысит 700 million, — и эти группы населения используют от 200 до 300 задокументированных жестовых языков. Несмотря на такой масштаб, жестовые языки полностью отсутствуют в нынешнем бума машинного обучения.

Жестовые языки — это полноценные естественные языки со своей уникальной морфологией и синтаксисом, выражаемые одновременно через руки, лицо, верхнюю часть тела и пространственную среду. Они также взаимно непонятны — American Sign Language и British Sign Language принципиально различаются, несмотря на то, что в обеих странах используется устный английский, — поэтому не существует единого универсального «жестового языка», который модель могла бы освоить. Создание ИИ, понимающего их, требует решения действительно сложной мультимодальной вычислительной задачи, где модели должны в реальном времени анализировать несколько визуальных каналов.

Данные, необходимые для обучения таких моделей, существуют, но они глубоко разобщены. Часть из них хранится в университетских архивах без коммерческих путей лицензирования, а часть остаётся в руках независимых организаций глухих, которым никогда не предлагали финансового стимула делиться ими.

Как работает маркетплейс

Маркетплейс Talksign работает по четырём ключевым направлениям, призванным коммерциализировать и стандартизировать данные жестового языка:

Contribute: независимые носители жестового языка и организации глухих могут отправлять видеозаписи и получать прямое финансовое вознаграждение.

Annotate: необработанное видео проходит глубокую обработку и превращается в обучающие данные через разметку gloss, извлечение поз и лингвистическую аннотацию. Talksign направляет эту оплачиваемую работу непосредственно носителям жестового языка, а не передаёт её на аутсорсинг неносителям.

Licence: покупатели получают машиночитаемые условия лицензирования и прозрачные записи о происхождении данных, что решает серьёзную проблему соответствия требованиям для корпоративных разработчиков ИИ.

Access: стартапы и исследователи могут оценивать и приобретать разнообразные наборы данных с различными диалектами и условиями записи из единого центра.

План для африканского ИИ

Для разработчиков и основателей в Африке проблема, которую решает Talksign, покажется до боли знакомой. На континенте существуют тысячи устных и жестовых языков, включая Nigerian Sign Language (NSL), которые страдают от той же нехватки данных, что и выводит их за рамки глобальной экономики ИИ. По оценке World Federation of the Deaf, более 80 percent из примерно 70 million глухих людей в мире живут в развивающихся странах, и это придаёт регионам вроде Африки особый вес в любой работе по созданию репрезентативных данных жестовой речи.

Африканские технологи, создающие инструменты обработки естественного языка для таких языков, как Hausa, Yoruba или Swahili, постоянно упираются в нехватку данных. Подход Talksign предлагает убедительный пример того, как местные основатели могут этично агрегировать и монетизировать данные языков с ограниченными ресурсами. Создавая прозрачный маркетплейс, который платит носителям языков и жестового языка за их вклад, разработчики могут обойти медленные академические схемы сбора данных, зависящие от грантов, и создавать надёжные, коммерчески пригодные корпуса.

Согласие, верификация и биометрические данные

Исторические отношения между технологической индустрией и маргинализированными сообществами в значительной степени были извлекающими: данные собираются, модели обучаются, а сообщества, производящие исходный материал, ничего не получают.

Данные жестового языка создают дополнительную проблему. Поскольку они по своей природе биометрические и фиксируют лицо и тело человека, их нельзя анонимизировать так же, как текст. Кроме того, они относятся к наиболее жёстко регулируемой категории персональных данных: например, GDPR ЕС относит биометрические данные, обрабатываемые для идентификации человека, к «особой категории», требующей явного согласия, а EU AI Act вводит дополнительные правила для биометрических систем. Для прямого решения этой проблемы Talksign представила открытый портал верификации. Система связывает каждый набор данных с его источником и условиями лицензирования, обеспечивая проверяемое согласие и права на изображение. Покупатели могут проверить уровень владения жестовым языком у подписантов и точность аннотаций до интеграции данных в свои пайплайны.

Подтверждение концепции

Talksign утверждает, что эта инфраструктура возникла из собственных внутренних трудностей разработки, и ссылается на свои проприетарные модели как на подтверждение концепции. По сообщениям компании, Palm 1.0 — модель speech-to-sign — достигает 84.2% семантической точности при задержке примерно 29 milliseconds. Её аналог sign-to-speech, Echo 1.0, как сообщается, показывает 0.927 Structural Similarity Index при 30 frames per second.

За пределами субтитров

По мнению Talksign, субтитры — слабая замена настоящей доступности, поскольку они полностью однонаправленны. Чтобы дать глухим пользователям возможность общаться с технологиями на родном для них языке, необходимо рассматривать жестовый язык как основной формат языка. Придавая этим данным реальную коммерческую ценность и компенсируя сообщества, которые их создают, компания закладывает основу для более справедливой ИИ-инфраструктуры.

Именно такого структурного мышления, по мнению компании, сейчас отчаянно не хватает всей технологической экосистеме.

Также читайте: TalkSign: Эдидионг Экong просто хотел общаться с друзьями; теперь он использует ИИ, чтобы преодолеть тишину Маркетплейс уже работает. Если у вас есть данные жестового языка и вы хотите разместить их, если вы носитель жестового языка или организация, заинтересованные во внесении данных или аннотировании, либо если вы создаёте продукт, которому нужны лицензированные мультимодальные данные жестового языка, Talksign приглашает связаться с ними. Вы можете зарегистрироваться здесь: или написать напрямую на sales@talksign.co .