НовостиАкцииГонконгская Votee AI создаёт кантонскую модель, чтобы бросить вызов доминированию английского языка и путунхуа

Гонконгская Votee AI создаёт кантонскую модель, чтобы бросить вызов доминированию английского языка и путунхуа

Автор: Fortune Crypto·

Ключевые выводы

  • Ведущие модели ИИ остаются сильнее всего в английском и путунхуа, из-за чего многие другие языки получают более слабую поддержку.
  • Votee AI дообучает модели с открытыми весами на кантонских данных и продаёт их банкам, университетам и государственным ведомствам.
  • Кантонский значительно отличается от путунхуа грамматикой и словарным запасом, и основные модели часто испытывают трудности с местными и культурными знаниями.
  • По данным Votee, корпус кантонских данных вырос со 100 млн токенов до более чем 500 млн токенов.
  • Компания заявляет, что она прибыльна за счёт контрактов с клиентами, ведёт активные переговоры с AI Singapore и планирует более широкую экспансию в Юго-Восточную Азию.
Гонконгская Votee AI создаёт кантонскую модель, чтобы бросить вызов доминированию английского языка и путунхуа

Бум ИИ движут два языка: английский и китайский путунхуа. Ведущие разработчики ИИ — OpenAI, Anthropic, DeepSeek, Moonshot AI, Z.ai и другие — почти все базируются либо в США, либо в материковом Китае, и в результате их модели лучше всего работают на их родных языках. Из-за этого бесчисленные другие языки и диалекты, даже те, на которых говорят десятки миллионов человек, остаются не у дел.

«Вся ИИ-революция происходит на английском и путунхуа, — говорит Пак-Сун Тин (Pak-Sun Ting), генеральный директор гонконгского стартапа Votee AI, который стремится создавать модели ИИ для кантонского и других обделённых вниманием языков. — Лишь очень малая доля приходится на остальные языки».

Votee — одна из растущего числа компаний, пытающихся решить проблему игнорирования ИИ других языков. Она берёт модели с открытыми весами у таких разработчиков, как Meta и Alibaba, дообучает их на кантонских данных и продаёт результат банкам, университетам и государственным ведомствам. На практике это важно, потому что пользователи, которым чаще всего нужна поддержка кантонского, обычно работают в сферах, связанных с обслуживанием населения, где точная обработка местного языка влияет на повседневные операции, а не только на неформальное общение.

«Это вопрос не только культуры. Кантонский используется в образовании, здравоохранении и полицейской связи, — говорит Тин. — Если эти сферы не охвачены, то ИИ по сути бесполезен».

Чем отличается кантонский

Кантонский часто называют «диалектом» китайского, но такое определение преуменьшает то, насколько он отличается от путунхуа — наиболее распространённой разновидности китайского языка. Кантонский использует иную грамматику, чем путунхуа, а также другой словарный запас — особенно в Гонконге, где говорящие часто переключаются между английскими и кантонскими словами, порой в одном и том же предложении.

На кантонском говорят более 80 млн человек — примерно столько же, сколько на корейском, и больше, чем на итальянском или тайском. Однако столь большая база носителей не породила сопоставимо глубокого массива стандартизированных письменных данных, особенно для разговорного кантонского, что отчасти объясняет, почему модели общего назначения могут выглядеть компетентными на базовых запросах, но при этом упускать нюансы, необходимые для местного использования.

Ведущие модели не полностью беспомощны в работе с кантонским. Набор бенчмарков HKCanto-Eval, разработанный исследователями Университета Кюсю, Педагогического университета Гонконга и местного ИИ-сообщества hon9kon9ize при спонсорской поддержке Votee, показывает, что, хотя основные модели способны на разумном уровне справляться с повседневным кантонским, они регулярно ошибаются, когда дело касается культурных и местных знаний.

Обучение с минимальными затратами

По словам Тина, создание кантонской LLM — это «по сути те же шаги, как если бы вы обучали модель с нуля»: берётся существующая модель с открытым исходным кодом, например Llama от Meta или Qwen от Alibaba, и проводится дополнительное обучение на кантонских данных.

Votee получает кантонские данные путём онлайн-скрейпинга, включая контент Radio Television Hong Kong (RTHK) — общественную телерадиовещательную службу города. Стартап также получает данные от сообщества и университетов, использует контент из своего прежнего бизнеса в сфере больших данных и применяет синтетические данные, создавая собственные кантонские наборы данных для обучения модели.

В совокупности эти усилия увеличили корпус кантонских данных со 100 млн токенов до более чем 500 млн.

Модели Votee AI имеют размер около 70 млрд параметров — это значительно меньше, чем у лучших моделей на рынке. Тем не менее, по словам Тина, они достаточно способны, чтобы понимать кантонский и рассуждать на нём. Что важнее, затраты Votee на обучение, хотя и не тривиальные, остаются значительно ниже, чем у лабораторий, разрабатывающих передовые модели. Тин оценивает, что компания использует от 500 млн до 1 млрд токенов для обучения своих моделей — против триллионов, используемых для англоязычных моделей, — при стоимости около 250 000 долларов США.

Суверенный ИИ

Ряд компаний работают над моделями для так называемых «языков с низкими ресурсами» — тех, за которыми не стоит огромный корпус опубликованных материалов. Indosat, второй по величине телекоммуникационный оператор Индонезии, создаёт Sahabat AI — большую языковую модель с открытым исходным кодом, ориентированную на индонезийские языки, такие как бахаса. Государственная организация Сингапура AI Singapore ведёт SEA-LION, охватывающий 11 недостаточно обеспеченных ресурсами языков Юго-Восточной Азии. Южная Корея пошла дальше, организовав спонсируемый государством турнир на выбывание — местные СМИ окрестили его «ИИ-игрой в кальмара», — чтобы выбрать национальных чемпионов в области собственных базовых моделей, при поддержке бюджета на ИИ на 2026 год в размере примерно 6,8 млрд долларов.

Всё это происходит под знаменем «суверенного ИИ» — идеи, что правительства и компании захотят владеть собственными данными, моделями и инфраструктурой, а не арендовать их из-за рубежа.

«ИИ стал настолько насущной потребностью, что вы не хотите быть привязанными к кому-то, кто может его отключить, — говорит Тин. — Он откровенно признаёт, что полная версия идеи суверенного ИИ, при которой страны владеют каждой частью цепочки поставок ИИ, — это «очень сложно». Вместо этого он предлагает странам сосредоточиться на владении базовыми моделями и приложениями, построенными на их основе.

Правительствам, как правило, не нужна модель такой же мощной, как существующие на переднем крае технологий, для автоматизации нескольких задач; Тин объясняет, что для этих целей может подойти крошечная модель, даже с 1 млрд параметров. Если правительствам нужны более продвинутые возможности, они могут пропускать результаты мощной англо- или китайскоязычной модели через меньшую модель, выдающую результат на местном языке.

Тин отмечает, что компания работает с моделями MiniMax и SenseTime и может использовать чипы Nvidia в своей деятельности. «Мы можем использовать чипы Nvidia, мы можем использовать модель Moonshot или DeepSeek, — говорит он. — Мы как тот человек в школе, который дружит со всеми».

Несмотря на все разговоры Тина о сохранении языков, Votee — коммерческая компания. Правительства и корпорации — первые клиенты для модели ИИ на таком языке, как кантонский или бахаса. Тин говорит, что Votee прибыльна «в том смысле, что наши доходы превышают наши расходы», а финансирование осуществляется в основном за счёт контрактов с клиентами. Стартап также может похвастаться таким советником, как Аллан Земан — гонконгский магнат, благодаря которому вырос развлекательный район Ланьквайфон.

Амбиции Votee не ограничиваются одним Гонконгом. Тин говорит, что стартап ведёт «активные переговоры» с AI Singapore, национальной исследовательской инициативой Сингапура в области ИИ, и планирует дальнейшую экспансию в Юго-Восточную Азию. Помимо этого, Тин хочет изучить возможность использования ИИ для защиты исчезающих языков в таких регионах, как Восточная Азия, Северная Америка и Африка.

Тин называет то, что англоязычный ИИ делает с другими языками, «моментом печатной машинки» — настолько большим приростом производительности, что люди отказываются от своего языка ради него. «Люди переходят на английский просто потому, что производительность печатной машинки настолько велика по сравнению с их собственным языком», — говорит он.

Изменит ли это кантонская модель на 70 млрд параметров — покажет время. Но Тин говорит, что им по-прежнему движет стремление дать другим языкам шанс на борьбу в мире, где доминирует ИИ на английском и китайском путунхуа.

«С каждым исчезающим языком вы теряете ещё один способ видеть мир, — говорит он. — Он может просто сохраниться в музее, где его можно как-то увидеть. Но мы также можем открыть много новой мудрости».

Пак-Сун Тин выступит на Fortune Leaders Forum, который пройдёт в Макао 8 сентября.

Этот материал был впервые опубликован на Fortune.