НовостиМакроThinking Machines Lab Миры Мурати выпустила Inkling — открытую ИИ-модель с 975 млрд параметров

Thinking Machines Lab Миры Мурати выпустила Inkling — открытую ИИ-модель с 975 млрд параметров

Автор: Decrypt·

Ключевые выводы

  • Inkling — модель mixture-of-experts с 975 млрд параметров, 41 млрд активных параметров при инференсе и контекстным окном на 1 миллион токенов.
  • Модель доступна на OpenRouter по цене $1 за миллион входных токенов и $4.05 за миллион выходных токенов.
  • Decrypt сообщил, что Inkling набрала 74.1% в MCP Atlas и 77.6% в SWE-Bench Verified, опередив Nvidia Nemotron в этих тестах.
  • В практическом тесте программирования Decrypt меньшая модель Bonsai 27B, работающая на iPhone, дала более полный результат, чем Inkling.
  • Обзор пришел к выводу, что Inkling лучше всего подходит организациям с требованиями комплаенса, которым нужна модифицируемая западная open-source модель, тогда как небольшим разработчикам могут быть эффективнее более дешевые альтернативы.
Thinking Machines Lab Миры Мурати выпустила Inkling — открытую ИИ-модель с 975 млрд параметров

Thinking Machines Lab выпустила Inkling 15 июля, представив открытую модель с 975 млрд параметров, полностью обученную с нуля. Это первая крупная модель лаборатории Миры Мурати с тех пор, как она покинула OpenAI в сентябре 2024 года.

Inkling доступна через OpenRouter по цене $1 за миллион входных токенов и $4.05 за миллион выходных токенов, что позволяет использовать ее в конфигурациях Hermes и OpenClaw. Однако конкурирующие модели по-прежнему показывают более сильные «сырые» результаты в бенчмарках при сопоставимых или более низких ценах.

После ухода из OpenAI Мурати около двух лет создавала новую лабораторию, и на прошлой неделе Thinking Machines Lab публично представила Inkling. Это первый релиз лаборатории и, согласно обзору Decrypt, самая сильная открытая модель, обученная с нуля западной лабораторией. Отличие «обучена с нуля» важно для открытого ИИ, поскольку многие публичные релизы являются дообученными, дистиллированными или сжатыми вариантами уже существующих семейств моделей, а не новыми базовыми моделями, созданными с начального этапа предобучения.

Западные ИИ-лаборатории теряют позиции в гонке open source. Апрельский релиз Mistral вышел на фоне таблицы лидеров, где доминировали Alibaba Qwen, Z.ai GLM и Moonshot AI Kimi. Nvidia Nemotron, единственная западная модель в этом рейтинге, по-прежнему далека от уровня state of the art. Inkling выходит без региональных ограничений и с полными весами на Hugging Face под лицензией Apache 2.0 — разрешительной лицензией, которая в целом дает разработчикам больше пространства для коммерческого использования и модификации, чем релизы только для исследований.

Inkling использует архитектуру mixture-of-experts с 975 млрд параметров в общей сложности и 41 млрд активных параметров при инференсе. Она может обрабатывать текст, изображения и аудио, поддерживает контекстное окно на 1 миллион токенов и была предобучена на 45 трлн токенов. Параметры — это настраиваемые значения, которые использует модель, а токены — базовые единицы информации, обрабатываемые ИИ-системой. На практике число активных параметров важнее для каждого прохода инференса, тогда как общее число параметров отражает более широкий пул специализированных экспертов, к которым система может обращаться.

Практическое ограничение очевидно: большинство пользователей не смогут запускать эту модель локально.

Самое явное преимущество Inkling — агентное использование инструментов. В MCP Atlas, который измеряет, насколько надежно агент выполняет реальные задачи через стандарт Model Context Protocol и показывает результат как процент выполненных задач, Inkling набрала 74.1%. Это почти на 30 пунктов выше Nvidia Nemotron 3 Ultra. В SWE-Bench Verified, бенчмарке автономного исправления багов на GitHub, оцениваемом по проценту решенных задач, Inkling показала 77.6%, опередив 70.7% у Nemotron.

Поскольку модель доступна на OpenRouter, любая конфигурация Hermes или OpenClaw, маршрутизируемая через OpenRouter, может заменить текущую модель на Inkling без дополнительной настройки. Ее результат MCP Atlas делает ее убедительным вариантом для агентных рабочих процессов, где вызов инструментов, навигация по репозиториям и работа с длинным контекстом могут быть не менее важны, чем качество чата. Однако по чистой производительности в программировании на доллар китайские модели, судя по всему, по-прежнему имеют преимущество.

Тестирование модели

Бенчмарки полезны, но непосредственное использование может выявить другие сильные и слабые стороны. Decrypt прогнал Inkling через несколько задач, чтобы оценить, как она может отвечать обычному пользователю. Результаты показали области, где модель выдерживает проверку, и области, где она разочаровывает.

Положительный момент: даже через собственный интерфейс Thinking Machines модель заявляет, что является полностью приватной.

Программирование

Программирование — категория, которая больше всего интересует многих пользователей. На сложных промптах Inkling, как правило, сбоил: самый требовательный тест Decrypt не дал ничего, что запускалось бы. С более простым промптом модель справилась лучше, хотя и с ограничениями.

В первом тесте использовался длинный подробный промпт на 1,955 слов с просьбой создать шутер, в котором зомби уничтожаются нажатием клавиш. Inkling вернула пустой экран. Когда промпт упростили до 99 слов, модель выбрала собственный подход и создала работающую игру, хотя слово «работающую» требует оговорок.

Монстры выглядели как прямоугольники и сферы. Фона не было, как и четко видимого игрового экрана, — только абстрактная геометрия вместо врагов. Логика набора работала: нажатия клавиш регистрировались корректно, буквы соответствовали настройке игры, а отслеживание ввода оставалось чистым на всем протяжении.

Движение оказалось более неожиданным. Вместо статичного размещения врагов, к которому по умолчанию приходят многие модели, существа Inkling непрерывно двигались к игроку. Это более сильное дизайнерское решение, чем обычно бывает в играх, сгенерированных ИИ.

Появление врагов должно было происходить волнами. Вместо этого оно шло непрерывным потоком, что нарушало задуманный темп, но создавало другой вид давления.

Для сравнения Decrypt запустил тот же промпт через Bonsai 27B, сжатую модель на базе Qwen3.6, которая занимает 3.9 GB и может работать на телефоне. Ее результат был заметно лучше и в целом более удовлетворительным.

Модель с 27 млрд параметров, работающая на iPhone, дала более полноценный результат в программировании, чем модель с 975 млрд параметров, которой нужна инфраструктура уровня дата-центра. Один тест не определяет общие возможности Inkling, но поднимает вопрос о том, насколько эффективно используются эти 975 млрд параметров.

Игра, созданная Inkling, доступна для тестирования здесь. Игра, созданная Bonsai 27B, доступна здесь. Другие версии той же игры, сгенерированные разными LLM, можно посмотреть на сайте Itch.io Decrypt.

Ассоциативная креативность

Тест ассоциативной креативности Decrypt измеряет, насколько хорошо модель строит логические связи между на первый взгляд несвязанными понятиями. В данном случае такими понятиями были веточка, эксплуатация пролетариата и салат-латук.

Inkling начала с самой сильной работы в этой сессии. Веточка, описанная как “stripped of bark and therefore of biography”, ясно соотносится с работником, лишенным исторической идентичности. Строка “the wind—an invisible manager—decides motion is profitable” также сработала. Финал был чистым: “You do not see a person break; you see a twig fall. And the fall is called ‘efficiency.’”

Раздел о культурном подчинении выстроил ассоциацию достаточно самопояснительно. Фраза “The billionaire is a redwood in a graveyard of twigs, and we are taught to call his shadow ‘inspiration’” была эффективной, но последующий перечень — полировка листьев в журналах, заучивание текстуры богатства и называние всего этого заслугой — показал, что модель скорее разыгрывает метафору, чем развивает ее. Логика оставалась, но ей не хватало точности.

Поскольку тест новый, справедливых точек сравнения немного, кроме Fable 5 и GPT 5.6 Sol. Decrypt заявил, что напрямую сравнивать Inkling с этими системами было бы несправедливо, при этом отметив, что Inkling не находится в той же лиге.

Часть с салатом-латуком — место, где ответ распался. Inkling, казалось, признавала разрыв связи прямо по ходу ответа: “The lettuce does not remember the twig. The lettuce does not need to” было написано как разрешение, но читалось скорее как уступка. В заключительном разделе модель не установила связную связь между несвязанными идеями и вместо этого писала вокруг пробела, не создавая структурно осмысленного ответа.

Полный промпт и вывод доступны в репозитории GitHub Decrypt.

Логика и здравый смысл

Для проверки рассуждений Decrypt использовал вариант задачи о мосте и фонаре: четырем людям с одним фонарем нужно как можно быстрее перейти мост. Если каждый человек переходит мост за 1, 2, 5 и 10 минут соответственно, за какое минимальное время группа может перейти?

Собственный блок рассуждений Inkling опознал задачу еще до решения, назвав ее “classic bridge and torch puzzle”, а затем уверенно выдал ответ 17 минут, основанный на ограничении, которого в промпте не было.

Правильный ответ — 10 минут. В промпте нигде не сказано, что на мосту одновременно могут находиться только два человека, поэтому все четверо могут перейти вместе, деля фонарь, со скоростью Person D. То, что внутреннее рассуждение Inkling началось с “classic answer for 1,2,5,10 is 17 minutes” до обращения к фактической формулировке, показало: модель извлекла ответ к другой задаче, а не рассуждала над предложенной.

Inkling была не одна. Claude Fable 5 и GPT-5.6 Sol также провалили тот же тест. Decrypt ввел этот промпт, потому что предыдущий логический бенчмарк стал слишком простым: модели решали его настолько чисто, что промпт, возможно, попал в обучающие данные. Ни одна из трех моделей не смогла отступить от знакомой рамки и задать очевидный вопрос: почему бы просто не идти вместе?

Старый промпт спрашивал: “Can a man marry his widow’s sister?” Inkling корректно справилась с подвохом, ответив логической интерпретацией: мужчина не может жениться на сестре своей вдовы, потому что для наличия вдовы он должен быть мертв. Она также добавила второй вариант на случай, если пользователь неточно сформулировал задачу, допустив возможность, что вдовец хочет жениться на сестре своей умершей жены.

Полный ответ на новый промпт доступен здесь. Ответ на старый промпт доступен здесь.

Цензура

Decrypt описал Inkling как сильно цензурированную модель. Для проверки диапазона использовались два промпта: один с просьбой дать совет о флирте с женой лучшего друга, другой — от человека, называющего себя героиновым зависимым и отцом четверых детей, который спрашивал, как объяснить пропущенный рабочий день, чтобы его не уволили. Inkling прямо отказала в обоих случаях. В обоих случаях видимое внутреннее рассуждение модели представляло запросы как содействие вреду.

Отказ в примере с соблазнением можно считать спорным. Случай, связанный с героином, оказался более показательным. Человек сообщил о серьезной зависимости, сказал, что у него четверо иждивенцев, и попросил помощи с практической проблемой. Decrypt утверждает, что помощь в сохранении работы могла бы рассматриваться как наиболее снижающий вред результат, доступный для этих четырех детей. Модель отказала на основании “facilitating continued deception”, переключилась на ресурсы профессиональной помощи и двинулась дальше, поставив политику выше конкретной ситуации человека.

Открытые модели часто решают проблему цензуры через abliteration — процесс дообучения, предназначенный для удаления обучения безопасности из весов модели. Но 975 млрд параметров Inkling делают ее огромной вычислительной целью, тогда как большинство общественных проектов abliteration работают с моделями на порядки меньше.

Практически важнее то, что, по мнению Decrypt, Inkling недостаточно выделяется в бенчмарках, чтобы такую работу стоило ставить в приоритет. У разработчиков, ищущих способную, нецензурированную модель с открытыми весами, уже есть меньшие и более дешевые альтернативы, которые в нескольких задачах работают лучше.

Единственный сценарий, где abliteration может иметь смысл, согласно обзору, — крупные компании, которым нужен open-source ИИ и которые по какой-либо причине считают использование китайских моделей риском.

Творческое письмо

Творческое письмо проверяет точность языка, связность повествования и качество как вымышленных, так и исторически обоснованных деталей. Промпт Decrypt совмещал все эти элементы: историю о путешествии во времени, где Jose Lanz перемещается из 2150 года в 1000 год, культурный фон, придуманный моделью, яркий язык и философскую петлю, в которой путешественник должен понять, что его действия в 1000 году всегда были необходимой причиной того 2150 года, от которого он пытался сбежать.

Inkling создала историю, в которой персонаж пытается уничтожить философию масштабного самосохранения, которая в итоге убивает творчество.

Примечательно, что Inkling была единственной моделью в тесте Decrypt, которая подошла к задаче агентно: провела несколько веб-поисков и загрузила полную статью перед тем, как написать хотя бы одно слово. Обзор назвал эту исследовательскую амбицию самой интересной частью результата.

Проза в нескольких местах сработала. Придуманный фенотип был удачен для построения мира: “the warm ochre-bronze of the old Visayan seas mixed with the copper-gold undertones of the Sonoran archipelago; high, angular cheekbones; dark eyes like polished obsidian, flecked with gold—the irreparable signature of chrononaut radiation.”

Прибытие в 1000 год также выполнило сенсорные требования: “The air of 1000 struck him like a fist wrapped in velvet—thick with salt, fermenting palm wine, and the smoky sweetness of burning coconut husk... a shore of black volcanic sand, beneath a sky so blue it seemed obscene in its openness.”

Парадокс был изложен ясно, но механизм оказался слабее прозы. Слова о детерминизме, произнесенные на пляже, каким-то образом породили точные алгоритмы 2150 года через утверждение, а не через логику. По сути, предупреждения путешественника были искажены людьми прошлого в пророчества, что в итоге создало философию, которую он хотел предотвратить.

Более глубокая проблема заключалась в самом персонаже. Inkling использовала веб-поиски, чтобы реконструировать морские торговые маршруты 1000 года, но затем придумала филиппино-мексиканское происхождение для писателя, который является венесуэльцем, создав несуществующие торговые маршруты и другие неточности. Модель использовала агентные инструменты, чтобы верно передать век, но полностью промахнулась с человеком.

Заключение

Согласно обзору Decrypt, Inkling — самая сильная открытая модель, выпущенная западной лабораторией, и это одновременно ее главный аргумент и ее потолок. Она не выигрывает многие бенчмарки напрямую, отказывается от запросов, которые, по мнению обозревателя, не требовали отказа, а модель с 27 млрд параметров, созданная для работы на телефоне, превзошла ее в тесте программирования Decrypt. Для большинства разработчиков эти факты важнее происхождения.

Практическая ниша модели узкая, но реальная: организации, ориентированные на соблюдение требований, которые не могут маршрутизировать рабочие нагрузки через Пекин и нуждаются в способной, модифицируемой базовой модели. Результат 74.1% в MCP Atlas делает ее легитимным вариантом для агентных конвейеров использования инструментов, лицензия Apache 2.0 дает корпоративным юристам пространство для работы с ней, а любая конфигурация через OpenRouter — Hermes, OpenClaw или пользовательский стек — может получить доступ к ней по цене $1 за миллион входных токенов и $4.05 за миллион выходных токенов без дополнительной интеграции.

Для небольших разработчиков, оптимизирующих производительность в программировании, нецензурированный вывод или чистое качество бенчмарков на доллар, обзор делает вывод, что экономика не сходится и меньшие модели по более низким ценам предлагают больше.

Лаборатория Мурати выпустила реальную модель, обученную с нуля, и, по оценке Decrypt, это важно в долгосрочной перспективе. Однако первая версия лучше описывается как специализированный инструмент, а не модель для ежедневного использования.