НовостиМакроDeepSeek V4.1 Flash почти сравнялась с GPT-6 Astra в дизайне при стоимости 1,4% от его цены

DeepSeek V4.1 Flash почти сравнялась с GPT-6 Astra в дизайне при стоимости 1,4% от его цены

Автор: Decrypt·

Ключевые выводы

  • DeepSeek V4.1 Flash набрала 81,2 балла — всего на 1,5 балла меньше лидирующего результата GPT-6 Astra в 82,7 балла.
  • Средняя стоимость готового дизайна для DeepSeek составила $0.023 против $1.61 у Astra и $3.66 у Claude Fable 5.1.
  • DeepSeek выполняла каждую разработку в среднем за 5,3 минуты — быстрее, чем Astra за 11,1 минуты и Fable за 12,8 минуты.
  • В бенчмарке тестировались 13 моделей на практических дизайнерских задачах; 11 из них набрали меньше DeepSeek и при этом стоили дороже в эксплуатации.
  • Показатель готовности составил 57,7% у DeepSeek, 60% у Astra и 56,7% у Fable, отражая долю результатов, признанных готовыми без доработки.
DeepSeek V4.1 Flash почти сравнялась с GPT-6 Astra в дизайне при стоимости 1,4% от его цены

OpenDesign Arena оценила DeepSeek V4.1 Flash в 81,2 балла из 100 в реальных дизайнерских задачах — почти наравне с GPT-6 Astra от OpenAI, набравшей 82,7 балла. Стоимость одной готовой разработки для модели DeepSeek составила $0.023 против $1.61 у Astra — около 1,4% от этой цены.

Компания OpenDesign, создавшая площадку для бенчмарков OpenDesign Arena, на этой неделе прогнала 13 моделей ИИ через один и тот же набор дизайнерских задач. Одиннадцать моделей набрали меньше DeepSeek V4.1 Flash и стоили дороже в эксплуатации. Более высокий результат показала только GPT-6 Astra.

OpenDesign Arena оценивает повседневную дизайнерскую работу, включая создание веб-приложений, дашбордов, мобильных экранов и лендингов, по 100-балльной шкале. Тридцать баллов отражают соответствие результата заданию, а остальные 70 оценивают качество дизайна, включая компоновку, иерархию, цвет и соответствие запрошенному стилю. Бенчмарк призван ответить на более узкий вопрос, чем универсальные рейтинги ИИ: какую модель работающий веб-дизайнер может использовать для практической работы.

GPT-6 Astra в среднем набрала 82,7 балла, выполняла каждую разработку за 11,1 минуты и стоила $1.61 за готовый результат. DeepSeek V4.1 Flash набрала 81,2 балла, справлялась за 5,3 минуты и стоила $0.023. Claude Fable 5.1 заняла третье место с результатом 80,3 балла, средним временем выполнения 12,8 минуты и стоимостью $3.66 за дизайн.

В число других протестированных моделей вошли Grok 4.6, Qwen 3.8-Max, Kimi K3, GLM-5.3 Flash и Gemini 3.8 Flash. Каждая из них набрала меньше DeepSeek V4.1 Flash и стоила дороже в эксплуатации. В общей сложности это 11 из 13 протестированных моделей. GPT-6 Astra превзошла результат DeepSeek на 1,5 балла.

Технический отчет DeepSeek о V4.1 Flash связывает более низкую стоимость эксплуатации и быстрое выполнение задач с архитектурой модели. Всего модель располагает 552 миллиардами параметров — внутренними настройками, корректируемыми в процессе обучения, — но активирует только 8 миллиардов параметров для обработки входящего запроса и 16 миллиардов для формирования ответа. DeepSeek называет эту конструкцию архитектурой Causal Encoder-Decoder.

Результат продолжает другие попытки DeepSeek сократить отставание в возможностях, взимая за использование меньше, чем конкурирующие модели. Несколькими неделями ранее модель V4 Pro от компании отстала от Claude Fable 5 менее чем на 5% в рамках отдельного сравнения по бенчмарку, при этом ее стоимость составляла лишь долю тарифа Fable. DeepSeek также нанимала инженеров в Пекине для разработки собственного Code Harness, стремясь контролировать весь агентный стек, а не только поставлять базовую модель.

Методология тестирования OpenDesign ограничивает то, что можно доказать этими результатами. Результат оценивается только в том случае, если изначально отображается как работающая веб-страница. Пустые, неисправные или обрезанные результаты получают ноль баллов и повторно не тестируются. Поэтому бенчмарк измеряет надежность выполнения повседневных дизайнерских задач, а не общие способности к рассуждению или программированию.

OpenAI выпустила GPT-6 Astra 3 сентября. Модель описывают как универсальную, способную выполнять такие задачи, как проектирование печатной платы, подготовка налоговой декларации и создание 3D-сцены, хотя первые тестировщики назвали ее более слабым автором текстов по сравнению с замененной ею моделью. В бенчмарке OpenDesign Astra работала медленнее и стоила дороже DeepSeek V4.1 Flash, но сохранила статус модели с самым высоким результатом.

Показатель готовности к передаче в работу OpenDesign, определяемый как доля результатов, признанных готовыми к использованию без доработки, составил 57,7% для DeepSeek V4.1 Flash, 60% для GPT-6 Astra и 56,7% для Claude Fable 5.1. Эти показатели дополняют оценки качества в бенчмарке практической метрикой: они показывают, как часто каждая модель создавала результат, который оценщики считали пригодным без дальнейших изменений.

Связанные материалы: OpenAI выпускает GPT-6 Astra, DeepSeek обновляет V4 Pro и планы DeepSeek по Code Harness.

Источник: Decrypt