阿里巴巴 Qwen Image 3.0 瞄準職場實用性而非美觀度,未開源模型權重
重點速覽
- •阿里巴巴 Qwen 團隊於 7 月 21 日發布 Qwen-Image-3.0,將其定位為生成生產就緒視覺資產的實用生產力工具,而非獨立的藝術作品。
- •與 Qwen Image 1.0 以開源 Apache 2.0 權重和同日技術報告發布不同,此次發布未提供開源權重、基準測試資料或技術文件。
- •該模型接受高達 4,500 token 的指令,約為前代容量的 4.5 倍,能夠一次性生成報紙和資訊圖表網格等複雜多面板排版。
- •Qwen-Image-3.0 支援 12 種語言的原始渲染,並可連接網際網路獲取即時資料,生成準確的即時視覺內容,如特定地點的天氣預報。
- •在阿里巴巴自己的 Qwen-Image-Bench 評估中,18 個模型中前代旗艦 Qwen Image 2.0 Pro 排名第五,而 OpenAI 的 GPT Image 2 領先,新模型是否改善了該排名仍有待確認。

阿里巴巴 Qwen 團隊於 7 月 21 日發布 Qwen-Image-3.0,將該模型定位為實用的生產力工具,而非又一個追求視覺驚豔效果的 AI 藝術競爭者。此次發布未提供開源模型權重、基準測試結果或技術報告——這與早期版本的开源路線有顯著差異,也反映出更廣泛的行業趨勢:包括最初擁抱開源發布在內的多家領先 AI 實驗室,越來越多地出於競爭或商業考量而保留模型權重和技術細節。
該模型可在 chat.qwen.ai 上試用,API 定價尚未公布。此次發布是阿里巴巴透過其雲端運算部門阿里雲進行更廣泛 AI 投資的一部分,阿里雲一直在構建涵蓋文字、視覺和多模態能力的 Qwen 模型系列,以與字節跳動和百度等國內競爭對手以及 OpenAI 和 Google 等西方企業競爭。
「Qwen-Image-3.0 不僅僅追求『好看』——它追求的是『實用』,讓圖像生成成為真正可部署的生產力工具,」Qwen 團隊在其官方公告中寫道。
與 Reve、Nano Banana 和 Seedream 等競爭 AI 圖像工具不同——這些工具通常強調創意、真實感或編輯能力——Qwen Image 3.0 圍繞公司所稱的豐富內容、真實細節和深度知識三大支柱構建。這種以實用性為先的定位,與企業 AI 供應商更廣泛的趨勢一致,即轉向生成可直接用於生產的資產——文件、簡報和介面原型——而非獨立的藝術作品。
豐富內容
最突出的特點是該模型能夠接受高達 4,500 token 的指令,大約是前一代處理能力的 4.5 倍。這一容量讓使用者可以在單一提示詞中描述複雜的多面板排版——如報紙、分鏡板和密集的資訊圖表網格——並將其作為一張完整、連貫的圖像接收回來。
「上方的完整圖像由 Qwen-Image-3.0 一次生成,而非由多張圖像拼接而成,」阿里巴巴在部落格中寫道。該公司展示中的每個面板都包含各自的圖表、公式、說明文字和細小字體文字,全部一次性渲染完成,而非後期組裝。阿里巴巴聲稱這是目前唯一能夠在沒有重大錯誤的情況下實現此類結果的模型。
真實細節
第二個支柱著重於精確渲染。據阿里巴巴表示,該模型「支援精確渲染小至 10px 的文字,生動重現毛孔和髮絲等細節,呈現逼真的微觀描繪。」10 像素文字即為細則文字——那種通常出現在藥品免責聲明上的字體大小。該模型還能準確處理 LaTeX 標記,使其能夠在完整的學術論文排版中渲染複雜的數學方程式。
Decrypt 使用該模型最快的配置測試了此功能,發現 Qwen Image 3.0 能夠重現 Decrypt 的一篇完整文章。據描述,執行效果確實令人印象深刻,但並非完美無缺。
深度知識
第三個支柱是深度知識。Qwen 團隊表示,該模型「支援 12 種語言的原始渲染,模擬網頁、遊戲和直播等主流介面,並運用豐富的世界知識。」它還可以連接網際網路獲取即時資料——例如,針對特定城市和日期請求天氣預報視覺化,會返回準確的即時圖形,而非近似值。該模型還展示了圖像理解能力:當看到一張昆蟲停在葉子上的照片時,它能根據對圖像的理解生成相關描述文字。
目標受眾與競爭定位
阿里巴巴將 Qwen Image 3.0 推銷給需要大規模生產就緒視覺資產的設計工作室、內容團隊、電商運營商和教育工作者。
然而,可驗證效能資料的缺失,與 Qwen Image 1.0 的發布形成鮮明對比——後者以 Apache 2.0 授權發布開源權重,並附帶同日發布的技術報告。在阿里巴巴自己的 Qwen-Image-Bench 評估中——一個在 18 個模型中評分圖像品質、美學和真實世界保真度的基準測試——前一代旗艦產品 Qwen Image 2.0 Pro 排名第五。OpenAI 的 GPT Image 2 領先該排名。Qwen Image 3.0 是否改善了前代的排名地位,在發布時無法獨立確認,因為此次發布未附帶任何基準測試表、可下載的權重或技術報告。
作為阿里巴巴更廣泛 AI 推展的一部分,該模型能力的證據目前僅限於公司在部落格上發布的精選範例圖像。獨立測試和社群評估可能將決定 Qwen Image 3.0 的單次渲染和細字體準確性是否能在更廣泛使用中站穩腳跟,而尚未公布的 API 定價將是該模型能否在阿里巴巴所瞄準的企業團隊中獲得青睞的關鍵因素。