新聞股票Google DeepMind 的 Gemini 3.7 Flash 在 Agent Arena 排行榜上名列第 20 位

Google DeepMind 的 Gemini 3.7 Flash 在 Agent Arena 排行榜上名列第 20 位

作者: CryptoBriefing·

重點速覽

  • Agent Arena 根據來自超過 170 萬個使用者工作階段的資料,對 AI 模型的即時任務表現進行排名。
  • Gemini 3.7 Flash 在取得 3.4% 的得分提升後,攀升至第 20 名。
  • 目前排行榜上有 19 個模型的排名高於 Gemini 3.7 Flash。
  • Google 的 Gemini 3.5 Flash 位居第 27 名,而 Gemini 3.6 Flash 則約在第 34 名。
  • 截至 2026 年 8 月中旬,Gemini 3.7 Flash 尚未正式發布。
Google DeepMind 的 Gemini 3.7 Flash 在 Agent Arena 排行榜上名列第 20 位

Google DeepMind 的 Gemini 3.7 Flash 已晉升至 Agent Arena 排行榜的第 20 名,這是由 arena.ai 營運的即時排名系統,依據 AI 模型在真實世界中的任務表現進行評估。該模型取得了 3.4% 的得分提升,躋身一個旨在反映模型在實際工作流程中行為表現的排行榜,而非靜態基準測試。

Agent Arena 如何評估模型

不同於依賴問答或標準化測試的傳統排行榜,Agent Arena 根據真實世界的工具調度與任務完成成效來對 AI 模型進行排名。該平台彙集了超過 170 萬個使用者工作階段的資料,並追蹤工具幻覺等指標——即模型自信滿滿地嘗試使用不存在的工具,或誤用可用工具的情況——以及整體成功率。

由於排名是基於即時使用資料,變動的意義不僅止於單次得分更新:它們能反映模型在需要選擇工具、從錯誤中恢復、以及完成任務時的表現,這些環境比考試式提示更接近實際的代理部署場景。

Flash 模型世代比較

Google Flash 系列內部的世代演進凸顯了模型迭代的速度。Gemini 3.5 Flash 目前位居第 27 名,淨改善幅度僅 0.39%,而 Gemini 3.6 Flash 則進一步落後至約第 34 名。

Gemini 3.6 Flash 於 2026 年 7 月 21 日發布。該世代模型著重於將輸出 Token 數量相較前代減少 17%。

在 Google 的 Python GenAI SDK 中發現的參考資料顯示,3.7 版本旨在進一步提升 Token 效率,同時整合多模態代理效能。這將使模型能夠在單一代理工作流程中處理文字、圖像及潛在的其他資料類型。截至 2026 年 8 月中旬,Gemini 3.7 Flash 尚未正式發布。

競爭態勢

Gemini 3.7 Flash 位居第 20 名,目前有 19 個模型在真實世界代理任務上表現優於它。關於 3.4% 改善幅度如何計算,目前尚未公開任何官方方法論。Agent Arena 的評分是動態的——隨著新競爭者加入及更多使用者工作階段資料的累積,模型的排名可能上升或下降。