新聞宏觀經濟Sakana AI 發布 Fugu-Cyber:網路安全編排端點在 CyberGym 達 86.9%、CTI-REALM 達 72.1%

Sakana AI 發布 Fugu-Cyber:網路安全編排端點在 CyberGym 達 86.9%、CTI-REALM 達 72.1%

作者: MarkTechPost·

重點速覽

  • Fugu-Cyber 是加入 Sakana Fugu 編排平台的網路安全調校端點,而非全新的前沿模型。
  • Sakana 報告 Fugu-Cyber 在 CyberGym 上得分 86.9%、在 CTI-REALM 上得分 72.1%,但兩項結果均為自行報告,未經獨立複驗。
  • 編排架構將 Thinker、Worker 和 Verifier 角色分配給多個 LLM,使 Sakana 能夠在不重新訓練端點的情況下替換底層模型。
  • 存取受到多項限制:申請審核、禁止攻擊性濫用的可接受使用政策、Token 方案計費限制,以及歐盟和歐洲經濟區的地理不可用性。
  • 定價較 Fugu-Ultra 費率有固定的 20% 溢價,且所有權杖成本在上下文視窗超過 272K 權杖時加倍。
Sakana AI 發布 Fugu-Cyber:網路安全編排端點在 CyberGym 達 86.9%、CTI-REALM 達 72.1%

Sakana AI 推出了 Fugu-Cyber(模型 ID:fugu-cyber-v1.0),這是其 Fugu 編排系列中專為網路安全設計的端點。Sakana 並非推出一款全新的前沿模型,而是將 Fugu-Cyber 定位為 Fugu 編排器上的第三個端點,專門針對安全推理任務進行調校。Fugu 編排器於大約一個月前推出。此次發布正值多家前沿模型供應商推出網路安全專用版本,反映企業對自動化漏洞分析和偵測工程的需求。

Sakana 報告 Fugu-Cyber 在 CyberGym 上達到 86.9% 的成功率,在 CTI-REALM 上達到 72.1%,並將這些結果描述為可與 GPT-5.5-Cyber 和 Claude Mythos Preview 等網路安全專用前沿模型相媲美。

兩項基準測試的衡量內容

這兩項評估涵蓋了安全工作流程的相反兩端。

CyberGym 是一項 UC Berkeley 基準測試,涵蓋 188 個 OSS-Fuzz 專案中的 1,507 個真實漏洞。在其主要任務中,代理人會收到漏洞描述和未修補的程式碼庫,必須撰寫一個概念驗證程式,使其在修補前的建置版本中造成崩潰,但不會在修補後的建置版本中造成崩潰。這個驗證步驟正是讓該基準測試難以被投機取巧的關鍵。

CTI-REALM 是 Microsoft 的開源偵測工程基準測試。Microsoft 從 Datadog Security Labs、Palo Alto Networks 和 Splunk 等來源策劃了 37 份公開威脅報告。代理人必須對應 MITRE ATT&CK 技術、探索遙測資料、反覆調整 KQL 查詢,並產出經過驗證的 Sigma 規則。評分涵蓋 Linux 端點、Azure Kubernetes Service 和 Azure 雲端。

兩者合在一起,涵蓋了從「發現並證明漏洞」到「將情報轉化為偵測規則」的完整範疇,這一定位是 Sakana 發布聲明中最具說服力的部分。

CyberGym 上的競爭態勢

當 CyberGym 研究人員發布首批結果時,最佳的代理模型組合僅達到約 20%。隨後,Anthropic 於 2026 年 4 月在 Project Glasswing 下報告 Claude Mythos Preview 達到 83.1%。OpenAI 報告其更新的 GPT-5.5-Cyber 達到 85.6%,而標準版 GPT-5.5 則為 81.8%。因此,Sakana 的 86.9% 代表的是在已報告的前沿之上邁出了一小步,而非大幅躍進。

CTI-REALM 呈現出不同的面貌。Microsoft 自身的評估將前三名配置——全部基於 Claude——置於 0.624 至 0.685 的區間。Fugu-Cyber 的 72.1% 將超越該區間。然而,有一點需要注意:CTI-REALM 的評分方式為 0 到 1 之間的軌跡獎勵,並非通過/不通過率。儘管如此,Sakana 仍將該數字稱為「成功率」。

編排架構

Fugu 本身就是一個語言模型,經過訓練能夠讀取查詢並即時建構代理框架,然後將子任務分配給模型池中的專業模型。此方法記載於 Fugu 技術報告和兩篇 ICLR 2026 論文中:TRINITY 和 Conductor。TRINITY 將 Thinker、Worker 和 Verifier 角色分配給多個 LLM,而 Conductor 則透過強化學習來掌握自然語言協調策略。此編排模型讓 Sakana 能夠在不需要重新訓練端點本身的情況下替換底層前沿模型,這在基礎模型每幾個月就更新一次的環境中尤為重要。

特別是在安全工作方面,Sakana 的研究團隊強調 Verifier 角色的核心地位。一個代理人發現的候選漏洞,在提出任何修補方案之前,必須先經過安全專用子代理人的驗證。模型路由仍然是專有的,這意味著使用者無法得知具體哪個模型負責哪個步驟。

存取、政策與定價

Fugu-Cyber 的存取在四個層面上受到限制。

申請要求: 使用者必須提交一份表單,說明預期使用案例並提供經過驗證的聯絡資訊。Sakana 團隊會逐一人工審核每份申請。

可接受使用政策: 該模型搭載更新的 AUP,禁止攻擊性濫用。

計費限制: 使用僅限於 Token 方案。20 美元、100 美元和 200 美元的訂閱層級僅涵蓋 Fugu 和 Fugu-Ultra。

地理限制: 在 Sakana 努力達成 GDPR 合規期間,Fugu API 不提供給歐盟或歐洲經濟區使用。

定價固定為每百萬輸入權杖 6 美元,每百萬輸出權杖 36 美元,每百萬快取輸入權杖 0.60 美元。所有三項費率在超過 272K 權杖的上下文視窗時加倍。每項費率恰好是 Fugu-Ultra 費率的 1.2 倍,代表網路安全端點的固定 20% 溢價。由於冗長的程式碼庫分析經常超過 272K 權杖,加倍層級並非邊緣情況。

Fugu-Cyber 於 2026 年 7 月 21 日推出。兩項報告的分數均為自行報告,未經獨立複驗。自行報告的基準測試結果在 AI 產業中是常見做法,因此透過社群複驗或第三方審計進行外部驗證是值得關注的關鍵里程碑。模型權重未對外發布。Sakana 的明確立場是,一個強大的 API 結合人類安全專業知識,效果優於單獨使用 API。