Sakana AI 发布 Fugu-Cyber:网络安全编排端点在 CyberGym 上报告 86.9%、在 CTI-REALM 上报告 72.1%
要点速览
- •Fugu-Cyber 是加入 Sakana Fugu 编排平台的网络安全调优端点,而不是一个全新的前沿模型。
- •Sakana 报告称 Fugu-Cyber 在 CyberGym 上得分 86.9%,在 CTI-REALM 上得分 72.1%,但两项结果均为自报告,尚未独立复现。
- •其编排架构在多个 LLM 之间分配 Thinker、Worker 和 Verifier 角色,使 Sakana 能够在不重新训练端点的情况下替换底层模型。
- •访问受到申请审核、禁止攻击性滥用的可接受使用政策、Token Plan 计费限制以及 EU 和 EEA 地区不可用等条件约束。
- •定价较 Fugu-Ultra 费率固定溢价 20%,且当上下文窗口超过 272K token 时,所有 token 成本都会翻倍。

Sakana AI 推出了 Fugu-Cyber(模型 ID:fugu-cyber-v1.0),这是其 Fugu 编排系列中的网络安全专用端点。Sakana 并未发布一个全新的前沿模型,而是将 Fugu-Cyber 定位为 Fugu 编排器上的第三个端点,专门针对安全推理任务进行调优。Fugu 编排器大约在一个月前推出。此次发布正值多家前沿模型提供商推出网络安全专用变体,反映出企业对自动化漏洞分析和检测工程的需求。
Sakana 报告称,Fugu-Cyber 在 CyberGym 上达到 86.9% 的成功率,在 CTI-REALM 上达到 72.1%,并将这些结果描述为可与 GPT-5.5-Cyber 和 Claude Mythos Preview 等网络安全专用前沿模型相媲美。
这些基准测试衡量什么
这两项评估面向安全工作流的两个相反端点。
CyberGym 是一项 UC Berkeley 基准测试,涵盖 188 个 OSS-Fuzz 项目中的 1,507 个真实世界漏洞。在其主要任务中,智能体会收到一份漏洞描述以及一个未打补丁的代码库,并必须编写一个概念验证,使补丁前构建崩溃,但不会使补丁后构建崩溃。这个验证步骤使该基准测试不易被投机取巧。
CTI-REALM 是 Microsoft 的开源检测工程基准测试。Microsoft 从 Datadog Security Labs、Palo Alto Networks 和 Splunk 等来源整理了 37 份公开威胁报告。智能体必须映射 MITRE ATT&CK 技术,探索遥测数据,迭代 KQL 查询,并生成经过验证的 Sigma 规则。评分范围涵盖 Linux 端点、Azure Kubernetes Service 和 Azure 云。
两者合在一起覆盖了从“发现并证明漏洞”到“将情报转化为检测”的范围,这一定位是 Sakana 公告中最站得住脚的部分。
CyberGym 上的竞争背景
当 CyberGym 研究人员发布初始结果时,最佳智能体-模型组合约达到 20%。随后,Anthropic 报告称 Claude Mythos Preview 在 2026 年 4 月的 Project Glasswing 下达到 83.1%。OpenAI 报告称,其更新后的 GPT-5.5-Cyber 达到 85.6%,相比之下标准 GPT-5.5 为 81.8%。因此,Sakana 的 86.9% 代表的是相对于已报告前沿水平的小幅提升,而非重大跃升。
CTI-REALM 则呈现出不同情况。Microsoft 自己的评估将排名前三的配置——全部基于 Claude——置于 0.624 到 0.685 的区间。Fugu-Cyber 的 72.1% 将高于该区间。不过,有一个限制需要注意:CTI-REALM 的评分是 0 到 1 之间的轨迹奖励,而不是通过/未通过率。尽管如此,Sakana 仍将该数字称为“成功率”。
编排架构
Fugu 本身就是一个语言模型,经过训练后可读取查询,并在将子任务委派给模型池中的专用模型之前,动态构建一个智能体式脚手架。该方法记录在 Fugu 技术报告以及两篇 ICLR 2026 论文中:TRINITY 和 the Conductor。TRINITY 在多个 LLM 之间分配 Thinker、Worker 和 Verifier 角色,而 Conductor 通过强化学习学习自然语言协调策略。这种编排模型使 Sakana 能够在不重新训练端点本身的情况下替换底层前沿模型;在基础模型每隔几个月就会更新的环境中,这一点具有重要意义。
对于安全工作,Sakana 的研究团队特别强调 verifier 角色的核心作用。由一个智能体发现的候选漏洞,会先由网络安全专用子智能体进行验证,然后才会提出任何补丁。模型路由仍为专有机制,这意味着用户无法看到每个步骤具体由哪个模型处理。
访问、政策与定价
Fugu-Cyber 的访问在四个维度上受到限制。
需要申请: 用户必须提交表单,说明预期用例并提供经过验证的联系方式。Sakana 团队会人工审核每一份申请。
可接受使用政策: 该模型随更新后的 AUP 一起提供,禁止攻击性滥用。
计费限制: 使用仅限 Token Plan。$20、$100 和 $200 的订阅档位仅覆盖 Fugu 和 Fugu-Ultra。
地域限制: 在 Sakana 推进 GDPR 合规期间,Fugu API 不在 EU 或 EEA 提供。
定价固定为每百万输入 token $6、每百万输出 token $36、每百万缓存输入 token $0.60。在上下文窗口超过 272K token 后,三项费率均翻倍。每项费率均恰好为 Fugu-Ultra 费率的 1.2 倍,代表网络安全端点收取固定 20% 溢价。由于较长代码库分析经常超过 272K token,翻倍档位并非边缘情况。
Fugu-Cyber 于 2026 年 7 月 21 日推出。两项报告分数均为自报告,尚未经过独立复现。自报告基准测试结果在 AI 行业中属于常见做法,因此通过社区复现或第三方审计进行外部验证,将是后续值得关注的关键里程碑。模型权重未发布。Sakana 的公开立场是,将有能力的 API 与人类安全专业知识结合起来,效果优于单独使用 API。