新闻宏观经济谷歌发布 Gemini 3.7 Flash,OpenAI 预览提速 14 倍的 GPT-5.6 Sol Ultrafast

谷歌发布 Gemini 3.7 Flash,OpenAI 预览提速 14 倍的 GPT-5.6 Sol Ultrafast

作者: Decrypt·

要点速览

  • Gemini 3.7 Flash 已全面开放,可在超过 160 个国家/地区使用。
  • 该模型最多可接受 100 万个输入 token,能够处理文本、图像、视频、音频、PDF 以及工具调用。
  • 谷歌表示,Gemini 3.7 Flash 在 2 分 13 秒内完成了其测试编程任务,快于上一代 Flash 模型。
  • OpenAI 预览了 GPT-5.6 Sol Ultrafast,这是一个仅限受邀使用的 API 层级,采用 Cerebras 芯片,输出速度可达每秒 750 个 token。
  • 谷歌将 Gemini 3.7 Flash 的价格定为年底前每百万输入 token 75 美分、每百万输出 token 3.75 美元,12 月 31 日之后费率将上调。
谷歌发布 Gemini 3.7 Flash,OpenAI 预览提速 14 倍的 GPT-5.6 Sol Ultrafast

谷歌于周四发布了 Gemini 3.7 Flash,这是一款面向编程和智能体的低成本模型,现已全面开放。同日,OpenAI 预览了 GPT-5.6 Sol Ultrafast,这是一项由 Cerebras 提供支持的服务层级,可将其最强大模型的运行速度提升至最高 14 倍。速度竞赛的焦点已从原始智能转向实时智能体——但目前只有谷歌的模型能让所有开发者即刻用上。

谷歌和 OpenAI 传递了同样的信息:对于使用 AI 智能体的用户而言,AI 的速度已快得令人印象深刻,两家公司均发布了超高速模型。这两次发布的技术路径截然不同,而且目前只有一款真正交到了开发者手中。对速度的重视有其结构性原因:智能体可以将多次模型调用按顺序串联——规划、调用工具、检查结果——因此单次调用的延迟会在整个任务中不断累积。

谷歌推出了 Gemini 3.7 Flash,这是其专为软件编程和自主业务流程调优的最新模型。OpenAI 则开放了 GPT-5.6 Sol Ultrafast 的有限预览,这一新服务层级可让其最强大的模型以每秒最高 750 个输出 token 的速度运行。

Today we're introducing Gemini 3.7 Flash, our most intelligent workhorse model yet for coding and agents. This model brings substantial gains across software engineering, web development, and complex knowledge work. Now through the end of the year, Gemini 3.7 Flash is available… pic.twitter.com/RSCBDipjKn

— Google (@Google) August 13, 2026 (X post)

Gemini 3.7 Flash 是一款全面开放的模型。它最多可接受 100 万个输入 token(约 750,000 个单词),输出为 64,000 个,支持处理文本、图像、视频、音频和 PDF,并且可以调用工具和控制计算机。谷歌将其定位为自主系统的“廉价大脑”——这类系统能够规划任务,并在更少人工协助的情况下完成多步骤工作。

该模型并未为速度牺牲质量。它既更强大也更高效:完成谷歌的测试编程任务仅用时 2 分 13 秒,而最新的 Flash 模型则需要 5 分钟以上。两者之间的质量差距也十分明显。

OpenAI 的 Ultrafast 并非新模型。它就是 GPT-5.6 Sol——即 OpenAI 在发布前曾用 AI 红队加固以抵御提示注入攻击的那款模型——如今借助芯片制造商 Cerebras 的算力走上了更快的轨道。其速度约为 GPT-5.6 Sol 自身标准速度的 14 倍。

Previewing Ultrafast mode: GPT-5.6 Sol at up to 14x the speed. Launching first in the OpenAI API to a select group of customers with expanded access to more businesses as capacity grows. pic.twitter.com/a5dleofiDJ

— OpenAI (@OpenAI) August 13, 2026 (X post)

Cerebras 的晶圆级芯片(制造尺寸接近整片硅晶圆的处理器,而非通常从一片晶圆上切出的众多小芯片)每秒可生成最高 750 个 token——约 560 个单词——速度快到语音智能体可以在通话中途进行“思考”。

关键数据

根据谷歌自己的基准测试表,Gemini 3.7 Flash 在 18 个测试类别中的 11 个里领先于 Claude Sonnet 5、GPT-5.6 Terra 等模型,其中包括 Code Arena 网页开发类 1,588 Elo 的最高分,以及企业工作流基准 AutomationBench 上 30.4% 的成绩。这些均基于谷歌自己的测评方法,因此这一领先应被视为该公司的单方面说法。

与所有 Gemini Flash 模型一样,它价格低廉。年底前其价格为每百万输入 token 75 美分、每百万输出 token 3.75 美元,为 Gemini 3.6 Flash 原始费率的一半。这一入门价格将于 12 月 31 日到期,随后翻倍至 1.50 美元和 7.50 美元——对一款谷歌模型而言仍然便宜。

除客户评价外,OpenAI 尚未公布 Ultrafast 的正面对比成绩。Jane Street 的 AI 工程师 John Crepezzi 在 OpenAI 的公告中表示,Cerebras 的速度“带来了使用模型的不同方式”。Podium 产品负责人 Courtland Lykins 称其“在我们的语音技术栈中不可或缺”,并表示这一速度“彻底改变了通话体验”。该服务层级目前仅限受邀使用。

这场速度攻势正值各家实验室将竞争焦点从“谁最聪明”转向“谁快到足以支撑智能体”之际。谷歌的时间点耐人寻味。其旗舰模型 Gemini 3.5 Pro 仍未发布,也未给出发布日期——此时距 3.6 Flash 发布已过三周,距 DeepMind 领导层改组(Demis Hassabis 让位于副手 Koray Kavukcuoglu)也仅数日。与此同时,OpenAI 选择租用 Cerebras 的速度,而非等待自家技术栈。

Gemini 3.7 Flash 现已在超过 160 个国家/地区上线;GPT-5.6 Sol Ultrafast 仍仅限受邀使用。