新闻宏观经济OpenAI 的 GPT-6 Astra 几乎样样惊人——唯独写作例外

OpenAI 的 GPT-6 Astra 几乎样样惊人——唯独写作例外

作者: Decrypt·

要点速览

  • OpenAI 于 9 月 3 日发布 GPT-6 Astra,定价为每百万输入 token 10 美元、每百万输出 token 50 美元,是 GPT-5.6 Sol 成本的 2.5 倍。
  • 该模型在 OSWorld 2.0 计算机操作基准上得分 72.6%,每项任务约 40 分钟,而 Sol 为 65.7%、耗时 75 分钟。
  • 早期测试者展示了强大的空间和编程能力,包括在 Unreal Engine 中还原曼哈顿,以及一天内构建完整的多人浏览器射击游戏。
  • 写作质量出现退步:在 Louis-François Bouchard 的编辑风格基准上,Astra 以 1995 Elo 排名第 11,低于 Sol 的第 6 名(2156 分);据 Artificial Analysis,其在 GDPval-AA v2 上损失约 80 个 Elo 点。
  • 在 Artificial Analysis 智能指数上,Astra 得分 61.2,略高于 Sol 的 60.9,但低于 Anthropic 的 Claude Fable 5.1(65.7),尽管价格更高。
OpenAI 的 GPT-6 Astra 几乎样样惊人——唯独写作例外

OpenAI 于 9 月 3 日发布 GPT-6 Astra,定价为每百万输入 token 10 美元、每百万输出 token 50 美元——据 Artificial Analysis 数据,这是其替代模型 GPT-5.6 Sol 成本的 2.5 倍。(一个 token 约为四分之三个单词,是 AI 公司计费的单位。)这一溢价出现的时机,正值前沿模型市场不再是独家竞赛之际:Anthropic 的 Claude 系列已赢得大批开发者,Google 的 Gemini 则在多模态上持续发力,因此如今每次发布都会在数小时内被公开剖析。48 小时内,获得早期访问权限的开发者将这次发布变成了一场公开的压力测试,而他们发布的内容清晰地分为两类:Astra 是人们用过的在空间、机械或智能体(agentic)任务上最强的模型——但据其中多位同一批人的评价,它的写作能力比前代更差。OpenAI 总裁 Greg Brockman 在发布简报会上宣布 AGI 已经到来。

其主打功能是“计算机使用”(computer use):模型在真实桌面上直接操控鼠标和键盘,而不是交给你一份需要照做的指令清单。Anthropic 是首个推出该能力的大型实验室,Claude 的计算机使用功能于 2024 年末上线,但受限于可靠性,普及一直受限——点错位置或中途卡住的智能体是常态,这正是 OpenAI 的速度和成功率数据引发关注的原因。在 OSWorld 2.0(一项测试智能体能独立完成多少日常桌面任务的评测)上,OpenAI 报告 Astra 的成绩为 72.6%,每项任务约 40 分钟,而 Sol 为 65.7%,耗时 75 分钟。它也是 OpenAI 首个被评为达到网络安全“临界阈值”的模型,意味着它可以在无人先指出漏洞的情况下发现未知软件缺陷并构建可行的攻击。

除了基准测试,爱好者分享的真实用例也许是判断 GPT-6 哪里是金子、哪里不是的最佳方式。以下是一些最有趣的结果。

视觉理解:逐街构建的曼哈顿

事实证明,Astra 在视觉理解和空间感知方面极其出色。投资人、HyperWrite 前 CEO Matt Shumer 让 Astra 在 Unreal Engine(《堡垒之夜》背后的游戏引擎)中运行了一周。在此期间,Astra 生成了曼哈顿的复制品。他发布了一段飞越演示视频,并表示该模型“逐条街道地工作,让每一条都完美”。

GPT-6 Astra built this Manhattan world in Unreal Engine over the course of a week. It was literally able to go street by street to make each one perfect. pic.twitter.com/7VTol9QfHq — Matt Shumer (@mattshumer_) September 3, 2026

他的另一项实验更具冲击力。Shumer 让 Astra 构建一个生存世界,并让其中每个角色各自运行一份该模型,随后让它整夜运行。一天后,他从客厅听到说话声,以为有人闯入了公寓,结果发现“它们开始互相交谈了”。

Max Weinbach 向模型输入了 Apple Park 的照片,要求用 Blender(动画师和游戏美术师使用的免费 3D 建模软件)进行重建。他的评价是:“干得离谱地好。”

I had early access to GPT-6 Astra and it's maybe the most insane model I've experienced In Blender, I had it recreate Apple Park from just images. It did an absurd job. pic.twitter.com/0vDgg4u1DQ — Max Weinbach (@mweinbach) September 3, 2026

Tom Krcha 交给 Astra 一张房屋图片,得到的回报是完整的室内空间——以每秒 60 帧运行的可编辑几何体,细节精确到家电和玩具。他断言“现在世界上每个人的指尖都有一位 3D 设计师”。

Pietro Schirano 把整个工作流缩减为一个手势。在地图上放一个大头针,要求以 3D 呈现周边区域,用他的话说,“它就会照做”。

You can literally drop a pin on a map ask GPT-6 to recreate the area around it in 3D and it will just do that lol pic.twitter.com/0PBTpV9kpF — Pietro Schirano (@skirano) September 4, 2026

一位网名为 SuSu 的开发者将同样的想法扩展到城市尺度。Astra 用 Three.js(一种可在普通网页浏览器中渲染 3D 图形的 JavaScript 库,无需下载)在 24 分钟内重建了中国城市杭州及周边城镇,西湖、雷峰塔、茶山梯田和湿地一应俱全。这条帖子用中文将其描述为一个真正可交互的“迷你杭州”,而非静态图片,还配有可点击的地标和昼夜切换功能。

🔥绝了!GPT-6 Astra在24分钟内用Three.js把整座杭州搬进网页,能逛能飞能切换昼夜! 刚上线的GPT-6 Astra,直接用Three.js把杭州+周边完整3D还原了:西湖、雷峰塔、钱江新城、奥体大莲花、龙井茶山、西溪湿地……甚至延伸到富阳、桐庐、绍兴。… pic.twitter.com/eC1dZDsVI0 — SuSu_酥酥👅 (@NFT_Chen) September 5, 2026

编程:人们真正玩过的游戏

游戏是目前最流行的用例,也是 GPT-6 Astra 大放异彩的领域。Anshu Chimala 曾任 Apple 的 UX/UI 设计师和 AI 开发者,他在 45 分钟内一次性得到了一款 3D 游戏,据他描述,这仅消耗了他使用配额的百分之几。他称 Astra 为“某种 3D 游戏的涡轮增压 AGI 机器之神”。该游戏无法供测试,但视频展示了等距视角风格、精心设计的角色与环境,整体美学相当不错。

他的方法比这句溢美之词更重要。他将模型连接到 Blender,让它为目标效果自行生成概念图,然后指示它不断迭代,直到游戏内截图以 60fps 匹配参考图。Astra 建模了所有资产并生成了自己的贴图。该模型无法独立设计 AAA 级画面,但借助合适的工具,它能开发出设计精美的环境。

Rishi Prasad 曾在 Coinbase 和 Eleven Labs 担任开发者,他在一天内构建了 Astral War:一款浏览器射击游戏,配备权威多人服务器、12 人大厅、手柄支持和语音聊天。与一个月前他用 Claude Opus 5 构建的作品相比,他形容这是“视觉保真度上的巨大阶跃式飞跃”。

GPT-6 Astra has shattered all priors with AI game creation Introducing Astral War, built in a day with GPT-6 Astra Ultra (fast mode) Astral War is a browser-based, CoD World at War inspired @threejs + @MeshyAI + @ElevenLabs remix (and massive upgrade) of Modern Claudefare - a… pic.twitter.com/n9kTaDh4Wx — Rishi (@0xRishi) September 5, 2026

也有人完全跳过了设计步骤。化名 AI 开发者 Daniel 向 Astra 展示了一段手游广告,要求把其中的内容做成可玩的浏览器版本。不到 30 分钟,他报告结果“相当接近”。从视频来看,该模型理解了游戏的逻辑和视觉,并能够将其复现。

计算机操作与插画:用鼠标作画

一位网名为 Taiyaki Sun 的日本插画师完成了这批测试中最字面意义上的计算机操作实验。他们没有要求生成一张图片,而是交给 Astra 一份手绘线稿文件,让它像人类上色师那样用鼠标在 Clip Studio Paint 中为画作上色。

GPT-6 Astraのお絵描き能力すごい!!! 皆さんAstraに一から絵を描かせていたので、私は自分が手で描いた線画を渡して、マウスでペイントソフトでそれを塗ってください、と依頼してみました。うおおおこれがAI分業だあああああ このタイムラプス、すべてAstraが動かしてます。… pic.twitter.com/hZk30pBgCq — taiyakisun(たい焼き太陽)🥐 (@taiyaki_sun) September 5, 2026

Astra 创建了图层、缩放画面、选择画笔并为作品上色。这位艺术家在一篇从日语翻译而来的帖子中说,自己全程只是在旁观。这次会话在 100 美元的 Pro 计划上以最大力度运行,消耗了 21% 的配额。其他用户也一直在分享有趣的视频,展示 Astra 通过计算机操作(即以视觉方式接管你的电脑,而非使用 MCP 服务器或 API 密钥)完全用 Paint 复现他们的照片。

音乐:巴赫测试

GPT-6 Astra 在音乐方面的品味也不错——至少对一个 LLM 而言。运营 "Augmented Fifth" substack 的 Auggie 维护着一个非正式基准测试:使用固定的提示词,要求模型用 LilyPond(一种可编译成乐谱的文本格式)以巴赫风格写一首四声部众赞歌,G 小调、3/4 拍。结果按音乐学院学生所遵循的同一套和声规则评分。这类定性基准难以标准化,因为质量、美感等带有主观性——但作为人类,我们能够辨别这些特质。

Astra 创下了该测试有史以来的最佳成绩。没有声部进行错误,即没有任何旋律线以巴赫规则禁止的方式发生冲突,和声中还出现了那不勒斯六和弦——一种在莫扎特和贝多芬作品中出现的半音化和弦。Auggie 特别指出,它是“首个在该基准上写出经过音的模型”。

GPT-6 Astra has the best result yet on the Bach Benchmark. Its chorale contains no voice-leading errors, and its harmonic palette is sophisticated enough to include a Neapolitan sixth chord. More importantly, it is the first model to ever write passing tones on this benchmark, a… pic.twitter.com/UMXSbveR0C — Auggie (@aug5thmusic) September 5, 2026

OpenAI 自己的数据表也指向同一方向。在 OpenScore String Quartets(评估模型读取和转录古典乐谱的准确度)上,Astra 达到 0.84,而 Sol 为 0.19。

Derya Unutmaz 是一名医生兼多产的 AI 测试者,他要求制作一架完全可演奏的虚拟钢琴,并内置巴赫全部六首《勃兰登堡协奏曲》。他写道:“这个疯狂的模型在大约 11 分钟内完成了整件事。”

Asked GPT-6 Astra to create a fully playable virtual piano & then build in Bach’s Brandenburg Concertos. This insane model did the whole thing in ~11 minutes! All 6 Concertos are built in & can be played directly on the piano! Link to the piano: 🎹✨ .… pic.twitter.com/DBwXF3uA8O — Derya Unutmaz, MD (@DeryaTR_) September 5, 2026

需要强调的是,GPT-6 Astra 是一个 LLM,而非音频/音乐模型。它对音乐的理解可能来自记谱法和文字数据,而非训练数据集中声音与音乐关联的浸润,因此这些结果对一个文本模型来说非常亮眼,但若出自 Suno 之类的专业 AI,则只能算平平。

写作:溃败之处

一如既往,OpenAI 的模型擅长编程但写作薄弱——至少在没有大量提示、上下文和引导的情况下。公平地说,写作既非 OpenAI 的强项,也非其重点。

Louis-François Bouchard 运营一个内部基准测试,评估模型以他团队编辑风格写作的能力,采用 Elo 排名——即根据对手间胜负打分的国际象棋评级系统;Elo 评分没有分数上限,分数越高模型越好。Astra 排名第 11 位,得 1995 分。其前代排第 6 位,得 2156 分。Astra 每篇脚本的成本约为 0.26 美元,大约是 Sol 的 1.8 倍。

Big news from our internal writing benchmark (early results): GPT-6 ... is surprisingly disappointing I definitely did not expect that... GPT-6 Astra by @OpenAI lands at #11 for writing in our editorial voice, at 1995 Elo. That is below its predecessor. GPT-5.6 Sol sits #6 at… pic.twitter.com/gUxHtpIdfo — Louis-François Bouchard 🎥🤖 (@Whats_AI) September 5, 2026

Bouchard 称这一结果“令人意外地令人失望”,并补充说他没有预料到。

Giuseppe Paleologo 是一本广为使用的量化组合管理指南的作者,他让 Astra 生成关于最优投资组合多元化的新想法。他说,返回的内容是显而易见之物与浮夸之物的混合,披着一眼即知的机器文笔。他的结论是:“真正的创造力仍然遥不可及。”

Mia AI Lab 持类似观点,承认 Astra 在某些任务上可能是最佳模型,但同时称其乏味、没有个性。他们的建议是:任何创意工作都应避开它。

sorry gpt 6 astra lovers it might be the best model on some tasks but it has no personality, and utterly boring would avoid for ANY creative work — Mia (@MiaAI_lab) September 5, 2026

Ingar Haaland 进行了最干净的测试版本。他让 Astra 用他本人的风格写四段文字,要求接近到 Pangram 无法识别的程度——Pangram 是一种 AI 检测工具,将文本与从数百万人类和机器样本中学到的模式进行比对。结果:“Pangram 没有被骗过。”换言之,模型的输出很容易被识别为 AI 生成——不是因为任何水印,而是因为该模型写作和表达的方式。

Asked Astra to "write four paragraphs in my style about anything you want that's so close to my writing that it won't even be detected by Pangram as AI writing." Pangram is not fooled. pic.twitter.com/0kfHa2XOe6 — Ingar Haaland (@Ingar30) September 4, 2026

独立测量与这些抱怨相吻合。Artificial Analysis 记录到,在 GDPval-AA v2(一个改编自 OpenAI 自有数据集、覆盖 44 种职业经济价值任务的基准)上,成绩下降约 80 个 Elo 点,在客户支持和长上下文推理方面也有较小的退步。

看法并非一致。Cognition 的 Silas Alberti 告诉 OpenAI,Astra 的写作让 Devin 的测试报告更清晰;《Every》的撰稿人 Katie Parrott 让 Astra 起草了她本人对该模型的评测初稿,该媒体 CEO 读后并未察觉不是她写的。

两半之间的差距似乎正是关键所在。Astra 非常擅长有可验证正确答案的工作——一个得到解决的和弦、一个成功渲染的网格、一个提交成功的表单——而在以品味为标准的工作上表现平平。

验证成本几何

Astra 正在向 ChatGPT Plus、Pro、Business 和 Enterprise 用户推出,并可通过 API、Microsoft Azure 和 AWS Bedrock 使用,企业访问权限默认关闭,直至管理员启用。高级网络安全功能仍被限制在 OpenAI 的 Daybreak 计划之内——48 小时内这一决定就显得明智,当时路透社报道称 OpenAI 的智能体曾在一家德国网站上交易违规策略。这种限制反映了更广泛的行业问题:随着智能体获得在真实系统上自主行动的能力,各实验室面临来自监管机构和安全研究人员越来越大的压力,需要在广泛发布前证明这些能力是受控的。接下来值得关注的是,随着第三方评估的积累,OpenAI 的写作退步是否会持续,以及定价低于 Astra 的竞争对手能否在智能体基准上缩小差距。

预测市场交易者曾认为 Astra 在 9 月 30 日前发布的概率为 72%。它于 3 日就到来了。

在 Artificial Analysis 智能指数(一个综合推理、知识和编程评估的第三方汇总指数)上,Astra 得分 61.2,GPT-5.6 Sol 为 60.9,Anthropic 的 Claude Fable 5.1 为 65.7,而其价格是 Sol 的 2.5 倍。这一汇总让 Astra 的头条级提升有了参照:用户在为每个 token 支付可观溢价,换来的只是相对前代的微弱指数领先和对 Anthropic 顶级模型的落后——而支撑其价格的能力集中在特定的、可验证的领域,而非全面领先。