新聞宏觀經濟OpenAI 的 GPT-6 Astra 在幾乎所有方面都好得驚人——除了寫作

OpenAI 的 GPT-6 Astra 在幾乎所有方面都好得驚人——除了寫作

作者: Decrypt·

重點速覽

  • OpenAI 於 9 月 3 日推出 GPT-6 Astra,定價為每百萬輸入 token 10 美元、每百萬輸出 token 50 美元,是 GPT-5.6 Sol 成本的 2.5 倍。
  • 該模型在 OSWorld 2.0 電腦操作基準上獲得 72.6%,每項任務約 40 分鐘,Sol 則為 65.7%、需 75 分鐘。
  • 早期測試者展示了強大的空間與程式設計能力,包括在 Unreal Engine 中重現曼哈頓,以及一天內打造出完整的多人瀏覽器射擊遊戲。
  • 寫作品質退步:Astra 在 Louis-François Bouchard 的編輯風格基準上以 1995 Elo 名列第 11,低於 Sol 的第 6 名 2156 分,且據 Artificial Analysis,在 GDPval-AA v2 上流失約 80 個 Elo 分。
  • 在 Artificial Analysis 智慧指數上,Astra 得分 61.2,略高於 Sol 的 60.9,但低於 Anthropic 的 Claude Fable 5.1 的 65.7,且價格更高。
OpenAI 的 GPT-6 Astra 在幾乎所有方面都好得驚人——除了寫作

OpenAI 於 9 月 3 日發布 GPT-6 Astra,定價為每百萬輸入 token 10 美元、每百萬輸出 token 50 美元——據 Artificial Analysis,是其前身 GPT-5.6 Sol 成本的 2.5 倍。(token 約為一個字的四分之三,是 AI 公司計費的單位。)這一溢價出現在尖端模型市場不再一家獨大的時刻:Anthropic 的 Claude 系列已占據開發者族群,Google 的 Gemini 則在多模態上持續推進,因此每次發布都會在數小時內被公開檢視。48 小時內,取得早期存取權的開發者已將這次發布變成一場公開壓力測試,而他們發布的內容呈現一條清晰的分界線:Astra 是任何人用過在空間、機械或代理式任務上最強的模型——但根據其中數位人士的說法,它的寫作能力比前身更差。OpenAI 總裁 Greg Brockman 在發布簡報中宣布 AGI 已經到來。

主打功能是電腦操作(computer use):模型直接在真實桌面上控制滑鼠與鍵盤,而不是回傳一堆要你照做的指令。Anthropic 是第一個推出此能力的大型實驗室,Claude 的電腦操作於 2024 年底上線,但普及受制於可靠性——點錯地方或中途卡住的代理程式是常態,這也是 OpenAI 的速度與成功率數據備受關注的原因。在 OSWorld 2.0(一項評分代理程式能獨立完成多少日常桌面工作的測試)上,OpenAI 報告 Astra 達 72.6%,每項任務約 40 分鐘,而 Sol 為 65.7%、需 75 分鐘。它也是 OpenAI 有史以來第一個被評為達到網路安全關鍵門檻的模型,意即它能在沒有人先指出漏洞的情況下,發現未知的軟體缺陷並建立可行的攻擊。

在基準測試之外,分享實際使用案例的愛好者或許是判斷 GPT-6 哪裡是金、哪裡不是的最佳方式。以下是一些最有趣的成果。

視覺理解:逐街建造的曼哈頓

事實證明,Astra 在視覺理解與空間感知方面極為出色。投資人、HyperWrite 前執行長 Matt Shumer 給了 Astra 一週時間在 Unreal Engine(《要塞英雄》背後的遊戲引擎)中作業。在這段時間裡,Astra 生成了一個曼哈頓的複製品。他發布了一段飛行瀏覽影片,並表示該模型「逐街建造,讓每一條街都完美」。

GPT-6 Astra built this Manhattan world in Unreal Engine over the course of a week. It was literally able to go street by street to make each one perfect. pic.twitter.com/7VTol9QfHq — Matt Shumer (@mattshumer_) September 3, 2026

他的另一個實驗更令人震撼。Shumer 要求 Astra 建造一個生存世界,並在其中放入各自運行一份模型副本的角色,然後讓它整夜運行。一天後,他聽到客廳傳來人聲,以為有人闖入他的公寓,結果發現「它們開始彼此交談了」。

Max Weinbach 將 Apple Park 的照片輸入模型,要求在 Blender(動畫師與遊戲美術師使用的免費 3D 建模軟體)中重建。他的評價是:「它做得誇張地好。」

I had early access to GPT-6 Astra and it's maybe the most insane model I've experienced In Blender, I had it recreate Apple Park from just images. It did an absurd job. pic.twitter.com/0vDgg4u1DQ — Max Weinbach (@mweinbach) September 3, 2026

Tom Krcha 只給 Astra 一張房屋圖片,就取回了以 60 幀每秒運行的可編輯幾何完整室內空間,連家電和玩具都一應俱全。他主張「現在世界上每個人的指尖上都有一位 3D 設計師」。

Pietro Schirano 把整個工作流程簡化為一個手勢。在地圖上放一根圖釘,要求以 3D 呈現周邊區域,用他的話說,「它就是會做到」。

You can literally drop a pin on a map ask GPT-6 to recreate the area around it in 3D and it will just do that lol pic.twitter.com/0PBTpV9kpF — Pietro Schirano (@skirano) September 4, 2026

一位名為 SuSu 的開發者將同樣的想法擴大到城市規模。Astra 用 Three.js(一種能在一般網頁瀏覽器中渲染 3D 圖形、無需下載的 JavaScript 函式庫)在 24 分鐘內重建了杭州及周邊城鎮,西湖、雷峰塔、茶園梯田與濕地全都到位。該貼文以中文形容這是一個真正可互動的「迷你杭州」,而非靜態圖片,還有可點擊的地標與日夜切換功能。

🔥絕了!GPT-6 Astra在24分钟内用Three.js把整座杭州搬进网页,能逛能飞能切换昼夜! 刚上线的GPT-6 Astra,直接用Three.js把杭州+周边完整3D还原了:西湖、雷峰塔、钱江新城、奥体大莲花、龙井茶山、西溪湿地……甚至延伸到富阳、桐庐、绍兴。… pic.twitter.com/eC1dZDsVI0 — SuSu_酥酥👅 (@NFT_Chen) September 5, 2026

程式設計:人們真的在玩的遊戲

遊戲是目前最受歡迎的使用案例,也是 GPT-6 Astra 大放異彩之處。Anshu Chimala——Apple 前 UX/UI 設計師與 AI 開發者——只花 45 分鐘就一次性產出一款 3D 遊戲,據他所說只用了配額的區區幾個百分比。他稱 Astra 為「某種 3D 遊戲的渦輪 AGI 機械之神」。該遊戲無法供測試,但影片顯示等距視角風格、設計良好的角色與環境,整體美學不錯。

他的方法比形容詞更重要。他將模型連接到 Blender,讓它為目標外觀自行生成概念圖,然後要求它持續迭代,直到遊戲內截圖在 60fps 下符合該參考。Astra 為每個素材建模並自行生成材質貼圖。該模型無法獨自設計 AAA 級圖形,但搭配合適工具,它能開發出設計精美的環境。

Coinbase 與 Eleven Labs 前開發者 Rishi Prasad 在一天內打造出 Astral War:一款具備權威式多人伺服器、12 人大廳、控制器支援與語音聊天的瀏覽器射擊遊戲。相較於一個月前用 Claude Opus 5 打造的版本,他形容視覺保真度出現「巨大的階躍式飛躍」。

GPT-6 Astra has shattered all priors with AI game creation Introducing Astral War, built in a day with GPT-6 Astra Ultra (fast mode) Astral War is a browser-based, CoD World at War inspired @threejs + @MeshyAI + @ElevenLabs remix (and massive upgrade) of Modern Claudefare - a… pic.twitter.com/n9kTaDh4Wx — Rishi (@0xRishi) September 5, 2026

其他人則完全跳過設計步驟。匿名 AI 開發者 Daniel 給 Astra 看一支手機遊戲廣告,要求它做出廣告中內容的可玩瀏覽器版本。不到 30 分鐘,他回報成果「相當接近」。從影片來看,該模型理解了遊戲的邏輯與視覺並成功重現。

電腦操作與插畫:用滑鼠作畫

一位名為 Taiyaki Sun 的日本插畫家進行了這批測試中最字面意義的電腦操作測試。他們不是要求生成一張圖片,而是交給 Astra 一份手繪線稿檔案,要求它像人類上色師一樣,用滑鼠在 Clip Studio Paint 中為畫作上色。

GPT-6 Astraのお絵描き能力すごい!!! 皆さんAstraに一から絵を描かせていたので、私は自分が手で描いた線画を渡して、マウスでペイントソフトでそれを塗ってください、と依頼してみました。うおおおこれがAI分業だあああああ このタイムラプス、すべてAstraが動かしてます。… pic.twitter.com/hZk30pBgCq — taiyakisun(たい焼き太陽)🥐 (@taiyaki_sun) September 5, 2026

Astra 建立圖層、縮放畫面、選擇筆刷並填色。這位藝術家在一篇譯自日文的貼文中說,自己全程只是在旁觀看。該次作業在 100 美元的 Pro 方案上以最大強度運行,消耗了 21% 的配額。其他用戶也陸續分享有趣的影片,展示 Astra 能透過電腦操作(以視覺方式接管你的電腦,而非使用 MCP 伺服器或 API 金鑰)完全用小畫家重現他們的照片。

音樂:巴哈測試

GPT-6 Astra 的音樂品味也不錯——至少對一個 LLM 而言。經營「Augmented Fifth」Substack 的 Auggie 維護一項非正式基準:固定的提示詞,要求模型用 LilyPond(一種可編譯成樂譜的文字格式)以 G 小調、3/4 拍寫一首巴哈風格的四聲部聖詠。結果以音樂院學生被評分的同一套和聲規則來評分。這類質性基準難以標準化,因為品質、美感等是主觀的——但身為人類,我們有能力分辨這些特質。

Astra 寫下該測試有史以來最佳成績。零聲部進行錯誤,意即沒有任何旋律線以巴哈規則禁止的方式相互衝突,和聲中還出現了拿坡里六和弦——一種出現在莫札特與貝多芬作品中的半音和弦。Auggie 特別指出它是「這個基準上第一個寫出經過音的模型」。

GPT-6 Astra has the best result yet on the Bach Benchmark. Its chorale contains no voice-leading errors, and its harmonic palette is sophisticated enough to include a Neapolitan sixth chord. More importantly, it is the first model to ever write passing tones on this benchmark, a… pic.twitter.com/UMXSbveR0C — Auggie (@aug5thmusic) September 5, 2026

OpenAI 自己的數據表也指向同樣方向。在評分模型讀取與轉錄古典樂譜準確度的 OpenScore String Quartets 上,Astra 達到 0.84,Sol 則為 0.19。

醫師兼多產 AI 測試者 Derya Unutmaz 要求打造一台可完整演奏的虛擬鋼琴,並內建巴哈全部六首《布蘭登堡協奏曲》。他寫道:「這個瘋狂的模型在約 11 分鐘內完成了整件事。」

Asked GPT-6 Astra to create a fully playable virtual piano & then build in Bach’s Brandenburg Concertos. This insane model did the whole thing in ~11 minutes! All 6 Concertos are built in & can be played directly on the piano! Link to the piano: 🎹✨ .… pic.twitter.com/DBwXF3uA8O — Derya Unutmaz, MD (@DeryaTR_) September 5, 2026

必須強調,GPT-6 Astra 是一個 LLM,而非音訊/音樂模型。它對音樂的理解很可能來自記譜與文字資料,而非訓練資料集中聲音與音樂的關聯,因此這些成果對一個文字模型而言非常驚豔,但若出自 Suno 這類專門 AI,就只能算差強人意。

寫作:垮掉的地方

一如往常,OpenAI 的模型擅長程式設計但寫作薄弱——至少在沒有大量提示、上下文與引導的情況下。平心而論,寫作不是 OpenAI 的強項,也不是其重心。

Louis-François Bouchard 經營一項內部基準,評分模型以其團隊編輯風格寫作的能力,採用 Elo 排名——一種依頭對頭勝負為參賽者評分的西洋棋評分制度;Elo 計分沒有上限,分數越高模型越好。Astra 以 1995 分名列第 11。其前身以 2156 分位居第 6。Astra 每份腳本成本約 0.26 美元,約為 Sol 的 1.8 倍。

Big news from our internal writing benchmark (early results): GPT-6 ... is surprisingly disappointing I definitely did not expect that... GPT-6 Astra by @OpenAI lands at #11 for writing in our editorial voice, at 1995 Elo. That is below its predecessor. GPT-5.6 Sol sits #6 at… pic.twitter.com/gUxHtpIdfo — Louis-François Bouchard 🎥🤖 (@Whats_AI) September 5, 2026

Bouchard 稱結果「令人意外地令人失望」,並補充他完全沒預料到。

廣泛使用的量化投資組合管理指南作者 Giuseppe Paleologo 要求 Astra 就最佳投資組合分散提出新穎想法。他表示,回傳的內容是老生常談與浮誇的混合,包裝在一眼即知是機器撰寫的文體中。他的結論是:「真正的創造力仍然非常、非常遙遠。」

Mia AI Lab 持類似看法,承認 Astra 在某些任務上可能是最佳模型,但稱其無聊、沒有個性。他們的建議是任何創意工作都避用它。

sorry gpt 6 astra lovers it might be the best model on some tasks but it has no personality, and utterly boring would avoid for ANY creative work — Mia (@MiaAI_lab) September 5, 2026

Ingar Haaland 進行了最乾淨的版本測試。他要求 Astra 用他自己的風格寫四段文字,接近到 Pangram 不會抓到——Pangram 是一種 AI 偵測工具,將文字與從數百萬人類與機器樣本學到的模式比對。結果:「Pangram 沒有被騙到。」換言之,模型的輸出很容易被識別為 AI 生成——不是因為任何浮水印,而是因為模型書寫與表達的方式。

Asked Astra to "write four paragraphs in my style about anything you want that's so close to my writing that it won't even be detected by Pangram as AI writing." Pangram is not fooled. pic.twitter.com/0kfHa2XOe6 — Ingar Haaland (@Ingar30) September 4, 2026

獨立測量與這些抱怨相符。Artificial Analysis 記錄到 GDPval-AA v2 上約 80 個 Elo 分的下滑——該基準改編自 OpenAI 自家資料集,涵蓋 44 種職業的經濟價值任務——此外在客服與長上下文推理方面也有較小的退步。

意見並不一致。Cognition 的 Silas Alberti 告訴 OpenAI,Astra 的寫作讓 Devin 的測試報告更清晰;Every 的特約撰稿人 Katie Parrott 則讓 Astra 為它自己的評測撰寫初稿,該媒體的執行長讀完也沒察覺不是她寫的。

這兩半之間的落差似乎正是重點。Astra 非常擅長有可驗證正確答案的工作——一個能解決的和弦、一個能渲染的網格、一份能送出的表單——而在以品味為標準的工作上則平庸。

要花多少代價才能知道

Astra 正向 ChatGPT Plus、Pro、Business 與 Enterprise 用戶推出,並透過 API、Microsoft Azure 與 AWS Bedrock 提供,企業存取在管理員啟用前保持關閉。進階網路安全功能則被限制在 OpenAI 的 Daybreak 計畫之後——在路透社報導 OpenAI 代理程式在一個德國網站上交易違規策略後不到 48 小時,這個決定顯得相當明智。這種門檻管控反映更廣泛的產業問題:隨著代理程式獲得在真實系統上自主行動的能力,實驗室面臨監管機構與安全研究人員與日俱增的壓力,須在廣泛發布前證明這些能力受到控制。值得關注的下一步是:OpenAI 的寫作退步是否會隨第三方評測累積而持續,以及定價低於 Astra 的競爭對手能否在代理式基準上縮小差距。

預測市場交易者原先給予 Astra 在 9 月 30 日前推出的機率為 72%。它在 3 日就上線了。

在 Artificial Analysis 智慧指數(一項整合推理、知識與程式設計評測的第三方綜合指標)上,Astra 得分 61.2,GPT-5.6 Sol 為 60.9,Anthropic 的 Claude Fable 5.1 為 65.7——而 Astra 的價格是 Sol 的 2.5 倍。這項綜合指數為 Astra 的亮眼數據提供了透視:用戶正為每個 token 支付可觀溢價,換到的只是相對前身的微幅指數領先,以及相對 Anthropic 頂級模型的落後——而支撐這個價格的能力存在於特定、可驗證的領域,而非全面性的領先。