- 天下Web only
OpenAI推出GPT-5.2,號稱專為開發者和專業日常工作設計。
GPT-5.2將提供給ChatGPT付費用戶與API開發者,分為三種版本:
Instant:速度最佳化的模型,適合查詢資訊、寫作、翻譯等日常任務
Thinking:擅長複雜的結構化工作,如寫程式、長文分析、數學、做計畫
Pro:最高階版本,追求困難問題的極致準確性與可靠性
OpenAI產品長西摩(Fidji Simo)在記者會表示,「我們設計5.2的目標,是為人們創造更大的經濟價值。它在製作試算表、建立簡報、寫程式、辨識影像、理解長文脈絡、使用工具與處理複雜多步驟專案等方面,都更為出色。」
ChatGPT正在與Google Gemini 3進行激烈競爭。Gemini 3在LMArena大多數基準測試中名列前茅,除了寫程式碼的能力仍然落後Anthropic Claude Opus-4.5。
本月稍早,《The Information》報導OpenAI執行長奧特曼(Sam Altman)在公司內發布「紅色警戒」(code red)備忘錄,原因包括ChatGPT流量下滑、消費者市占疑似流向 Google。這份備忘錄要求公司調整優先事項,包括暫緩廣告上線等承諾,專心提升ChatGPT使用體驗。
GPT-5.2是OpenAI試圖重新奪回領導地位的一步棋。儘管有員工希望延後發布以爭取更長調校、改進時間,OpenAI仍選擇迅速推出GPT-5.2。外界可能以為OpenAI將更專注改善消費者的個人化體驗,不過這次發布主要是強化企業端的佈局。
OpenAI明確鎖定開發者和工具生態系,希望成為建構AI應用程式的預設基礎平台。本週稍早OpenAI公布的數據顯示,企業端AI工具使用量在過去一年大幅成長。
Google近期也在迅速把Gemini 3深度整合到旗下產品與雲端生態裡,包括多模態與代理式(agentic)工作流程。本週Google推出托管式 MCP伺服器,使代理更容易連接Google地圖、BigQuery等工具。(MCP是連接AI系統與外部數據和工具的連接器。)
OpenAI宣稱,GPT-5.2在以下領域刷新基準成績:寫程式碼、數學、科學、視覺、長上下文推理、工具使用等等,因此能促成「更可靠的代理式工作流程、可部署到生產環境等級的程式碼、能處理大規模真實世界資料的複雜系統」。
這讓GPT-5.2足以和Gemini 3的Deep Think模式直接競爭。Gemini 3以在數學、邏輯與科學推理方面的大幅進步備受稱讚。
在OpenAI的基準測試圖表中,GPT-5.2 Thinking幾乎在所有列出的推理測試中都小幅勝過Gemini 3與Anthropic的Claude Opus 4.5,從真實世界軟體工程任務(SWE-Bench Pro)、博士級科學知識(GPQA Diamond)到抽象推理與模式發現(ARC-AGI 套件)都略勝一籌。
研究主管克拉克( Aidan Clark)解釋,高數學分數不只是解決算式的能力,更要能處理多步驟邏輯、在長時間保持數字一致性、避免逐步累積的微小錯誤,「這些能力對財務模型、預測、資料分析等各種不同工作任務都非常重要。」
在簡報中,OpenAI產品主管施瓦澤(Max Schwarzer)表示,GPT-5.2 在「程式碼生成與除錯方面有大幅進步」,還能逐步講解複雜的數學與邏輯推理,像Windsurf、CharlieCode等程式開發新創都說GPT-5.2的「代理程式表現達到業界最先進水準」,複雜的多步驟工作流程方面也有進步。
在非程式任務方面,GPT-5.2 Thinking的回答錯誤率比前一代低38%,使這套模型在日常決策、研究與寫作上更可靠。
GPT-5.2看起來不是重做,更像是把GPT-5和GPT-5.1的進步整合成更成熟的系統。8月推出的GPT-5建立統一架構,加入路由器,可在快速與深度推理模式間切換。11月的GPT-5.1主要是讓系統更溫暖、更像對話,也更適合代理和程式任務。GPT-5.2像是在這些進步基礎上加強火力,成為更適合生產環境使用、更可靠的底層模型。
對OpenAI來說,風險從未如此巨大。OpenAI已承諾未來幾年投入1.4兆美元建構AI基礎設施,以支撐成長。這些承諾是在OpenAI仍具備明顯領先優勢時做出的,現在Google後來居上,這筆龐大押注可能正是奧特曼發布「紅色警戒」的主因。
OpenAI重新聚焦在推理模型,也是很冒險的一步棋。Thinking模式和Deep Research模式背後的系統非常吃運算資源,比一般標準的聊天模型昂貴很多。加碼押注這個模型可能讓OpenAI落入一個惡性循環,那就是為了稱霸排行榜花更多錢買算力,然後為了維持超高成本模型大規模運作,再花更多錢。
據報導,OpenAI現在花在運算上的支出已經高於先前對外透露的水準。OpenAI多數的推論成本,也就是執行已訓練AI模型所需的運算支出,現在大多以現金支付,而不是依靠雲端服務提供的點數補貼,代表OpenAI的運算成本已高到超過合作方案和雲端點數所能吸收的範圍。
西摩在簡報表示,隨著OpenAI規模變大,能推出更多產品與服務,進一步支應增加的運算成本。
她說,「重要的是從效率角度看待這一切。跟一年前相比,你現在花同樣的算力與成本,能換到更多的智慧。」
這個新模型主要聚焦推理能力,而新影像模型明顯缺席。據說奧特曼在紅色警戒備忘錄指出,影像生成會是接下來的重要優先事項,特別是Google的Nano Banana(Gemini 2.5 Flash Image)於8月爆紅之後。
專家:OpenAI的優勢岌岌可危
對許多產業專家而言,真正的重點是OpenAI所謂的「基礎模型」與其他競爭者之間的技術差距,已經幾乎不存在,同時OpenAI燒錢速度與收入之間的巨大落差,也叫人難以忽視。
奧特曼先前表示,到2025年底,公司預估月營收換算成年收入將達200億美元。但這距離真正賺錢還很遙遠。未來幾年,公司計畫投入1.4 兆美元建置、運行AI技術所需的龐大運算資源。
OpenAI於2022年底推出ChatGPT,引爆全球AI浪潮,當時對手遠遠落後,OpenAI的領先維持了兩年多。但過去 12 個月,美國與中國的多家企業陸續推出能力媲美甚至超越OpenAI的模型。
追踪AI技術的公司Vals AI執行長克利許南(Rayan Krishnan)說,「打造基礎模型所需的核心方法已被全面掌握,而且各大AI實驗室的做法幾乎一樣。」
Google上次推出新模型後一週,舊金山新創公司Anthropic也發表Claude Opus 4.5,表現與OpenAI同等水準。紐約新創公司Runway不久前也公布一款新模型,在業界標準測試中表現超越OpenAI的影片生成模型Sora。
正因如此,奧特曼才發布紅色警戒,目標是守住OpenAI最關鍵的業務。
研究公司Similarweb資料顯示,每週有超過8億使用者使用ChatGPT,市占率達76%。克利許南說,「消費者用的AI就是OpenAI。如果這個優勢不見,公司價值就會大打折扣。」
(資料來源:TechCrunch、NYTimes)
天下總主筆陳良榕專欄。半導體狂熱、科技巨頭謀略的最犀利解讀
看懂科技大勢,獨家解讀
請查看您的信箱,我們將寄送驗證信給您,確保未來信件會送到您的信箱