經歷了兩年的延遲,本週,OpenAI終於發佈旗艦模型GPT-5。
在新聞發表會上,OpenAI執行長奧特曼表示,與GPT-5互動就像「與任何領域的博士級別專家交談」。
怎麼用?
OpenAI特別自豪GPT-5的「氛圍編碼」技能——從此以後,用戶想要做任何應用程式,都可以以簡單的幾句文字指令實現。
(延伸閱讀:「Vibe Coding」是什麼?以後還需要程式設計師嗎?)
負責訓練模型的杜博伊斯(Yann Dubois)要求GPT-5幫忙打造一個法文學習App,並給指令:像坊間的語言學習App一樣具備每日學習進度、抽卡、測驗等功能。
幾分鐘後,AI生成的網站就誕生了,雖然只是一個簡單的展示,卻完全符合杜博伊斯的需求。
「它是一位出色的程式碼幫手,」另一位訓練專家波克拉斯(Michelle Pokrass)指出,GPT-5能夠理解何時、如何使用Web瀏覽器或外部API等功能,遵循指令,並解釋自己的操作。
現在,只要訂閱ChatGPT每月20美元的Plus方案,即可獲得比免費用戶更高的GPT-5使用限制。同時,每月200美元的Pro方案訂閱用戶,將可以無限使用GPT-5,以及名為GPT-5 Pro的增強版。
此外,OpenAI的Team、Edu和Enterprise用戶,將於下週開始將GPT-5作為其預設模型。
值得一提的是,有了GPT-5之後,ChatGPT的使用者體驗獲得升級。用戶現在可以在ChatGPT的設定中選擇4種新的性格:憤世嫉俗者、機器人、傾聽者和書呆子。
這些性格將調整ChatGPT的回應方式,讓用戶無需特別要求模型以某種方式回應。
OpenAI 也表示,GPT-5 比之前的模型更安全。雖然人工智慧推理模型偶爾會胡言亂語或是發表陰謀論,但GPT-5的欺騙率低於其他模型。
贏過競爭對手
在性能方面,GPT-5於多項測試中展現了它的強大之處。
在公認的程式碼任務測驗SWE-bench Verified中,GPT-5的首次嘗試得分高達74.9%,略勝於Anthropic最新的 Claude Opus 4.1模型(得分為74.5%),和Google DeepMind 的 Gemini 2.5 Pro(得分為59.6%)。
在針對博士級科學問題的測試GPQA Diamond中,GPT-5 pro首次嘗試就獲得89.4%的得分,超過了得分80.9%的Claude Opus 4.1和得分88.9%的Grok 4 Heavy。
OpenAI表示,GPT-5也比以前更適合回答健康相關問題。在HealthBench Hard Hallucinations測試中,GPT-5的幻覺出現率僅為 1.6%,遠好過該公司先前的GPT-4o和o3模型,後兩者的幻覺得分分別為12.9%和15.8%。
最後,在衡量數學、人文和自然科學領域人工智慧模型表現的較高難度測試Humanity’s Last Exam中,GPT-5 Pro在使用工具的情況下得分為42%,比該公司先前其他版本都高。
不過,GPT-5並非全面勝出,它也在一些領域輸給其他模型,像是在Humanity’s Last Exam得分略低於xAI的Grok 4 Heavy(44.4%),或是在基準測試Tau-bench的一些項目中,表現較為參差不齊,小幅輸給先前的版本o3和Claude Opus 4.1。
前路難行
事實上,OpenAI這家擁有全球7億個人用戶、500多萬企業用戶的AI新創,一直面臨著打造更先進技術的巨大壓力。
在2022年率先推出語言模型之後,已被競爭對手Google DeepMind和Anthropic逐漸趕上。最近,Meta還創建一個超級智慧實驗室,並從OpenAI挖走至少10名研究人員。
OpenAI也好不容易從人事風波走過來,如今為了維持成長,必須與微軟重新談判愈來愈來緊張的合作關係,還要努力獲得國家監管機構批准,以轉型成營利公司。
眾多棘手挑戰顯示,即使GPT-5在各種測試中表現領先,OpenAI的前路仍瀰漫著未知。
(資料來源:WSJ, TechCrunch, WSJ, Wired, The Verge)
天下總主筆陳良榕專欄。半導體狂熱、科技巨頭謀略的最犀利解讀
看懂科技大勢,獨家解讀
請查看您的信箱,我們將寄送驗證信給您,確保未來信件會送到您的信箱