重磅出刊

GPT-5比其他模型強在哪?怎麼用?

OpenAI終於發佈旗艦模型GPT-5,比過往版本和競爭對手更會考試、寫程式、解決問題。只要給幾句指令,就能幫你做出一個網站和App。具體該怎麼操作?

GPT-GPT-5-OpenAI-ChatGPT 圖片來源:Shutterstock
其他
  • 天下Web only
加入Google偏好來源 在Google搜尋優先看到天下

經歷了兩年的延遲,本週,OpenAI終於發佈旗艦模型GPT-5。

在新聞發表會上,OpenAI執行長奧特曼表示,與GPT-5互動就像「與任何領域的博士級別專家交談」。

怎麼用?

OpenAI特別自豪GPT-5的「氛圍編碼」技能——從此以後,用戶想要做任何應用程式,都可以以簡單的幾句文字指令實現。

(延伸閱讀:「Vibe Coding」是什麼?以後還需要程式設計師嗎?)

負責訓練模型的杜博伊斯(Yann Dubois)要求GPT-5幫忙打造一個法文學習App,並給指令:像坊間的語言學習App一樣具備每日學習進度、抽卡、測驗等功能。

幾分鐘後,AI生成的網站就誕生了,雖然只是一個簡單的展示,卻完全符合杜博伊斯的需求。

「它是一位出色的程式碼幫手,」另一位訓練專家波克拉斯(Michelle Pokrass)指出,GPT-5能夠理解何時、如何使用Web瀏覽器或外部API等功能,遵循指令,並解釋自己的操作。

現在,只要訂閱ChatGPT每月20美元的Plus方案,即可獲得比免費用戶更高的GPT-5使用限制。同時,每月200美元的Pro方案訂閱用戶,將可以無限使用GPT-5,以及名為GPT-5 Pro的增強版。

此外,OpenAI的Team、Edu和Enterprise用戶,將於下週開始將GPT-5作為其預設模型。

值得一提的是,有了GPT-5之後,ChatGPT的使用者體驗獲得升級。用戶現在可以在ChatGPT的設定中選擇4種新的性格:憤世嫉俗者、機器人、傾聽者和書呆子。

這些性格將調整ChatGPT的回應方式,讓用戶無需特別要求模型以某種方式回應。

廣告

OpenAI 也表示,GPT-5 比之前的模型更安全。雖然人工智慧推理模型偶爾會胡言亂語或是發表陰謀論,但GPT-5的欺騙率低於其他模型。

贏過競爭對手

在性能方面,GPT-5於多項測試中展現了它的強大之處。

在公認的程式碼任務測驗SWE-bench Verified中,GPT-5的首次嘗試得分高達74.9%,略勝於Anthropic最新的 Claude Opus 4.1模型(得分為74.5%),和Google DeepMind 的 Gemini 2.5 Pro(得分為59.6%)。

在針對博士級科學問題的測試GPQA Diamond中,GPT-5 pro首次嘗試就獲得89.4%的得分,超過了得分80.9%的Claude Opus 4.1和得分88.9%的Grok 4 Heavy。

OpenAI表示,GPT-5也比以前更適合回答健康相關問題。在HealthBench Hard Hallucinations測試中,GPT-5的幻覺出現率僅為 1.6%,遠好過該公司先前的GPT-4o和o3模型,後兩者的幻覺得分分別為12.9%和15.8%。

最後,在衡量數學、人文和自然科學領域人工智慧模型表現的較高難度測試Humanity’s Last Exam中,GPT-5 Pro在使用工具的情況下得分為42%,比該公司先前其他版本都高。

廣告

不過,GPT-5並非全面勝出,它也在一些領域輸給其他模型,像是在Humanity’s Last Exam得分略低於xAI的Grok 4 Heavy(44.4%),或是在基準測試Tau-bench的一些項目中,表現較為參差不齊,小幅輸給先前的版本o3和Claude Opus 4.1。

前路難行

事實上,OpenAI這家擁有全球7億個人用戶、500多萬企業用戶的AI新創,一直面臨著打造更先進技術的巨大壓力。

在2022年率先推出語言模型之後,已被競爭對手Google DeepMind和Anthropic逐漸趕上。最近,Meta還創建一個超級智慧實驗室,並從OpenAI挖走至少10名研究人員。

OpenAI也好不容易從人事風波走過來,如今為了維持成長,必須與微軟重新談判愈來愈來緊張的合作關係,還要努力獲得國家監管機構批准,以轉型成營利公司。

眾多棘手挑戰顯示,即使GPT-5在各種測試中表現領先,OpenAI的前路仍瀰漫著未知。

(資料來源:WSJ, TechCrunch, WSJ, Wired, The Verge)

廣告
你可能有興趣
最新訊息
中秋限定64折解鎖暢讀天下只到9/30
訂閱天下雜誌電子報

天下雜誌當期內容的精華與延伸,每周三發送最具時效性的深度內容